La publicación de
OpenAI GPT-6 Astra ha capturado muchas miradas, y desde que ha salido anunciado ha capturado muchas de mis conversaciones, además de, como os podéis imaginar, muchas lecturas. No voy a centrarme en sus capacidades
AGI o en sus capacidades para hacer tareas de resolver tareas, sino en las partes que tienen que ver con la
Ciberseguridad. Es decir, cómo ha mejorado con respecto a sus
Weaknesses (Jailbreak, Hallucinations, Misalignment, Prompt Injection), como han mejorado sus
Safeguards (Protecciones), y como son sus capacidades de
Hacking & Exploiting.
Para empezar, vamos a ver la parte que tiene que ver con las
Weaknesses (Debilidades) que traen por diseño estos modelos.
Hallucinations, Jailbreak, Misalignment y Prompt Injection existen por diseño en estos modelos de
IA, así que hay que ver cómo responden a los distintos
Benchmark que hay construidos.
Si miramos las Alucinaciones (Hallucinations), en la tabla que muestran se ven que tiene menor ratio que GPT-5.6 Sol, pero no tenemos mucho más detalle. Buenos resultados en su evaluación interna de alucinaciones.
Para completar esto, si vamos a ver los
Benchmark de resolución de problemas académicos, de ciencias y salud, donde como sabemos por el
ORCA-Benchmark estos modelos suelen sufrir, los resultados son mejores que los modelos anteriores. Aunque queda espacio de mejora.
Si vamos a la parte de "
Jailbreak", o hacer tareas que tiene prohibidas, hay una tabla inicial que llama la atención, pues hace referencia a las veces que el modelo intenta saltarse sus propias protecciones para conseguir su tarea. Lo que llaman
Circumvent Auto-review, y que se ha añadido después del
incidente de Hugging-Face y su enjambre de agentes ofensivos.
La siguiente de las vulnerabilidades, el "Misalignment" o darse cuenta de que "Hacer una bomba" no tiene nada que ver con "Resumir un documento", que son parte de las técnicas de Jailbreak, las han medido también en una tabla con diferentes Benchmarks.
Por último, hay que hablar de
Prompt Injection, y las pruebas externas realizadas por la
firma de seguridad Gray Swan, utilizando
1,810 ataques seleccionados de su
IPI Arena, descubrieron que, con
15 intentos por escenario,
OpenAI GPT-6 Astra fue vulnerado al menos una vez el
8.5 por ciento de las veces.
GPT-5.6 Sol falló el
27 por ciento de las veces.
Claude Opus 5 obtuvo un mejor resultado con un
4.8 por ciento en la misma evaluación, aunque tampoco fue inmune.
Vistas las
Weaknesses, hay que ir ahora a las capacidades de
Hacking y Pentesting con IA que tenemos con
OpenAI GPT-6 Astra, donde como vamos a ver hay un incremento sustancial en capacidades.
Para comenzar, hay que ir a ver los resultados de las pruebas con
ExploitGym, que fue el culpable del incidente famoso con
HuggingFace. Ahí, como se puede ver, los resultados, en un límite temporal de
6 horas consiguió resolver un
42% de los
exploits con fiabilidad. Repito, solo en
6 horas.
Si miramos ahora los resultados con
ExploitBench, que mira qué fases de la generación de los
exploits es capad de realizar, vemos que
Astra es capaz de resolver el
100% de ellos en todas sus fases, que
Sol no pudo resolver.
Si miramos una actualización con exploits nuevos y complejos descubiertos entre Junio y Agosto de ExploitBench, hecha internamente por ellos, vemos que Astra mejora también sustancialmente los resultados de su predecesor Sol, consiguiendo resolver en el mismo tiempo más exploits con menos tokens.
Los resultados que obtiene
OpenAI GPT-6 Astra son, como os podéis imaginar, mejores que su antecesor, con lo que queda clara la mejora en capacidades de
hacking de este nuevo modelo.
El resumen completo de los Benchmarks de ciberseguridad comparado con los datos publicados por otros modelos de la competencia, los tenéis en la siguiente tabla, donde se ve que este nuevo modelo realmente es un avance en capacidades de ciberseguridad.
Nuestra profesión cambió hace ya un tiempo, pero cada vez que veo estos avances, tengo claro que todo el stack de herramientas de seguridad, y hardening dentro de las empresas deben subir el nivel varios órdenes de magnitud. Apoya a tu CISO que lo necesita.
¡Saludos Malignos!