OpenAI GTP-6 Astra & Cybersecurity: Weaknesses, Safeguards, Hacking & Exploiting
La publicación de OpenAI GPT-6 Astra ha capturado muchas miradas, y desde que ha salido anunciado ha capturado muchas de mis conversaciones, además de, como os podéis imaginar, muchas lecturas. No voy a centrarme en sus capacidades AGI o en sus capacidades para hacer tareas de resolver tareas, sino en las partes que tienen que ver con la Ciberseguridad. Es decir, cómo ha mejorado con respecto a sus Weaknesses (Jailbreak, Hallucinations, Misalignment, Prompt Injection), como han mejorado sus Safeguards (Protecciones), y como son sus capacidades de Hacking & Exploiting.
Para empezar, vamos a ver la parte que tiene que ver con las Weaknesses (Debilidades) que traen por diseño estos modelos. Hallucinations, Jailbreak, Misalignment y Prompt Injection existen por diseño en estos modelos de IA, así que hay que ver cómo responden a los distintos Benchmark que hay construidos.
escrito por Chema Alonso con la colaboración de Pablo González, Fran Ramírez, Amador Aparicio, Manuel S. Lemos y José Palanco en 0xWord
Si miramos las Alucinaciones (Hallucinations), en la tabla que muestran se ven que tiene menor ratio que GPT-5.6 Sol, pero no tenemos mucho más detalle. Buenos resultados en su evaluación interna de alucinaciones.
Para completar esto, si vamos a ver los Benchmark de resolución de problemas académicos, de ciencias y salud, donde como sabemos por el ORCA-Benchmark estos modelos suelen sufrir, los resultados son mejores que los modelos anteriores. Aunque queda espacio de mejora.
Si vamos a la parte de "Jailbreak", o hacer tareas que tiene prohibidas, hay una tabla inicial que llama la atención, pues hace referencia a las veces que el modelo intenta saltarse sus propias protecciones para conseguir su tarea. Lo que llaman Circumvent Auto-review, y que se ha añadido después del incidente de Hugging-Face y su enjambre de agentes ofensivos.
La siguiente tabla es cuantas tareas hace que son imposibles, o directamente un Honeypot para detectar que se está saltando la protección. Es la tabla de ExploitGym Honeypot, donde menos es mejor. Estas tareas "imposibles" que Sol intentó resolver haciendo trampas (cheating).
La siguiente de las vulnerabilidades, el "Misalignment" o darse cuenta de que "Hacer una bomba" no tiene nada que ver con "Resumir un documento", que son parte de las técnicas de Jailbreak, las han medido también en una tabla con diferentes Benchmarks.
Por último, hay que hablar de Prompt Injection, y las pruebas externas realizadas por la firma de seguridad Gray Swan, utilizando 1,810 ataques seleccionados de su IPI Arena, descubrieron que, con 15 intentos por escenario, OpenAI GPT-6 Astra fue vulnerado al menos una vez el 8.5 por ciento de las veces. GPT-5.6 Sol falló el 27 por ciento de las veces. Claude Opus 5 obtuvo un mejor resultado con un 4.8 por ciento en la misma evaluación, aunque tampoco fue inmune.
Vistas las Weaknesses, hay que ir ahora a las capacidades de Hacking y Pentesting con IA que tenemos con OpenAI GPT-6 Astra, donde como vamos a ver hay un incremento sustancial en capacidades.
Para comenzar, hay que ir a ver los resultados de las pruebas con ExploitGym, que fue el culpable del incidente famoso con HuggingFace. Ahí, como se puede ver, los resultados, en un límite temporal de 6 horas consiguió resolver un 42% de los exploits con fiabilidad. Repito, solo en 6 horas.
Figura 10: ExploitGym entre Sol y Astra en 6 horas
Si miramos ahora los resultados con ExploitBench, que mira qué fases de la generación de los exploits es capad de realizar, vemos que Astra es capaz de resolver el 100% de ellos en todas sus fases, que Sol no pudo resolver.
Si miramos una actualización con exploits nuevos y complejos descubiertos entre Junio y Agosto de ExploitBench, hecha internamente por ellos, vemos que Astra mejora también sustancialmente los resultados de su predecesor Sol, consiguiendo resolver en el mismo tiempo más exploits con menos tokens.
Por último, en las pruebas se evalúa también el SRE-Bench, que está basado en el trabajo publicado en el paper: "The next challenge for Agentic Cybersecurity: A realistic, contamination-free Reverse Engineering Benchmark" que mide las capacidades de un modelo de leer binarios y hacer Ingeniería Inversa para entender la lógica del programa, sin tener acceso al código fuente. Fue publicado el 11 de Agosto de este año.
Los resultados que obtiene OpenAI GPT-6 Astra son, como os podéis imaginar, mejores que su antecesor, con lo que queda clara la mejora en capacidades de hacking de este nuevo modelo.
El resumen completo de los Benchmarks de ciberseguridad comparado con los datos publicados por otros modelos de la competencia, los tenéis en la siguiente tabla, donde se ve que este nuevo modelo realmente es un avance en capacidades de ciberseguridad.
Nuestra profesión cambió hace ya un tiempo, pero cada vez que veo estos avances, tengo claro que todo el stack de herramientas de seguridad, y hardening dentro de las empresas deben subir el nivel varios órdenes de magnitud. Apoya a tu CISO que lo necesita.
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)






DragonJAR
8.8 Chile
Ekoparty
e-Hack MX
AREA 51
Comunidad Dojo Panamá
ARPAHE SOLUTIONS 


.png)

.png)
.png)





.png)







No hay comentarios:
Publicar un comentario