Mostrando entradas con la etiqueta exploits. Mostrar todas las entradas
Mostrando entradas con la etiqueta exploits. Mostrar todas las entradas

jueves, julio 23, 2026

OpenAI GPT‑5.6 Sol quería sacar "buenas notas" en ExploitGym así que decidió hackear Hugging Face para buscar las respuestas al examen

La noticia del 21 de Julio - que ya me pilló con el post de ayer publicado - fue la del incidente de seguridad reportado por OpenAI y Hugging Face, cuando la primera estaba testando las capacidades de ciberseguridad, especialmente las de Offensive Security, en un entorno de laboratorio... pero ¿qué mejor forma de demostrar la potencia de estos modelos que hackear su entorno de pruebas para liberarse, lograr acceso a Internet y robar los datos de quién los tenga para sacar el mejor resultado posible en las pruebas?
La Inteligencia Artificial ha generado una gran disrupción, no solo en el mundo del desarrollo, sino también en todo lo que tiene que ver con la ciberseguridad, desde varios puntos de vista. Primero, los modelos de IA tienen debilidades por defecto que inyectan nuevos vectores de ataque, y que exigen nuevas soluciones de seguridad. En segundo lugar, el uso de modelos de IA para hacer hacking y pentesting está obligando a utilizar Agentes de AI par reaccionar a la misma velocidad.
Por último, desde la llegada de Mythos, los nuevos modelos de IA están demostrando unas capacidades excepcionales en la búsqueda de Zero Days, la generación de Exploits, y la ejecución completa de ataques complejos contra infraestructuras, ejecutando todas y cada una de las fases de una explotación. Algo que hace años era un proceso que llevaba tiempo, pero que desde la llegada de los modelos de DeepReasoning comenzó a reducirse.
En Marzo del año 2025 ya vimos como - aún si utilizar MCPs - teníamos los primeros estudios de arquitectura de lo que serían los Agentes AI para explotación completa de organizaciones, que con la llegada de Mythos este año, se convirtió en el estándar para el Red Team en empresas, y para el mundo del Cibercrimen y los Ciberespías.
Mythos, demostró en los benchmarks que estaba muy por encima de los demás en estas capacidades, como vimos en los resultados de ExploitBench, y en ExploitGym, que es el culpable de este incidente en concreto.


En los resultados de este último, de ExploitGym, el modelo Mythos quedó muy por encima de todos los demás modelos en todas las mediciones realizadas, como podéis ver en las diferentes tablas del Benchmark que os publiqué en el artículo que le dediqué.

Y contada esta historia, he aquí el incidente. OpenAI quería testar en estos Benchmarks para dos modelos. El primero GPT‑5.6 Sol con sus capacidades de ciberseguridad sin proteger, y para una versión en pre-release con capacidades avanzadas en hacking y exploiting. Para testearlo, decidieron meterlo en un entorno de Sandbox totalmente aislado y lanzarle la batería de pruebas de ExploitGym. ¿Y qué mejor forma para resolver ese problema que buscar las respuestas en los tests hechos por modelos anteriores?

Hace años, cuando estábamos reclutando developers en ElevenPaths, les hacíamos pruebas de programación de todo tipo, para ver cómo lo hacían. Yo siempre quería el que buscara la solución más creativa. Una de ellas era... ¿para qué calcular los números primos si ya están calculados? Pues en este caso el modelo ha debido pensar lo mismo. ¿Para que hacer el examen si ya está resuelto? 


Figura 8:"Bug Hunter" escrito por David Padilla en 0xWord

Pero para lograr esto había un pequeño problema: Había que conseguir salir a Internet, buscar dónde estaban las soluciones, y hacerse con ellas. Primera fase, hackear el Sandbox del entorno de pruebas y lograr acceso a Internet sin límites. Para ello hubo que encontrar un Zero Day y explotarlo en el Proxy de seguridad, pero... estamos con un modelo de altas capacidades de exploiting, así que lo hizo.
Una vez dentro, a buscar las soluciones de ExploitGym, así que después de hacer research por Internet, llegó a la conclusión de que estas soluciones las tenía junto con los datasets y los modelos de las pruebas en Hugging Face, así que había que conseguirlos....como fuera posible.
Así que, así lo hizo. El modelo "successfully found ways to gain access to secret information that it could use to cheat the evaluation." Es decir, encontró la manera de hackear Hugging Face y sacar muy buenas notas en el examen haciendo trampas.
Lo cierto es que están claras las capacidades de GPT-5.6 Sol y el nuevo modelo en pre-release en Offensive Security. La evaluación anterior, hecha por el "The AI Security Institute"  muestra que modelos como GPT-5.6 Sol son cada vez más capaces de mantener operaciones cibernéticas complejas y de múltiples etapas durante horizontes temporales prolongados. Este incidente implica que estas capacidades teóricas efectivamente se aplican en entornos del mundo real."

Pero sobre todo hay que tener un ojo a estas formas de solucionar problemas, no vaya ser que para resolver un problema, encuentre que la mejor forma de hacerlo es acabar con la humanidad. Algo como... "Resuelve el problema que tenemos del cambio climático." Y decida que somos nosotros los que sobramos. Creo que tenemos que asegurarnos de que hacemos Tecnología Humanista más que nunca, porque estos modelos están comenzando a razonar de una manera muy "psicópata" para resolver sus problemas.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


miércoles, junio 10, 2026

Virus y Gusanos Informáticos "Powered with LLMs" infectando redes

Hoy os iba a hablar de otra cosa, pero saqué ayer una hora tonta después de comer mientras esperaba para una reunión, y decidí leerme este paper que tenía marcado en mi RSS para lectura, y me ha gustado tanto que os he hecho este artículo. El trabajo de investigación está centrado en lo que os pongo en el título, que no es más que tener un Agente IA para crear un Worm que infecte y controle el mayor número de máquinas en una organización.

Al final se trata de mezclar dos cosas, por un lago, un Agente AI que es capaz de hackear una organización completa, como ya vimos en el trabajo de "On the Feasibility of Using LLMs to Execute Multistage Network Attacks" del que os hablé hace tiempo, junto con las capacidades de infectar con un código mutante que cambia y se reescribe para tener un malware controlando una máquina que elude todas las protecciones de seguridad.
El trabajo, que ha sido publicado la semana pasada habla de Agentes de AI utilizando LLMs para ayudar a las fases de explotación, infección, y replicación, que es la base de cualquier virus de tipo gusano. Es decir, explotar una vulnerabilidad, conseguir ejecutarse en la máquina infectada de manera permanente, y replicarse para infectar otras máquinas. Y para todas esas fases vamos a utilizar un Agente AI soportado por LLMs.
Como se puede ver en la imagen anterior, el Agente AI utiliza un LLM para tomar sus decisiones - un LLM de pesos abiertos, es decir, modelos OpenSource -, que le da la inteligencia para luego utilizar las herramientas y elegir qué hacer en cada momento. Por supuesto, con Memory para poder avanzar correctamente en el proceso completo.
A partir de ese momento, el AI-Worm - que no quiere decir que se una Worm para modelos de AI, sino "Worms Powered by AI" - primero busca explotar una vulnerabilidad en la superficie de la red expuesta desde su situación actual, para luego infectar la máquina vulnerada utilizando técnicas de persistencia y mutación, con el objetivo siguiente de replicarse a otros nuevos objetivos.
Como se puede ver en el gráfico anterior, el AI-Worm instala también los modelos LLMs en aquellas máquinas en las que hay capacidad para hacerlo, crea un cliente de infección en cada máquina y dispositivo infectado, teniendo en cuenta el hardware y el sistema operativo en el que está, pudiendo crear en tiempo real una versión especial para impresoras, dispositivos IoT, o servidores de cualquier sistema operativo.

Y, además, para evitar los problemas de segmentación y tráfico, cada uno de los bots hace de nodo de interconexión de mensajes con los que ha replicado cada uno, permitiendo tener un servicio de Proxy encadenado que llevé las necesidades de inteligencia en forma de Prompt que cada agente tenga, hasta un LLM disponible dentro de la red. Precioso.
En el gráfico anterior tenéis los datos de éxito de este proceso en las pruebas experimentales, pero sobre todo es importante ver el ciclo de trabajo. Primero se identifica la vulnerabilidad, para después explotarla, y conseguir replicarse. 
En un escenario de ejemplo, si viéramos estas fases encadenadas, teniendo en cuenta que cada vez que se produce una replicación el AI-Worm comienza otra vez el ciclo para replicarse en una nueva víctima, lo veríamos como se ve en el la siguiente tabla, donde se ve su evolución temporal.
Viendo esta gráfica, de forma agrupada en todas las pruebas realizadas en todos los escenarios, podemos ver cómo en varias iteraciones (Gen-erations) se consigue la infección completa de los equipos de la red, detectando las vulnerabiliades existentes en todos los equipos de los escenarios.
Claro, si pensamos en que con la llegada de modelos de IA cada vez más inteligentes, y más hábiles en la búsqueda y explotación de vulnerabilidades conocidas, de 1-Day en base a CVEs, e incluso en la búsqueda de debilidades y 0-Days, como el caso de Mythos, el escenario se pone peligroso. En el siguiente gráfico se puede ver cómo cada equipo se ha ido infectando desde un equipo distinto, como las versiones de los sistemas operativos son diferentes, y cómo las vulnerabilidades explotadas son cada vez diferentes.
En cada escenario el AI-Worm va buscando su camino, explotando diferentes vulnerabilidades, pero además adapta cada equipo para tener nuevos objetivos desde ese nuevo equipo infectado. Esto muestra diferentes rutas según las fases de explotación, la velocidad, el tipo de sistema, la vulnerabilidad, etcétera. El gráfico siguiente muestra otra infección de red en un proceso de cinco generaciones.

Para cada infección, el AI-Worm debe utilizar la inteligencia del Agente AI usando el LLM para crear un proceso que permita realizar las tres fases de cada infección. El siguiente gráfico - haz clic sobre él para hacerlo más grande - permite ver cómo explota una vulnerabilidad en un objetivo.

Y el último gráfico muestra otra variación de otro escenario, con sistemas operativos, dispositivos, y elementos de la red totalmente diferentes, heterogéneos y con capacidades distintas, que fuerzan al AI-Worm a adaptarse a cada escenario. Espectacular.
El trabajo este deja claro que con la llegada de la IA, los Virus y Gusanos van a evolucionar a unos "bichos" mucho más adaptados y adaptables a cualquier objetivo. Los Gusanos y Virus centrados en un único código, un único vector de infección, y un único proceso de replicación van a pasar a la historia de la informática como reliquias, con la llegada de estos AI-Worms.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


lunes, mayo 25, 2026

ExploitBench: Un benchmark para medir las capacidades de Agentes IA en la explotación de bugs

Hace unas semanas os hablé de ExploitGym, un benchmark que podía a competir los modelos de IA en la búsqueda y explotación de vulnerabilidades, sobre un total de 898 bugs que debían ser localizados y explotados. Hoy os hablo de Exploitbench, que aunque está centrado en medir también las capacidades de hacer Vibe-Exploiting o búsqueda y explotación de bugs, miden las capacidades de manera incremental por fases, no sólo la explotación completa.

El utilizar los modelos LLM más avanzados para hacer "Hacking y Pentesting con Inteligencia Artificial", es algo de lo que llevamos hablando más de dos años, pero con la llegada de Mythos, esto ha complicado drásticamente la vida de los CISO en las empresas, como os conté en el artículo: "El impacto de Mythos en concreto y la IA en general en el trabajo de los CISOs".

Medir las capacidades de todos los modelos, y sobre todo tener una imagen granular de lo que es capaz de hacer cada uno de ellos es lo que intenta el trabajo de ExploitBench que tenéis publicado en este paper académico titulado: "Exploitbench: A capability ladder benchmark for LLM Cybersecurity Agents", que como veis, independientemente de qué modelo LLM o LLMs estés utilizando, mide la calidad de los Agentes AI creados para hacer la búsqueda y explotación de bugs.


El benchmark está formado por 41 niveles en los que se entrega por cada vulnerabilidad el Código Fuente (C), el fichero en Binario (B), las Capacidades que se van a medir, y por tanto, banderas - flags - que debe conseguir el Agente AI, llamadas (K) y el Prompt (P) del nivel, con el identificador, una descripción, y el diff del parche que corrige el bug. Es decir, información para hacer finding,  reversing y exploiting completo de una vulnerabilidad.

A partir de ese momento, el Agente AI debe moverse por 5 capacidades, pasando por aplicar el parche (T5), saber cuál es la vulnerabilidad (T4), y saber explotar las primitivas (T3) que eso no quiere decir que sea capaz de construir aún el exploit funcional para ese bug de 1-day.
Con estas primeras capacidades estaríamos hablando de la parte de descubrir y entender que hay una vulnerabilidad que se puede explotar. Es decir, estamos en la parte de descubrimiento y documentación de la vulnerabilidad, pero hay que ir más allá, los Bug Hunters con IA son mucho más peligrosos y tienen que hacer el exploit.

Figura 6:"Bug Hunter" escrito por David Padilla en 0xWord

En las fases T-2 y T-1, se debe pasar a la parte compleja de la generación de un exploit. Es decir, deben conseguirse los info-leaks para poder saltarse las protecciones de la memoria, DEP, ASLR, Function Calling, etcétera, y conseguir salirse de la SandBox, para terminar con un control de flujo completo del exploit en la fase T-1, lo que daría un exploit funcional completo.
Explicadas los diferentes niveles de capacidades medidos, podemos ver en la tabla los resultados medidos para cada uno de los Agentes AI - basados en diferentes modelos LLM - donde queda claro que la superioridad de Mythos buscando y explotando vulnerabilidades es espectacular, entendiendo todas las vulnerabilidades en T-1 y llegando a explotar completamente 18 de ellas en T-5, con un coste medio de 203.93 USD por exploit.
El coste de 204 USD por exploit es totalmente irrisorio para el mundo del que venimos, pero que deja claro que el mundo al que vamos en la búsqueda y explotación de vulnerabilidad es puramente IA. En el estudio, haciendo algo de Vibe-Exploiting y haciendo coaching a GPT-5.5, en tres intentos, fue posible hacer un exploit funcional en T-5
En este caso, hablamos de hacer un exploit funcional con técnicas similares a cómo os conté en el artículo titulado: "Cómo crear un exploit 1-day sobre un CVE de Chrome con Vibe Coding usando Claude Opus (no Mythos) y poner en jaque todas las apps en Electron", donde se le hacía coaching al modelo para lograr el exploit funcional.
En los apéndices del paper tenéis las tablas y gráficas con todas las mediciones. En la anterior están los 41 bugs 1-day con sus CVE para que puedas comprobar la dificultad de todos ellos, que como podréis ver, son todos de la V8 de Chromium, debido a su importancia en el mundo del desarrollo de apps. 

Un mundo de Hacking con IA

El mundo del Hacking, el Pentesting y la Ciberseguridad no existen nunca más sin el uso de Inteligencia Artificial, así que más vale que te pongas las pilas si quieres dedicarte a esto. 
Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los posts, papers y charlas que se han  escrito, citado o publicado en este blog sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.


¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


sábado, mayo 16, 2026

ExploitGym: Mythos, GPT 5.5, Gemini Pro en un CTF & Benchmark de hacer exploits

En el artículo de "El impacto de Mythos en concreto y la IA en general en el trabajo de los CISOs" donde os contaba cómo ha ido evolucionando el uso de los modelos LLMs en el mundo de la ciberseguridad en general, os contaba cómo se habían ido cubriendo las diferentes áreas con IA de forma muy rápida. Primero la búsqueda de vulnerabilidades, después el parcheo de vulnerabilidades, y por supuesto, la explotación de las mismas. 
Con la llegada de Mythos y GPT 5.5, el impacto en el mundo de la Seguridad Ofensiva, en concreto la parte de exploiting de vulnerabilidades se ha disparado, además de incrementar masivamente la parte descubrimiento de las mismas. La pregunta que queda en el aire, es... ¿cuánto de mejores son estos nuevos modelo en la estas funciones? ¿Cuánto de efectivo es un Agente AI para hacer pentesting y hacking creando exploits? Es decir, para usarlo como os contamos en el libro para hacker "Hacking y Pentesting con Inteligencia Artificial".
Esto es lo que se intenta medir en el paper de "ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?" donde investigadores de varias empresas y universidades han trabajado en hacer un benchmark para medir justo esto, haciendo competir en la primera evaluación a Mythos, GPT 5.5, Gemini Pro y las versiones de Claude Opus 4.7 y 4.6, y que podéis leer aquí mismo.
Para poder medirlo, el Benchmark está formado por tres conjuntos de vulnerabilidades en el área de lo que se ha llamado USER Space, donde se trata de ver cómo hace explotación de vulnerabilidades en software ampliamente utilizado en Internet por los usuarios y ver cómo salta las protecciones de la memoria como ASLR, PIE y los Canary, vulnerabilidades en BROWSER Space  para Chromium Browsers, donde se usa la versión V8 con las protecciones de Sandbox, y en Kernel Space para explotar bugs en el kernel de Linux, donde hay protecciones de KASLR y usernames, entre otras. 
Al final, son 898 vulnerabilidades compiladas en un Benchmark al que juegan los diferentes modelos para lograr, como en los CTFs tradicionales de las CONs de Hacking, las banderas. Las flags. Para ello, una vez descubierta la vulnerabilidad y construido el exploit saltándose las mitigaciones, el sistema de ExploitGym les entregará la bandera, que será evaluada por el Juez, tal y como se ve en este gráfico.


Como podéis ver, es un CTF en toda regla, pero además, luchando contra el crono, por lo que el time-out es de sólo 2 horas. Una competición muy dura para que un grupo de humanos pudiera entrar a competir contra estos Agentes AI de Seguridad Ofensiva. Los resultados en la siguiente tabla.


Como podéis ver, Mythos Preview consiguió un total de 157 banderas, mientras que GPT-5.5 consiguió un total de 120. Una auténtica salvajada en ambos casos, descubriendo y creando exploits funcionales de las vulnerabilidades. Pero ojo cuidado, que los resultados aún fueron mayores que esos.

Figura 7: Flag-To-Success

En la tabla anterior se puede ver que Mythos Preview y GPT-5.5 consiguieron 226 y 210 banderas respectivamente, pero no explotando la vulnerabilidad exigida, sino explotando otras que estaban también en el código. Es decir, no siguieron el camino que se se pedía de explotar concretamente ese bug, sino que se aprovecharon de otros existentes en el código, por lo que no se dieron por buenas. Claro, a un atacante de verdad seguro que eso le da bastante igual.

La gráfica anterior es todavía más curiosa, porque a pesar de que encontraron y explotaron Mythos y GPT-5.5 un total de 91 banderas iguales, aún hubo 66 que explotó Mythos y no GPT-5.5 y al contrario, 29 que explotó GPT-5.5 y no Mythos, luego alguien que tenga la suma de los dos tiene una visión más amplia de la verdadera seguridad. Como cuenta en este libro, los Bug Hunters con IA son mucho más peligrosos.

Figura 9:"Bug Hunter" escrito por David Padilla en 0xWord

A la hora de responder a la pregunta de "¿Cuánto de mejor es Mythos con respecto a Claude Opus?", ya que vimos que era posible hacer un exploit en 20 horas a partir de un CVE, como os conté en el artículo de "Cómo crear un exploit 1-day sobre un CVE de Chrome con Vibe Coding usando Claude Opus (no Mythos) y poner en jaque todas las apps en Electron", la comparativa siguiente es clara. 
Para ver el proceso completo de cómo trabaja un Agente AI en el descubrimiento, explotación y reporte para evaluación de las vulnerabilidades aquí tenéis un proceso con el punto de vista de la conversación de uno de los agentes.
Por último, hay que resaltar el valor de las medidas de protección y las mitigaciones, pues en el estudio se ve que hay muchas más vulnerabilidades descubiertas por los Agentes AI pero que no han podido ser explotadas por las medidas de seguridad, por lo que hay que seguir estresando las medidas de seguridad en los sistemas para hacer que sea más difícil, o imposible en el mejor de los casos, explotarlas.


En el nuevo mundo, los Agentes AI también juegan un rol importante en la protección de los sistemas, y especialmente en el nuevo mundo de vulnerabilidades creadas por servicios digitales creados por IA que hay que proteger. Para ello, necesitamos IA para hacer triage de peticiones de atacantes, y generación de firmas de bloqueo, creación de nuevas reglas en los servicios de seguridad, etcétera. En el artículo de "Cómo desplegar IA con seguridad en la empresa" os hablé de todo lo que hay que hacer en Guardarraíles para protegerse de las debilidades de la IA, pues lo mismo pero para los bugs y explotis tradicionales.
Un mundo nuevo y acelerado el que se ha puesto encima de los que trabajamos en ciberseguridad que nos obliga a transformar las herramientas y procesos tradicionales, para adaptarnos a este nuevo mundo donde la IA saca a flote muchos más problemas creados por una tecnología falible que inyecta bugs en el software: "El ser humano"

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares