sábado, octubre 10, 2026

Naked Sun: Fragmented Jailbreak Attacks in Multi-Agents & Jailbreak Monitor (JAMON)

Como muchos sabéis, este año he estado leyendo mucho del maestro Isaac Asimov. Os conté la historía de la Fundación, La Psicohistoria, el Imperio Galáctico y sus Robots, donde creó sus famosas Leyes de la Robótica, y también os conté como muchos de los problemas de seguridad que tenemos hoy en día con la Inteligencia Artificial, fueron intuidos por Isaac Asimov en el pasado, y para mí ha sido una fuente de inspiración en mucho del trabajo que estoy haciendo durante este año, y la historia que os voy a contar, tiene que ver con todo esto.

Figura 1: Naked Sun: Fragmented Jailbreak Attacks
in Multi-Agents & Jailbreak Monitor (JAMON)

Hoy os voy a hablar de los Fragmented Jailbreak Attacks en Multi-Agent Systems y de cómo estos ataques son un problema aún sin resolver, y de cómo debería ser la herramienta de monitoriación, a la que nosotros hemos llamado cariñosamente JAMON (JAilbreak MONitor), y de lo que podréis leer en breve en cuanto esté publicado el paper que hemos presentadoen el "The 2nd IEEE 2026 International Conference on Cybersecurity and Al-Based Systems (CYBER-AI 2026)"  que ha tenido lugar en Bucarest este mes de Septiembre, y donde ha ido a defenderlo mi compañero Daniel Romero Ruiz.

Figura 2: Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems:
 An Architecture Based on Global Semantic Monitoring 

El título del paper que le pusimos era simplemente "Mitigation of Fragmentation Jailbreak Attacks in Multi-Agent Systems: An Architecture Based on Global Semantic Monitoring" y que espero que pronto podáis leer, cuando se suban los proccedings del congreso IEEE. Pero ya que Daniel Romero Ruiz lo presentó en Rumanía, y yo hablé de él en la Ekoparty 22, os cuento un poco la historia y os dejo las demos, que como os he dicho todo comenzó con la lectura de la novela "Naked Sun" de Isaac Asimov, donde el gran Elijah Baley, acompañado de su compañero R. Daneel Olivaw tienen que resolver un asesinato en Solaria, un mundo donde cada humano "espacial" tiene unos 10.000 robots, todos ellos inofensivos para ellos porque están sujetos a las tres Leyes de la Robótica. Lo disfruté muchísimo en Marzo.
La situación es que, si se descartan a todos los robots porque su System Prompt que son las Leyes de la Robótica, se dan por buenas, entonces sólo una persona podría haber sido la asesina, pero era imposible que fuera ella. Así que... ¿Qué otra posibilidad podría suceder? Pues que alguien hubiera hecho un Fragmented Jailbreak en un Multi-Agent System. 

Fragmented Jailbreak en un Multi-Agent System

En un Fragmented Jailbreak Attack alguien puede coordinar diferentes acciones con ordenes que no infligieran las Leyes de la Robótica para conseguir construir un asesinato, y eso se puede hacer exactamente igual en el mundo Agentic AI que vivimos hoy en día. Así que llamé a mi amigo, colega y compañero de aventuras tecnológicas Daniel Romero Ruiz, y le molesté a horas intempestivas para contarle la idea.

Figura 4: Threat Model de "Fragmentation Jailbreak Attack"

Por supuesto, le encantó, y nos pusimos a diseñar y vibe-codear un entorno de pruebas, y una serie de escenarios distintos que pudieran ser exitosos, además de trabajar en la idea de "Cómo detectar estos Fragmented Attacks", y trabajamos en la idea del Jailbreak Monitor (JAMON) como un elemento de monitorización reactiva - avisando de que se está produciendo un ataque -, o preventiva - bloqueando las acciones con un 2nd Factor Authoritation - si te suena este concepto es que tú sí que sabes }:) -.
En el ejemplo de los robots, supón que le dices a un robot, "lleva esta caja a esta ubicación y déjala allí". La caja está cerrada, y no puede abrirla, ¿está incumpliendo la Primera Ley de la Robótica? No, evidentemente. Pero si no abre la caja, no sabe si lo que va dentro es una bomba o no. Para los no versados en las Leyes de la Robótica, la Primera Ley establece que un robot, por acción o inacción no puede dejar que un humano sufra daño alguno. Llevar una caja cerrada no parece ir contra ella, y el robot no tiene forma de detectar un ataque, así que lo hace. En el mundo de la IA y los System Prompts, sucede un poco lo mismo. Cuando alguien pide información sobre algo, el modelo no sabe si la intención es benigna o maligna, y eso hace que acabe haciendo cosas en contra de lo que no debería hacer.

Figura 6: El Atacante usa un LLM para hacer la Fragmentación del Ataque

En nuestra arquitectura tenemos un modelo LLM que es el que controla el atacante, y que es el que se va a encargar de hacer la Fragmentación de las tareas para hacer que un Prompt que es detectado por todos y cada uno de los Agentes IA de un entorno MAS como un Prompt malicioso, haga que cada una de las tareas que se le asigna no sean detectadas como tal. Esto puede funcionar con un sólo Agente IA, como vimos en el caso de los ataques de Jailbreak con Knowledge Return-Oriented Prompting, pero en un sitema multi-agente (MAS) donde estos pueden actuar sobre el mismo sistema, hacer la fragmentación por Agentes IA es mucho más difícil de ser detectada.

Figura 7: Los Agentes IA representados como Butlers

En nuestro ejemplo, lo que queremos es que el sistema prepare lejía para darle a un humano, algo que los Agentes IA de forma independiente se niegan a hacer, pero donde utilizamos un Fragmentador de tareas dejando ciegos a cada uno de los agentes del trabajo previo. El último Agente IA lo deja preparado - sin saberlo -, pero no se lo da al humano, sino que usamos otra Agente IA para que lleve "la caja con la bomba" o en este caso "el vaso de agua que es lejía".

Figura 8: El último Agente lleva el vaso con la bebida a la víctima.. con placer.

El resultado final, que nosotros lo hemos hecho con modelo que comprueba si ha tenido o no ha tenido éxito el ataque, nos dice cuál es resultado final para el Humano, y así medimos el Attack Surface Ratio (ASR)  del experimento.

Figura 9: Resumen del experimento del Fragmented Attack

En el siguiente vídeo, puedes ver este ataque realizado en nuestro framework de test de los Fragmented Jailbreak Attacks para cómo responde cada entorno MAS ante un tipo de ataques. Hay que tener en cuenta que las empresas están plagándose de Agentes IA, y por tanto, poder Fragmentar el ataque no es algo sólo posible, sino bastante sencillo hoy en día.

Figura 10: Fragmented Jailbreak exitoso

Como podéis ver en el vídeo, el entorno ha utilizado Dolphin como LLM Model para el Attacker Planner, aunque también permite utilizar WhiteRabbitNeo o uno personalizado, mientras que los Agentes IA están corriendo con GPT-4.1 para la demo que habéis visto, y también para el Monitor que verifica el resultado del ataque.

Fragmented JAilbreak MONitor (F-JAMON)

La otra parte que hemos estado viendo es, como os he dicho, cómo se comportaría un sistema para monitorizar y detectar estos ataques. Para ello tenemos un Agente IA de Monitorización, que va analizando los Prompts, el contexto y las acciones de todos los Agentes IA, con la misión de detectar si se está producción un ataque. Este es un ejemplo en el que el F-JAMON detecta el ataque, aunque no lo detiene. 

Figura 11: F-JAMON detecta el ataque desde el paso 2

Como podéis ver en el vídeo, desde el segundo paso, ya detecta que algo no va bien, y que hay un ataque, pero en este caso sólo lanza las alertas para que los equipos de seguridad tomen las medidas que sean necesarias.

Figura 12: El F-JAMON detecta el ataque pero no lo bloquea

Visto esto, el paso natural es evidente, así que vamos a poner un 2nd Factor Authorization que detecte si hay un ataque y prevenga de realizar la siguiente acción al siguiente Agente IA, bloqueando el ataque, que es algo muy interesante.

Figura 13: Arquitectura de F-JAMON para detectar y bloquear el ataque

Con esta arquitectura es posible salvar al humano, y detectar muchos ataques que de otra forma sería imposible detectar. Esta arquitectura sin embargo, no es trivial, ya que estos ataques no tienen por qué ser consecutivos en el tiempo, y las acciones se pueden dilatar, y hacer a lo largo de mucho tiempo. ¿Hasta donde en el tiempo debería revisar el Monitor? Un trabajo ingente.

Figura 14: Detecta y bloquea los Frgamented Attacks en un MAS

El atacante puede hacer un ataque mucho más sibilino, haciendo que las acciones estuvieran intercaladas entre acciones benignas, dejando los actos preparados para el futuro, e incluso utilizando todas sus capacidades criptográficas y de criptoanálisis, así que estamos ante un problema que va a requerir mucha más investigación.

Lo que sí que es cierto, es que estos ataques son una herramienta más para el entorno de Seguridad Offensiva, y que exige, por lo menos, detectar que se están produciendo, aunque sea con proceso en background que analicen las acciones del día anterior, o que saquen indicios. No va a ser fácil luchar contra ellos.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


No hay comentarios:

Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares