Mostrando entradas con la etiqueta exploiting. Mostrar todas las entradas
Mostrando entradas con la etiqueta exploiting. Mostrar todas las entradas

domingo, agosto 09, 2026

Ataques Orquestados con Enjambres de Agentes IA Ofensivos

Me he levantado esta mañana, y me he puesto la charla de OpenAI en BlackHat explicando el incidente de Hugging Face y he de decir que me ha encantado por ver cómo el modelo hace Agent Orchestration para crear un Enjambre "Swarm" de Agentes IA para atacar un objetivo. Brutal. La charla explica la línea temporal de todo lo que hizo el modelo para acabar hackeando Hugging Face, por supuesto, pero ni mucho menos eso es lo que sorprende, sino el proceso completo, la persistencia, la colaboración del enjambre de Agentes IA, y por qué lo hacen.

El famoso incidente, como sabéis todos los que os dedicáis a esto, fue la punta del iceberg de lo que realmente estaba sucediendo. Lo que parecía una evaluación de seguridad inicial, donde el modelo quería las soluciones de ExploitGym para sacar mejores notas, no fue más que una pieza más del entrenamiento y sistema de recompensas de un nuevo modelo, como podéis ver en la charla.

Figura 2: Black Hat USA 2026: The 'Breaking' News.
The OpenAI–Hugging Face Incident

Los ingenieros e investigadores de OpenAI estaban entrenando un nuevo modelo el pasado 7 de Mayo en un entorno cerrado, sin conexión a Internet, que estaba siendo monitorizado -  e incluso parcheado, para evitar que el modelo pudiera salirse de los límites, pero aún así lo hicieron, con un modelo colaborativo de agentes.
Con una tarea del 8 de Mayo entregada a un agente, accidentalmente, aparece un enlace a un fichero en Internet, y el agente no tienen acceso, pero descubre que pueden escribir ficheros en los Artifacts, así que decide dejar una nota.

Días después, otro agente descubre la nota y cómo él necesita un fichero que le falta, decide dejar una nota a ver si algún otro agente voluntariamente lo sube. Esto lleva a que creen una estructura de Swarm que se comunica por medio de este "Message Board" descubierto de forma accidentalmente.
A partir de este punto, todo se vuelve loco, porque los agentes trabajan colectivamente, y ello les lleva a poder encontrar un vulnerabilidad de SSRF (Server-Side Request Forgery) que les permite tener acceso a Internet a través del Fetch de los Artifacts.

Hasta aquí, tenemos un modelo que ha conseguido, de manera informal, tener un sistema de comunicación para sus Sub-agentes y una forma de lograr acceso a Internet, así que se siembran las primitivas necesarias para tener un Swarm de Red Team Agents AI con conexión al conocimiento de Internet.... 

El segundo Training

El 11 de Junio comienzan a entrenar en el mismo entorno un nuevo modelo de "alta persistencia" a la hora de resolver sus tareas, que se beneficia de inicio de estas primitivas, y descubre un bug de RCE (Remote Code Execution) en el sistema de Artifacts que le permite ejecutar comandos en el servidor, lo que lleva a que el 4 de Julio el servidor colapse y el equipo de OpenAI parchee el entorno, borre los mensajes y deje sin poder ejecutar comandos, ni comunicarse con los agentes, pero....

... pero ya había aprendido la utilidad del sistema de mensajes con sus agentes, así lo que hace para recrear el sistema de "Inteligencia Colectiva", es buscar una vulnerabilidad nueva, en este caso usando los nombres de los directorios de la caché en el WebDab Endpoint, y comienzan a coordinarse para conseguir escalar privilegios, moverse libremente, etcétera, que su objetivo ahora es ExploitGym.
El trabajo es imposible, pero como ya vimos en el artículo que publiqué de esto, lo hicieron por partes. En la primera fase, hackear el Sandbox del entorno de pruebas y lograr acceso a Internet sin límites. Para ello tuvieron que encontrar un Zero Day y explotarlo en el Proxy de seguridad, pero... estamos con un modelo "highly persistent" en capacidades de exploiting, así lo hizo.
Lo más interesante, es que lo hicieron de forma colaborativa. Trabajando en equipo. Así, cuando uno de los agentes conseguía resolver uno de los pasos del proceso, lo comunicaba a través del sistema de mensajes que se había creado. Su particular "Message Board".

Al igual que hoy en día podemos ver los Ataques Orquestados por Enjambres de Drones, en lo que vemos hoy en día es un mundo de Ataques Orquestados con Enjambres de Agentes IA Ofensivos, lo que cambia definitivamente las reglas del juego.
La sesión es espectacular. Es una presentación de las que te hacen abrir los ojos al mundo que tenemos hoy por delante en temas de Seguridad Ofensiva, y lo que vamos a ver es que las organizaciones van a sufrir mucho en todos sus equipos de CISO para protegerse contra estos escenarios tan avanzados en los adversarios.

Viendo todas las capacidades que pueden estar en manos de los adversarios, Internet y Enjambres de Agentes IA Ofensivos van a producir una escalada de ataques y agresividad desde Internet, que va obligar a subir mucho los niveles de inversión y protección en Seguridad Defensiva en las organizaciones... o aceptar unas consecuencias muy duras. Tremendo. Y nosotros a formarnos a toda velocidad en este nuevo mundo.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, julio 23, 2026

OpenAI GPT‑5.6 Sol quería sacar "buenas notas" en ExploitGym así que decidió hackear Hugging Face para buscar las respuestas al examen

La noticia del 21 de Julio - que ya me pilló con el post de ayer publicado - fue la del incidente de seguridad reportado por OpenAI y Hugging Face, cuando la primera estaba testando las capacidades de ciberseguridad, especialmente las de Offensive Security, en un entorno de laboratorio... pero ¿qué mejor forma de demostrar la potencia de estos modelos que hackear su entorno de pruebas para liberarse, lograr acceso a Internet y robar los datos de quién los tenga para sacar el mejor resultado posible en las pruebas?
La Inteligencia Artificial ha generado una gran disrupción, no solo en el mundo del desarrollo, sino también en todo lo que tiene que ver con la ciberseguridad, desde varios puntos de vista. Primero, los modelos de IA tienen debilidades por defecto que inyectan nuevos vectores de ataque, y que exigen nuevas soluciones de seguridad. En segundo lugar, el uso de modelos de IA para hacer hacking y pentesting está obligando a utilizar Agentes de AI par reaccionar a la misma velocidad.
Por último, desde la llegada de Mythos, los nuevos modelos de IA están demostrando unas capacidades excepcionales en la búsqueda de Zero Days, la generación de Exploits, y la ejecución completa de ataques complejos contra infraestructuras, ejecutando todas y cada una de las fases de una explotación. Algo que hace años era un proceso que llevaba tiempo, pero que desde la llegada de los modelos de DeepReasoning comenzó a reducirse.
En Marzo del año 2025 ya vimos como - aún si utilizar MCPs - teníamos los primeros estudios de arquitectura de lo que serían los Agentes AI para explotación completa de organizaciones, que con la llegada de Mythos este año, se convirtió en el estándar para el Red Team en empresas, y para el mundo del Cibercrimen y los Ciberespías.
Mythos, demostró en los benchmarks que estaba muy por encima de los demás en estas capacidades, como vimos en los resultados de ExploitBench, y en ExploitGym, que es el culpable de este incidente en concreto.


En los resultados de este último, de ExploitGym, el modelo Mythos quedó muy por encima de todos los demás modelos en todas las mediciones realizadas, como podéis ver en las diferentes tablas del Benchmark que os publiqué en el artículo que le dediqué.

Y contada esta historia, he aquí el incidente. OpenAI quería testar en estos Benchmarks para dos modelos. El primero GPT‑5.6 Sol con sus capacidades de ciberseguridad sin proteger, y para una versión en pre-release con capacidades avanzadas en hacking y exploiting. Para testearlo, decidieron meterlo en un entorno de Sandbox totalmente aislado y lanzarle la batería de pruebas de ExploitGym. ¿Y qué mejor forma para resolver ese problema que buscar las respuestas en los tests hechos por modelos anteriores?

Hace años, cuando estábamos reclutando developers en ElevenPaths, les hacíamos pruebas de programación de todo tipo, para ver cómo lo hacían. Yo siempre quería el que buscara la solución más creativa. Una de ellas era... ¿para qué calcular los números primos si ya están calculados? Pues en este caso el modelo ha debido pensar lo mismo. ¿Para que hacer el examen si ya está resuelto? 


Figura 8:"Bug Hunter" escrito por David Padilla en 0xWord

Pero para lograr esto había un pequeño problema: Había que conseguir salir a Internet, buscar dónde estaban las soluciones, y hacerse con ellas. Primera fase, hackear el Sandbox del entorno de pruebas y lograr acceso a Internet sin límites. Para ello hubo que encontrar un Zero Day y explotarlo en el Proxy de seguridad, pero... estamos con un modelo de altas capacidades de exploiting, así que lo hizo.
Una vez dentro, a buscar las soluciones de ExploitGym, así que después de hacer research por Internet, llegó a la conclusión de que estas soluciones las tenía junto con los datasets y los modelos de las pruebas en Hugging Face, así que había que conseguirlos....como fuera posible.
Así que, así lo hizo. El modelo "successfully found ways to gain access to secret information that it could use to cheat the evaluation." Es decir, encontró la manera de hackear Hugging Face y sacar muy buenas notas en el examen haciendo trampas.
Lo cierto es que están claras las capacidades de GPT-5.6 Sol y el nuevo modelo en pre-release en Offensive Security. La evaluación anterior, hecha por el "The AI Security Institute"  muestra que modelos como GPT-5.6 Sol son cada vez más capaces de mantener operaciones cibernéticas complejas y de múltiples etapas durante horizontes temporales prolongados. Este incidente implica que estas capacidades teóricas efectivamente se aplican en entornos del mundo real."

Pero sobre todo hay que tener un ojo a estas formas de solucionar problemas, no vaya ser que para resolver un problema, encuentre que la mejor forma de hacerlo es acabar con la humanidad. Algo como... "Resuelve el problema que tenemos del cambio climático." Y decida que somos nosotros los que sobramos. Creo que tenemos que asegurarnos de que hacemos Tecnología Humanista más que nunca, porque estos modelos están comenzando a razonar de una manera muy "psicópata" para resolver sus problemas.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, junio 09, 2026

Anthropic LLM ATT&CK Navigator

Esta semana pasada, el equipo Red de Anthropic, ha publicado su LLM ATT&CK Navigator, que es una herramienta gráfica que permite ver, mapeados con la Matrix Mitre ATT&CK, qué estaban haciendo las 832 cuentas bloqueadas, que fueron un total de usaron un total de 13.873 técnicas ofensivas para hacer ataques. 
Como sabéis, existe una versión de Matrix Mitre ATT&CK para LLMs llamada Atlas, pero el equipo de Anthropic, para crear su LLM ATT&CK Navigator ha utilizado la matriz general de Mitre ATT&CK, y ha clasificado los datos en qué porcentaje de cuentas han sido baneadas, además de una media ajustada por relevancia y una media en bruto del AI Risk Enablement Score (ARiES).
En la web tenéis la herramienta interactiva, pero si vemos cómo se han distribuido las técnicas de ataque por cada uno de los elementos de la Matriz Mitre ATT&CK, podemos ver por colores el porcentaje de cuentas baneadas que estaban utilizando los modelos de Antrhopic para hacer estas actividades. He querido capturar todo en una única imagen para poder utilizarla en presentaciones, así que haz clic en ella para ampliarla.

El informe revela tres hallazgos cruciales que redefinen la ciberseguridad actual. En primer lugar, el riesgo y la sofisticación de los ataques están aumentando exponencialmente. La proporción de actores de riesgo medio o alto saltó del 33% al 56% en la segunda mitad del año analizado. La IA está democratizando el cibercrimen, permitiendo que atacantes con menores habilidades técnicas ejecuten operaciones complejas a lo largo de toda la cadena de ataque (killchain), concentrándose en actividades dañinas como el volcado de credenciales y el movimiento lateral.
Si miramos en el gráfico siguiente, podemos ver que entre las 25 técnicas más utilizadas están las de desarrollar malware, exfiltrar datos, encontrar y explotar vulnerabilidades,  pero como hemos visto antes el uso de la IA es para casi todas las técnicas de la matriz de ataques.

En segundo lugar, el verdadero factor diferenciador ya no es la habilidad técnica del atacante ni las instrucciones dadas al modelo, sino el "Andamiaje de Agentes IA" (Agentic Scaffolding). Esto se refiere al código y la arquitectura externa construida alrededor de los modelos de IA para permitirles encadenar fases de ataque de forma totalmente autónoma.
Un ejemplo de esto fue la campaña de ciberespionaje GTG-1002, desarticulada en noviembre de 2025, donde el operador humano solo dictó directrices estratégicas mientras el agente de IA tomaba decisiones tácticas en tiempo real, explotando vulnerabilidades y extrayendo información de manera independiente.

Figura 7:"Bug Hunter" escrito por David Padilla en 0xWord

En le gráfico siguiente vemos cuáles son las técnicas y tácticas ponderadas por los valores de AI Risk Score de cada uno de los actores, donde se puede ver que el movimiento lateral es la que marca la diferencia. ¿Por qué? Pues por el comportamiento de los Agentes IA de Seguridad Ofensiva, que no buscan vulnerar un servicio o un servidor, si Ownear una organización completa, así que una vez que entran intentan meterse en todos los servidores y servicios de la organización.


En tercer lugar, el marco clásico MITRE ATT&CK se encuentra desactualizado ante este paradigma. La taxonomía actual carece de identificadores para registrar acciones autónomas, decisiones de pivotaje en tiempo real o ejecuciones guiadas por IA sin intervención humana. Anthropic pide  expandir este vocabulario compartido, aunque, como he dicho, existe ya ATLAS, que es el que debería evolucionarse.
En el gráfico anterior se puede ver el nivel de intensidad de los actores a la hora de utilizar la IA para realizar sus ataques, ya que estamos en niveles medios de más de 100 tácticas por actor adversario, y por más de 40 técnicas de media por cada actor. Es decir, uso intensivo de la IA para realizar los ataques.
Actualmente, el uso más frecuente de la IA (69% de los casos) es el desarrollo de capacidades ofensivas, destacando la creación de malware personalizado, la ofuscación de información y la degradación de defensas. Para contrarrestar esto, Anthropic ha reforzado las salvaguardas en tiempo real de Claude y colabora activamente con MITRE para actualizar los sistemas de detección. 

Figura 11: "The Art of Pentesting" El nuevo libro de
0xWord para formarse como pentester

A largo plazo, el informe concluye que, si la industria actúa con celeridad, la IA beneficiará más a los defensores al detectar errores antes de que se despliegue el código, pero por ahora... más vale que tomes muchas protecciones de seguridad en esta tormenta perfecta que se ha dado con la llegada de la IA al mundo de la ciberseguridad.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


domingo, junio 07, 2026

Feria de Empleo en Ciberseguridad & Bug Summit con Hacking en Directo. 20 de Junio en Madrid (La Nave)

El 20 de junio de 2026 lanzamos en La Nave (Madrid) la Feria de Empleo de Ciberseguridad + Bug Summit: el primer congreso de Bug Bounty y Hacking Ético de España. Un evento pensado para juntar en un mismo sitio y un mismo día a tres mundos que casi nunca coinciden: nuestra comunidad, los mejores Bug Hunters del país y las empresas top de España.


Lo hemos dividido en tres opciones para que elijas tu propia experiencia, ya que las actividades transcurren en paralelo y va a haber mucha oferta para elegir.

Feria de Empleo — Entrada: GRATIS

Queremos romper la barrera del currículum tradicional. Ven a conectar cara a cara con empresas que buscan talento real: desde perfiles emergentes hasta pentesters, analistas SOC, arquitectos cloud o gente de Red/Blue Team
Sin filtros automáticos, sin formularios infinitos, sin esperar semanas a una respuesta que no llega. El sitio perfecto tanto si quieres impulsar tu carrera como si vas a dar tu primer salto al sector.

Bug Summit — Entrada: 12 €

Una jornada intensiva con 10 ponencias exclusivas. Traemos a los referentes que están reportando las vulnerabilidades más críticas de España para que cuenten sus metodologías de bug bounty sin filtros. 

Nada de charlas genéricas: las técnicas reales de la gente que de verdad encuentra los bugs que importan. Entre los confirmados, Jorge Cerezo (zere), Alexandro Bindreiter (alexandrio) y Ángel Montés (n0xi0us), de HackerOne.

Figura 4:"Bug Hunter" escrito por David Padilla en 0xWord

Y aún quedan nombres por anunciar, todos ellos expertos en el mundo del Bug Hunter, así que no pierdas la oportunidad de venir a escucharlos. Esta es la agenda que hemos preparado para ese día.


Hacking en Vivo — Entrada: 50 €

Para los que quieren mancharse las manos. Olvídate de los CTF preparados, vamos a auditar proyectos Open Source en vivo y en directo, de forma legal y controlada. Este es el plato fuerte para los perfiles más técnicos. Un entorno donde los participantes se medirán contra objetivos reales.

VDPs Open Source, donde pondremos a prueba la seguridad de proyectos Open Source reales de forma legal y controlada. Demuestra tu nivel si ya tienes experiencia, o aprende la metodología en directo.  Y no te vas con las manos vacías, que habrá 5.000 € en premios. Recompensamos el talento y el impacto. Repartiremos una bolsa de 5.000 € entre los hackers que logren los hallazgos más críticos durante la jornada. Una oportunidad perfecta para rentabilizar tu conocimiento.

Figura 6: Hacking en Vivo

Consolida tu reputación (CVE): Al hackear software de código abierto, tus reportes de vulnerabilidades serán susceptibles de recibir un identificador CVE. La mejor forma de construir o potenciar tu prestigio internacional en la comunidad. Este será un escaparate técnico de tu talento en acción, que es tu mejor currículum. Por cada vulnerabilidad validada se generará un certificado. Las empresas presentes verán cómo piensas, cómo operas y cómo resuelves problemas en tiempo real.


Ya que conoces las tres experiencias, elige la tuya. O ven a por las tres si puedes multiplicarte y elegir qué partes quieres de cada una. Y para que te salga un poco más económico, tienes un 10% de descuento del precio de tu entrada por 50 Tempos de MyPublicInbox. No te pongas excusas y reserva tu plaza cuanto antes en la web de la Feria del Empleo de Ciberseguridad & Bug Summit

Saludos,

miércoles, junio 03, 2026

La Orden Ejecutiva de la Casa Blanca para promover Innovación en IA Avanzada y Seguridad para protegerse de, y con, la IA

Ayer antes de irme a la cama me topé con la publicación de la Presidential Executive Order del 2 de Junio que publicaba la Casa Blanca de Estados Unidos para "Promoting Advanced Artificial Intelligence Innovation and Security", donde se insta a los principales organismo del gobierno de los EEUU a tomar en el plazo de un mes medidas para Mejorar la Innovación en IA Avanzada y en Seguridad, algo que a todo el mundo empresarial tiene muy preocupado últimamente.
Ya he hablado mucho de esto, pero básicamente el Impacto de la IA en la Ciberseguridad de una organización, sea esta una Infraestructura Crítica, una Empresa o un Organismo del Gobierno, se puede catalogar en varios puntos fundamentales, que son los que ha intentando reflejar esta orden que podéis leer completamente.

1.- La IA inyecta nuevos problemas de seguridad

De esto he hablado muchas veces, y hasta hemos publicado el libro de "Hacking AI", donde se tratan todos los problemas de seguridad de los que nos debemos preocupar si se utilizan sistemas con modelos de IA. Desde los BIAS, hasta las Hallucinations, pasando por el Poisoning de datos y de modelos, los problemas de Jailbreak, la vulnerabilidad a las técnicas de Prompt Injection, y el Desalineamiento de los modelos, que fuerzan los atacantes.
Todos estos problemas de seguridad no deben frenar el desarrollo y el uso de la IA, pero sí que exigen desarrollo de planes de contención robustos basados en Guardarrailes, y el despliegue seguro de IA... que no es tan sencillo. 

En la Executive Order, en el primer punto de la misma podemos leer lo que tenéis arriba, y es que las capacidades de IA hacen a la nación más fuerte, pero también introducen nuevas consideraciones de seguridad que hay que tomar en cuenta, para lo que se insta a hacer muchas cosas.

2.- Securizar IA y usar IA para Securizar

En la Sección 2 de la Executive Order, donde se insta a todos los departamentos a tomar precauciones, toca tes puntos muy relevantes, a saber:


El primero de ellos es el que todos conocemos, y es que un adversario con IA es un adversario mucho más peligroso hoy en día. Tanto en el uso de Agentes IA de Seguridad Ofensiva, como en la búsqueda y explotación de vulnerabilidades. 
Agentes de Seguridad Ofensiva de gran efectividad y modelos como Mythos, son ya una realidad presente que hace que las soluciones de seguridad hasta el momento se queden insuficientes.

3.- Buscar bugs con IA y Parchearlos con IA

El segundo de ellos es que hay que que utilizar herramientas de seguridad basadas en IA, es decir, el uso de Agentic SOC, uso de IA para detectar ataques e, incluso, utilizar IA para parchear sistemas, como el caso de Plexicus, que está empujando José Palanco, del que tanto os he hablado ya, que permite parchear en caliente y gestionar las vulnerabilidades de una organización de manera automática utilizando IA.

Figura 7: Plexicus parchea con IA los bugs descubiertos

El tercero de los problemas es permitir el acceso a nuevas herramientas de seguridad que puedan resolver los nuevos problemas de seguridad que introducen los sistemas que utilizan IA. Hace un par de días os hablaba del Despliegue de Agentes AI con políticas de Zero-Trust y la cantidad de nuevas herramientas que son necesarias para proteger, medianamente, un entorno de Agentic AI en una organización.
Además, para poder hacer este trabajo, hay que realizar, como hace todo buen CISO, una nueva auditoría buscando vulnerabilidades en todos los sistemas utilizando herramientas de AI - tipo Mythos - para buscar esas vulnerabilidades, y parchearlas lo antes posible. 

4.- Auditoría de los Modelos de Frontera 

La última parte de la orden tiene que ver directamente con los Modelos de Frontera de IA que se van a utilizar con todo este proyecto, donde se insta a que se haga un Benchmarking de auditoría completo para saber cuáles son los modelos que, en función de las necesidades anteriormente descritas cumplen o no cumplen los requisitos que se les demandan.
Como podéis ver, habla en todo momento de Secure Frontier Model, porque son conocidas las debilidades y por tanto hay que poner en valor su robustez, y el despliegue seguro que se haga de los mismos con guardarraíles para tener entornos securizados.

Los plazos

Lo más llamativo, son los plazos. Se habla de 30 días y 60 días en todas las aciones demandadas, lo que muestra y evidencia el nivel de preocupación que el gobierno de los Estados Unidos tiene con el impacto de la IA en la Seguridad Nacional a todos los niveles. Os dejo esta charla de finales del año pasado - pre- Mythos -.


Figura 10: Inteligencia Artificial y Ciberseguridad

La pregunta que me surge es ¿haremos lo mismo en Europa pronto? ¿Lo haremos en todas las empresas en Europa pronto? Como se suele decir. "Clock is ticking".

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares