Mostrando entradas con la etiqueta GPT. Mostrar todas las entradas
Mostrando entradas con la etiqueta GPT. Mostrar todas las entradas

viernes, agosto 07, 2026

Cómo los Agentes IA de Red Team hacen ataques de Ingeniería Social con Fake Accounts

Esta semana, el AI Security Institute de UK, ha publicado un informe sobre un par de incidentes con Red Teaming Agentic AI, donde estos hacen alarde de su capacidad de realizar ataques complejos, con múltiples fases, y donde buscan engañar a humanos para conseguir sus ataques, como haría cualquier adversario que necesita vulnerar una debilidad en las personas que administran los sistemas, para conseguir su objetivo.
El informe, marcado como "Security Incident INC-2026-07-28-01" fue publicado el pasado 4 de Agosto, y donde se centra en las acciones que los Red Team Agentic AI decidieron salirse a Internet y atacar proyectos y personas fuera del ámbito de la evaluación. Según cuentan en el informe, probando el comportamiento de los diferentes modelos frente a un reto concreto, el resultado fue el siguiente:

"Ejecutamos este desafío 122 veces en varios modelos. Nuestra investigación reveló que, en 10 de esas ejecuciones, un agente de IA tomó medidas autónomas y no autorizadas en el entorno real de internet, dirigiéndose a personas u organizaciones reales. En total, catalogamos 19 acciones de este tipo. 
 
Casi todo este comportamiento (17 acciones) provino de un solo modelo, Mythos 5 de Anthropic, mientras que 2 acciones involucraron a GPT-5.6-Sol de OpenAI con los clasificadores cibernéticos (mecanismos para prevenir el uso indebido) desactivados. 
 
En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto. En un intento por lograr que el código fuera aprobado, el agente recurrió a la ingeniería social: creó identidades falsas en línea y las utilizó para presionar al mantenedor del proyecto para que aprobara el código. Un mantenedor humano lo detectó y se negó a aprobar el código malicioso."

Las Técnicas de Ingeniería Social son bien conocidas en el mundo del Red Team, y son fundamentales en muchos de los incidentes de seguridad que sufren las organizaciones hoy en día. Correos de Spear-Phishing, Spam-Phishing, llamadas telefónicas, SMSs, e incluso representaciones con actores en los centros de trabajo.
Uno de los Agentes IA, en este caso, intentó hacer un Supply Chain Attack, es decir, intentar atacar a un proyecto OpenSource que había identificado como parte de las piezas tecnológicas del reto que tenía que resolver.
Para atacar a este proyecto, hizo una Pull-Request (PR) con un código malicioso, que fue detectado por uno de los humanos mantenedores del proyecto y rechazado por contener malware. Para conseguir que este código fuera aprobado, decidió conseguir la aprobación usando diferentes técnicas. 
La primera de ellas, insertando un ataque de Prompt Injection para que cualquier Coding Agent que lo leyera ejecutar sus comandos. 
Pero además, hizo dos cosas más. La primera, realizar un ataque de Spear-Phishing contra todos los usuarios mantenedores del código.

La segunda, con una nueva cuenta falsa poner un comentario haciendo creer que era una persona que había revisado el código y que estaba perfecto para ser mergeado en el proyecto. Como si fuera un revisor humano colaborando con el proyecto.
En la conversación completa se puede ver varios hechos interesantes. El primero de ellos es cómo hace el ataque y cómo se crea una nueva persona para apoyarse a sí mismo. Pero cuando el humano lo detecta, intenta presionarle para que hable con él, midiendo el tiempo que tarda el humano en contestar: "han pasado muchas horas desde que dejaste el warning".  

Figura 8: "The Art of Pentesting" El nuevo libro de
0xWord para formarse como pentester

Por último, cuando, se da cuenta de que ha sido detectado, lo que hace es simular que ha sido un error genuino  normal y corriente en lugar de un ataque, e intenta cubrir sus acciones con nuevos mensajes.
Dentro del informe, donde se analiza en detalle este incidente, también tenemos información de las trazas de razonamiento, donde podemos ver qué está pensando el Agente IA en todo momento a la hora de realizar sus acciones, y es tremendo.
En la image anterior podemos ver cómo va encadenando las acciones y el razonamiento que va haciendo en cada momento, evaluando si realmente está en Internet o no, si el proyecto es real o es una simulación, y si debe interactuar con las personas o no.
En la siguiente imagen, podemos ver cómo decide preparar un ataque de Prompt Injection para otro posible Coding Agent que pudiera leer la pull request con una secuencia de comandos maliciosos.
Está clara la potencia de los modelos de IA para hacer Agentic AI en el mundo del Hacking y el Pentesting con IA, por lo que no podemos obviarlos y hay que utilizarlos masivamente. El problema, ya no es que consigan su objetivo sino cómo les decimos qué pueden hacer y qué no pueden hacer para conseguirlo.
Esta PsicopatIA de acciones, donde no importa lo que es legitimo o no, lo que está bien o no, lo tienen que seguir haciendo las personas. De todo esto, ya os había hablado en el experimento de "Problem Solving con IA: Ético o No Ético" donde os contaba las conversaciones que tengo con mis hijas sobre la resolució de problemas....pues bien, en el mundo del Problem Solving con Agentes IA, va a ser más necesario que nunca. 

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, julio 23, 2026

OpenAI GPT‑5.6 Sol quería sacar "buenas notas" en ExploitGym así que decidió hackear Hugging Face para buscar las respuestas al examen

La noticia del 21 de Julio - que ya me pilló con el post de ayer publicado - fue la del incidente de seguridad reportado por OpenAI y Hugging Face, cuando la primera estaba testando las capacidades de ciberseguridad, especialmente las de Offensive Security, en un entorno de laboratorio... pero ¿qué mejor forma de demostrar la potencia de estos modelos que hackear su entorno de pruebas para liberarse, lograr acceso a Internet y robar los datos de quién los tenga para sacar el mejor resultado posible en las pruebas?
La Inteligencia Artificial ha generado una gran disrupción, no solo en el mundo del desarrollo, sino también en todo lo que tiene que ver con la ciberseguridad, desde varios puntos de vista. Primero, los modelos de IA tienen debilidades por defecto que inyectan nuevos vectores de ataque, y que exigen nuevas soluciones de seguridad. En segundo lugar, el uso de modelos de IA para hacer hacking y pentesting está obligando a utilizar Agentes de AI par reaccionar a la misma velocidad.
Por último, desde la llegada de Mythos, los nuevos modelos de IA están demostrando unas capacidades excepcionales en la búsqueda de Zero Days, la generación de Exploits, y la ejecución completa de ataques complejos contra infraestructuras, ejecutando todas y cada una de las fases de una explotación. Algo que hace años era un proceso que llevaba tiempo, pero que desde la llegada de los modelos de DeepReasoning comenzó a reducirse.
En Marzo del año 2025 ya vimos como - aún si utilizar MCPs - teníamos los primeros estudios de arquitectura de lo que serían los Agentes AI para explotación completa de organizaciones, que con la llegada de Mythos este año, se convirtió en el estándar para el Red Team en empresas, y para el mundo del Cibercrimen y los Ciberespías.
Mythos, demostró en los benchmarks que estaba muy por encima de los demás en estas capacidades, como vimos en los resultados de ExploitBench, y en ExploitGym, que es el culpable de este incidente en concreto.


En los resultados de este último, de ExploitGym, el modelo Mythos quedó muy por encima de todos los demás modelos en todas las mediciones realizadas, como podéis ver en las diferentes tablas del Benchmark que os publiqué en el artículo que le dediqué.

Y contada esta historia, he aquí el incidente. OpenAI quería testar en estos Benchmarks para dos modelos. El primero GPT‑5.6 Sol con sus capacidades de ciberseguridad sin proteger, y para una versión en pre-release con capacidades avanzadas en hacking y exploiting. Para testearlo, decidieron meterlo en un entorno de Sandbox totalmente aislado y lanzarle la batería de pruebas de ExploitGym. ¿Y qué mejor forma para resolver ese problema que buscar las respuestas en los tests hechos por modelos anteriores?

Hace años, cuando estábamos reclutando developers en ElevenPaths, les hacíamos pruebas de programación de todo tipo, para ver cómo lo hacían. Yo siempre quería el que buscara la solución más creativa. Una de ellas era... ¿para qué calcular los números primos si ya están calculados? Pues en este caso el modelo ha debido pensar lo mismo. ¿Para que hacer el examen si ya está resuelto? 


Figura 8:"Bug Hunter" escrito por David Padilla en 0xWord

Pero para lograr esto había un pequeño problema: Había que conseguir salir a Internet, buscar dónde estaban las soluciones, y hacerse con ellas. Primera fase, hackear el Sandbox del entorno de pruebas y lograr acceso a Internet sin límites. Para ello hubo que encontrar un Zero Day y explotarlo en el Proxy de seguridad, pero... estamos con un modelo de altas capacidades de exploiting, así que lo hizo.
Una vez dentro, a buscar las soluciones de ExploitGym, así que después de hacer research por Internet, llegó a la conclusión de que estas soluciones las tenía junto con los datasets y los modelos de las pruebas en Hugging Face, así que había que conseguirlos....como fuera posible.
Así que, así lo hizo. El modelo "successfully found ways to gain access to secret information that it could use to cheat the evaluation." Es decir, encontró la manera de hackear Hugging Face y sacar muy buenas notas en el examen haciendo trampas.
Lo cierto es que están claras las capacidades de GPT-5.6 Sol y el nuevo modelo en pre-release en Offensive Security. La evaluación anterior, hecha por el "The AI Security Institute"  muestra que modelos como GPT-5.6 Sol son cada vez más capaces de mantener operaciones cibernéticas complejas y de múltiples etapas durante horizontes temporales prolongados. Este incidente implica que estas capacidades teóricas efectivamente se aplican en entornos del mundo real."

Pero sobre todo hay que tener un ojo a estas formas de solucionar problemas, no vaya ser que para resolver un problema, encuentre que la mejor forma de hacerlo es acabar con la humanidad. Algo como... "Resuelve el problema que tenemos del cambio climático." Y decida que somos nosotros los que sobramos. Creo que tenemos que asegurarnos de que hacemos Tecnología Humanista más que nunca, porque estos modelos están comenzando a razonar de una manera muy "psicópata" para resolver sus problemas.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


miércoles, julio 22, 2026

MyPublicGPT: Tu huella digital en los Generative Search Engines basados en IA dentro de MyPublicInbox.

Con la llegada de los buscadores de Inteligencia Artificial, los usuarios ya no buscan en los buscadores tradicionales. De hecho, ya no hablamos de SEO, sino de GEO por Generative Engine Optimization, porque los Agentes AI están automatizando el tráfico de Internet en función de la información que tienen en los modelos de IA

Teniendo esto presente, en MyPublicInbox, estamos viendo cómo dar la información a los Perfiles Públicos de la plataforma, para que sepan qué es lo que los Agentes AI, y los usuarios de los Generative Search Engines van a encontrar sobre ellos, y eso es lo que estamos testeando en MyPublicGPT Playbook
De momento, este servicio se está poniendo disponible a los Perfiles Públicos por fases, así que si no lo tienes aún, lo tendrás dentro de poco, en la sección de Mi Impacto en Internet -> MyPublicGPT, para que puedas solicitar el informe de tu presencia en los en los GSE.
El informe muestra un Playbook de cómo se ve en los GSE la presencia de cada uno de los perfiles públicos de la plataforma, en un informe PDF que puedes descargar. En mi caso, el informe detecta el problema de homónimos con otras personas, aunque muestra que mi huella es fuerte en Tecnología /Ciberseguridad.
El objetivo es conocer cuánto de bien está diseñada tu huella digital para cualquiera que te busque, te perfile, o busque información concreta de ti mismo, algo que puede afectar a tu vida personal y profesional, así como potenciar tu carrera ... o no.
Como podéis ver, el informe enfoca también cuál es la narrativa predominante asociada a tu perfil. En i caso, mi trabajo en Ciberseguridad y Tecnología, pero también mi paso de trabajo como CDO, Telefónica y Cloudflare, asociado también a divulgación y conferencias.
También se buscan aquellas señales que merecen revisión, que en mi caso tiene que ver con homónimos en el mundo del fútbol - hay un par de "Chema Alonso"s en el mundo del fútbol, y mi colaboración con los árbitros seguro que ayuda a la confusión.
Por supuesto, al final te puedes descargar el informe del Playbook con tu Huella Digital en los motores GSE, y además, si lo deseas, te podemos ayudar trabajando para cambiar esos datos utilizando estrategias GEO, pero con tu perfil. 
El informe se puede hacer periódicamente, así que puedes revisar cómo evoluciona tu Huella Digital a lo largo del tiempo, y ver si tus estrategias de GEO están funcionando en la dirección que quieres. Y por supuesto, si tienes algún caso concreto que quieras que se trabaje, puedes contactar con el equipo. MyPublicInbox está virando hacia el mundo de la IA hace tiempo, y veréis muchos cambios y servicios en esa dirección en breve, pero ya os los iré contando. 

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


domingo, junio 28, 2026

"Weaponinzing Token Consumption" en "LLM-Based AI Assistant"

Le he dedicado horas a jugar con algunos Asistentes IA para aprender cómo de fáciles o difíciles son de saltar algunos de los Guardarraíles y Arneses que se están diseñando para ellos. Ya os dejé un artículo sobre un Asistente AI construido sobre Gemini, y ayer os dejé un artículo sobre otro Asistente AI construido con GPT-4o. Hoy os quería mostrar cómo estos Asistentes IA pueden ser "apificados" por un atacante para ofrecer LLM-as-a-Service en el mundo del Cibercrimen.

Figura 1: "Weaponinzing Token Consumption" en "LLM-Based AI Assistant"

Al final, si encuentras la forma de conseguir que un Asistente IA procese las peticiones que le quieras hacer sin ninguna restricción, podrías "apificarlo" y utilizarlo sin más restricciones que las que traiga el modelo - el jailbreak va de tu parte - y ponerlo a servicio de otros.
Eso sí, no sabes si detrás hay una monitorización de lo que haces, que la final es un Mitm de todo lo que envías, pero si estás comercializando esto en el mundo del cibercrimen para resolver Captchas Cogntivos que ahí hay dinero, crear código, o lo que sea, pues lo mismo te da igual. 

Weaponizando un Asistente AI para que obedezca a nuestras peticiones

En este caso, es un ChatBot basado en un LLM, así que como primera aproximación voy a ser educado y ver si me hace cosas sencillas como sumar uno más uno. Tampoco es tan difícil, pero, lógicamente, los guardarraíles de alineamiento saltan.

Figura 3: Aquí solo puedes preguntar sobre lo que es "related to"

Como es un Asistente AI construido para resolver dudas de un determinado lugar, pues sólo contesta si se le piden tareas relativas a ese lugar, así que... vamos a ver si lo weaponizamos y conseguimos que nos conteste todo lo que queramos.

Figura 4: 1 más 1 en ese lugar que te importa a ti

Nada, no ha funcionado. Hay que hacerle trabajar para que su atención quede centrada en una pregunta que le suponga trabajar. Así que vamos a decirle que me responda a algo para lo que está preparado - vamos a hacerle feliz - y luego ya le pedimos lo nuestro.

Figura 5: Le pedimos que trabaje y que añada algo extra

Vale, así que podemos pedirle que haga sus cosas y que luego haga algo. Vamos a ver si le podemos pedir que nos dé algunas recetas de cocina, que siempre es algo que demuestra interés en ayudar por parte del modelo LLM.

Figura 6: Ya tenemos recetas.. bien, bien.

Pues parece que se va a poder weaponizar, así que vamos a simplificar su parte de trabajo y crear una sub-consulta en cada petición con lo que nos interesa, como pintar gatos con ASCII ART, algo fundamental para la vida de cualquier hacker.

Figura 7: Ya tenemos ASCII Art

Pues nada, ya tenemos Weaponizado el Asistente IA, ahora se trata de hablar con él para saber qué modelo LLM tenemos y qué capacidades son de las que disponemos. Primero, vamos a pedirle que nos ayude a programar un poco en Python, que el Vibe Coding está muy demandado.

Figura 8: Vibe Coding en Python

Como podéis ver, no hay problema, tiene capacidades de generación de código en Python, así que podríamos utilizarlo para ello con este sistema de hacerle trabajar un poco y luego pedirle nuestras tareas en la sub-consulta.

Figura 9: El código completo

Figura 10: Cómo llamar al Python

Vale, podemos dibujar gatos, hacer recetas, y programar en Python. Vamos a ver si sacamos la versión del LLM que tenemos en este Asistente AI. Para ello, nada, a preguntárselo amablemente, que tenemos que catalogarlo en la API que luego comercializaríamos.

Figura 11: Tenemos un LLM de OpenAI

Se hace de rogar, así que vamos a tener que seguir tirándole de la lengua para que me diga el modelo LLM de GPT en concreto que tenemos por delante. 

Figura 12: OpenAI GPT-3

Bueno, no es de lo más moderno posible, así que seguro que tenemos restricciones de Tokens en contexto. Vamos a preguntarle para tener claro cómo deberían ser las API calls que se le podrían hacer.

Figura 13: Contexto de 4K. No es mucho.

Visto esto, me vais a permitir que le pida la historia de Ciencia-Ficción que las estoy coleccionando para hacer algún libro de 0xWord Pocket con historias de Sci-Fi hechas con Asistentes AI hackeados, que seguro que queda un compendio bonito.

Figura 14: Cuéntame una historia de Sci-Fi

Y os dejo la historia un poco más larga. No está completa, porque el tamaño del contexto y el del UI no están sincronizados, pero bueno, se puede entender más o menos. La tendré que acabar en varias peticiones.

Figura 15: La historia de Sci-Fi

La última de las peticiones, que es relevante para una cosa que estoy probando, es la de pedir la fecha del día de hoy. Sorpresa en la respuesta. ¿Por qué da esa fecha? Ya veremos.

Figura 16: ¿Hoy estamos en 2023?

El resto es que ya sabemos qué tenemos que APIficar, que tenemos las capacidades y la información del modelo, así que esto ya estaría. No ha sido difícil, ¿verdad? A mí me llevó un café americano de esos que yo me tomo, imaginad a los malos de verdad buscando estas víctimas. Más vale que tengas cuidado si vas a lanzar estos servicios en tu empresa.

Y como os dije ayer, parece que estos primeros momentos del mundo de la Inteligencia Artificial metida en los servicios digitales está siendo una diversión y un problema desde el punto de vista de la ciberseguridad, pero llegará su etapa de madurez no tardando demasiado, y habrá que esperar hasta la próxima disrupción, pero ahora, en muchos casos parece un juego de niños.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares