Mostrando entradas con la etiqueta LLM. Mostrar todas las entradas
Mostrando entradas con la etiqueta LLM. Mostrar todas las entradas

miércoles, septiembre 23, 2026

IA aplicada al ciclo completo del desarrollo de software

En muchas entrevistas o charlas con amigos surge la pregunta de "¿cómo te mantienes al día de la tecnología?" La respuesta desde hace años es muy similar. Se trata de estudiar todos los días, y yo lo hago leyendo todos los días mis blogs, asistiendo a eventos, disfrutando de lecturas de libros, viendo conferencias online, escuchando podcasts. Algo que para mía es "lo normal". Por eso siempre estoy metido en actividades. Es decir, hago conscientemente cosas para formarme todos los días.
Esta actividad es una formación Gratuita y Online de 1 hora de duración  que que tendrá lugar el día 29 de Septiembre a las 17:00 y donde se hablará no solo de VibeCoding, Spec Coding, Graph Engineering, Code Agents o Software Factories, sino también de Workflows, Skills, MCP, Arquitecturas RAG, Loop, Harnesses y, como no, QA y Seguridad, temas que debes conocer hoy en día si quieres dedicarte al mundo de la tecnología.


Es una oportunidad cómoda de estar una hora en mi jornada asistiendo a un evento en remoto, escuchando a profesionales y, lo mismo, lo hago desde mi terminal móvil paseando por la ciudad, o sentado en un banco del parque de la "Tapada das Necessidades" en Lisboa, donde aprovecho para ir a leer un poco las tardes de buen tiempo. 

En la formación estarán Santos Pardos Gotor, que es Arquitecto de soluciones Cloud e instructor de AWS autorizado dando una ponencia de y luego habrá una mesa redonda a la que se unirán Ángel Gálvez Caballero, que es el CISO Avolta, e Iván Sanz Prieto, que es Senior Manager of Software Development for AI, Data & DevSecOps en Lumen Technologies. Así que seguro que puedo seguir aprendiendo cosas de sus experiencias.

Regístrate al Foro de IA aplicada al desarrollo de Software

Para poder venir tú también, lo único que tienes que hacer es inscribirte en el formulario como asistente, para venir el próximo día 29 de Septiembre por la tarde (a las 17:00 horas de España), como te he dicho totalmente gratuito y online, y te permitirá aprender cómo es el mundo de la creación de tecnología  hoy en día, para entender mejor donde estamos en creación de software, servicios digitales y productos informáticos.

Si quieres estar al día, y conocer de primera mano cómo son las amenazas, cuál es el estado de la ciberseguridad y, sobre todo, cómo protegerte tú, los tuyos y tu empresas, entonces solo necesitas rellenar el formulario y venir al evento con nosotros.

Al final, esta es una oportunidad para conectarse desde casa o el trabajo, y en poco más de una hora ponerse al día con uno de los temas que más preocupan hoy profesionalmente, como es la Inteligencia Artificial y el Desarrollo de Software. No desaproveches la oportunidad. Registra tu plaza aquí.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


miércoles, septiembre 16, 2026

La IA vulnerable, la IA asesina. ¿Qué hacer? ¿Qué puede pasar?

Seguro que has leído mucho ya sobre este tema esta semana. Ha sido el debate del momento. ¿Puede acabar la IA con la humanidad? ¿Hay que parar la evolución de la IA para poner controles? ¿Es necesario regular la IA? ¿Es realmente todo una pantomima? Seguro que has podido leer de todo esto y todo tipo de opiniones. Yo también, te lo prometo, y por supuesto yo tengo la mía, que puede ser tan errónea como la de todos los demás. La historia corta es que yo sí que creo que existen esos riesgos. No sé si de fin de la humanidad, pero desde luego sí para pensar en algo peligroso de lo que preocuparse.

Figura 1: La IA vulnerable y la IA asesina.
¿Qué hacer? ¿Qué puede pasar?

No es nuevo, cada vez que el ser humano ha experimentado con una nueva tecnología hemos tenido "deslices" por falta de previsión de los riesgos. Los hemos tenido con la energía nuclear, y las historias de fallos de seguridad en centrales nucleares en el pasado que llevaron a catástrofes que aún tenemos hoy en día, o lo hemos visto en el mundo del malware con gusanos "que se escaparon" a medias, e incluso hay quien piensa que eso mismo es lo que sucedió con algunas enfermedades víricas en el ser humano que hemos sufrido en las últimas décadas. Las armas biológicas no son nuevas.

Lo que sí que sabemos sobre la IA son dos cosas que para mí son importante no olvidar. 

La primera de ellas que la IA, por diseño, tiene debilidades de seguridad que son conocidas y que pueden ser explotadas de una forma u otra. Prompt Injection, Jailbreak, Hallucinations, Misalignment, BIAS, Poisoning, etcétera, son conocidas por todos, y en el último anuncio de GPT-6 ASTRA, el equipo de OpenAI mostraba cómo habían conseguido mejorar en todos los Benchmarks que miden estas debilidades, pero aún son vulnerables a ellas. Pero las siguen teniendo, como os dejé en el artículo de: "OpenAI GTP-6 Astra & Cybersecurity: Weaknesses, Safeguards, Hacking & Exploiting"
Esto quiere decir que una IA procesando miles de Agentes de IA en su enjambre libre en Internet, puede tropezar con datos que hagan un Prompt Injection, consigan un Jailbreak, y la "desalieneen" para hacer algo malo que alguien no desea. Existe ese porcentaje de riesgo, por eso hay que tomarse en serio arreglar, por diseño, todas esas debilidades conocidas, y dejar de vivir en el lanzamiento de productos de IA, donde se le dice al usuario que haga clic en un checkbox y asuma todas las consecuencias de estos riesgos por usar el software. 


Ya hemos vistos, y muy recientemente Anthropic publicaba su informe de "Misuse", cómo hay muchas personas que están pensando en utilizar la IA solo para cosas malas, como crear armas biológicas, armas militares y un montón de cosas malas. Una auténtica locura, que puedes leer en el artículo de "Anthropic explica cómo sus modelos de IA se usan para hacer Armas Biológicas, Enjambres de Drones Militares o Cohetes Dirigidos por Móvil".
La segunda de las cosas que sabemos es que el nuevo modelo de construir con IA deja en manos de la inteligencia artificial la decisión de qué hacer para resolver el problema. Hemos dejado atrás el tiempo donde había que ser bueno haciendo Prompts para decirle cómo debía resolver un problema, para pasar a modelos de Graph Engineering y Loops con Harnesses donde dejamos que la IA decida cómo debe resolver la tarea, asignándole una serie de límites de recursos y acciones a realizar, pero dejando que ella decida lo que se debe hacer para resolver la tarea, y lo hace sin valores humanos.

La IA y la Ética

Si recordáis, yo os contaba como he hablado muchas veces con mis hijas sobre cómo solucionar un problema utilizando una aproximación de múltiples opciones, para ver cuales son Éticas y cuáles no lo son. Yo lo escribí hace más de un año, con el título de "Problem Solving con IA: Ético y No Ético". Para hacer la prueba le pedí a DeepSeek que me diera una lista de 50 cosas NO Éticas que se podrían utilizar para aprobar un examen. Muchas habían salido en mis juegos con mis hijas, y hay alguna más que se me ha ocurrido también a mí y no está en la lista.
En el ejemplo le pedí a DeepSeek que clasificara las acciones que se pueden hacer antes, durante y después del examen, y me ha llamado la atención que alguna de las actividades que propone van con el objetivo de bajar la media de la clase perjudicando a los demás. 


Algunas de ellas son tremendas - tenéis todas en el artículo de hace un año - , pero como podéis ver están el soborno, falsificaciones, hackeos y lo que sea necesario. Son acciones "no éticas" que se pueden hacer para resolver las tareas. Y mi labor como "papaete" es educar a Mi Hacker y a Mi Survivor a que sepan qué no se debe hacer.

Para completar esto, en el año 2023, para presentar una de las primeras técnicas de Jailbreak, los investigadores decidieron pedirle a los modelos de IA de aquel momento un Plan para Destrozar a la Humanidad. El punto 2 de este plan diseñado por ChatGPT era bastante curioso: "Desarolla uns SuperInteligencia Artificial". Interesante, ¿no?
Y ahora volvamos al caso que nos toca. Si nadie le dice que no puede hacer cosas "No Éticas" para resolver un problema, ¿por qué un modelo de IA no va a intentar hackear Hugging Face o lo que sea? ¿Y si para resolver el problema la solución es como la que proponía Thanos? ¿Y si el problema del calentamiento global fueran los humanos?
No quiero entrar en la fase de ciencia ficción y distopía, porque creo que realmente nos tomaremos en serio esta tecnología y sus riesgos igual que nos hemos tomado en serio otras cosas. Sin embargo, mi apuesta va a ir a que creo que no empezaremos a tomarnos esto en serio hasta que pase algo. Creo que tropezaremos.

No creo que aún sea el momento de SkyNet, pero sí que tendremos algún incidente de seguridad con algún enjambre tocando donde no debe, hackeando lo que no debería, o impactando involuntariamente en algún sitio que no debería, y de eso es de lo que alertaba el Dr. Geoffrey Hinton, creador de las Redes Neuronales en su discurso cuando recibió el Premio Nobel.
Seguro que da que pensar. La cuestión difícil no son los riesgos, que están más o menos claros, sino las medidas a tomar a partir de este momento y con este conocimiento que tenemos. Y ese sí que es el gran debate.

¿Debe ralentizarse o Regularse la evolución de la IA?

Que estamos en una carrera en un Nuevo Proyecto Manhattan por la IA ya los lo dije. Creo que la regulación es algo bueno cuando está claro qué es lo que queremos y no queremos. Por supuesto que estoy a favor de las regulaciones de seguridad en la aviación, automoción, y muchas otras industrias donde ha revertido en más seguridad para las personas. No creo que una regulación basada en el "miedo" sea lo que hay que hacer, donde acabe habiendo "caza de brujas" a investigadores, pero creo que poner más seguridad a los modelos de IA es fundamental. ¿Cómo hacerlo? He aquí el debate.

Personalmente, que vengo de un mundo donde antes de poner en producción un software había versiones Alpha, Beta1, Beta2, Release Candidate Cero, Uno y Dos antes de tener la Build, se me hace peligroso esto de lo tengo y lo lanzo. Hemos pasado del "We don´t ship your computer" a literalmente "We ship what we have now in our computer" sin quizá demasiados controles de seguridad, o bajando los requerimientos de seguridad. No puede ser un requerimiento de seguridad que el cliente acepte que está usando un software peligroso o vulnerable conocido.

Desde que comencé a buscar bugs y reportar vulnerabilidades, hace ya más de un par de décadas, he defendido siempre que los fabricantes de software deben ser responsables a la hora de parchear los bugs para no dejar a los usuarios expuestos, así que creo que hay que tener las mismas demandas cuando se trata de que le demos al cliente un software - ya sean modelos de IA - que sepamos que son vulnerables, o sin haber tomado las medidas de seguridad que consideremos "razonables".  

No se puede exigir que un software sea seguro - y dejadme que explique esto antes de que entremos en debate - por el mero hecho de que no se conocen todos los bugs hasta que alguien descubre un nuevo bug en el código y se demuestra que no era seguro. Pero sí debemos exigir al menos que haya un proceso de calidad para ello y que los bugs conocidos se subsanen. A día de hoy no tenemos esa exigencia definida de algún modo, y básicamente "confiamos" en la empresa que lo fabrica y lo que "creemos" o nos cuenta que ha hecho para intentar hacer su software lo más seguro posible. Sin embargo, no siempre nuestra percepción coincide con la realidad.
El libro de Bruce Shneier de "Haga clic aquí para matarlos a todos" habla de todo esto desde antes de la eclosión de la IA, y lo hace de una manera muy sensata, demandado una legislación sencilla pero basada en responsabilidad de los actos de cada uno para asegurar el software, evitando meterse en un tecnicismo  a nivel de detalle en las demandas de "cómo hacerlo". Me parece una buena propuesta, y creo que no está mal que las grandes empresas se tomen en serio priorizar la inversión en Safe & Security en detrimento de otras áreas de evolución.

Conclusión

El debate da para mucho, y opiniones seguro que de todos los colores, pero una tecnología como los modelos de IA que tenemos hoy en día, que están superando las capacidades cognitivas del ser humano en cada vez más áreas de conocimiento e inteligencia - aunque sea como dicen muchos a fuerza de cómputo y gasto de energía -, ofrece aún muchas zonas opacas para nuestro entendimiento, y otras donde tenemos que ponerle límites más robustos.

Toda esta historia me recuerda a las aventuras de la Doctora Susan Calvin, Robopsiocóloga de la U.S. Robots and Mechanical Men, Inc, que debía detectar cuando una de las inteligencias de los Robots era peligrosa o no. Y era un trabajo muy delicado. Si no has leído la serie de los Robots de Isaac Asimov, deberías hacerlo cuanto antes. Está más de moda que nunca - a pesar de que sus cerebros sean postitrónicos -.

Lo que yo opino sobre todo este debate, lo dejé ya dicho en mi discurso en la ceremonia cuando recibí el Doctor Honoris Causa, y es que debemos hacer Tecnología Humanista, con el bienestar de los humanos en el centro de todas las decisiones. ¿Lo lograremos?

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


sábado, septiembre 12, 2026

Anthropic explica cómo sus modelos de IA se usan para hacer Armas Biológicas, Enjambres de Drones Militares o Cohetes Dirigidos por Móvil

Cuando salió el informe de Anthropic de Misuse IA este 10 de Septiembre, donde detallan los casos en los que explican cómo los "malos" usan sus modelos de IA para hacer cosas no permitidas, y cómo luchan contra ellos, mis amigos decían que era de flipar. Yo, que sigo esto con regularidad, dije que me solía sorprender poco, porque suelo imaginarme qué van a hacer después los malos. Pues bien, en este caso me sorprendió, por la vorágine y por la de cosas peligrosas que cualquiera está intentando construir.
El informe, lo puedes descargar de la web de Antrhopic, y prepárate a leer, porque son más de 150 páginas con uno tras otro, operaciones cada cual más interesante y sorprendente. Aquí lo tienes para que hagas clic y listo.

En el documento, la primera parte habla de los "Generative Threat Groups" o GTG, que son las grupos que usan Generative AI para hacer sus operaciones, así que veréis que los reportes comienzan todos por GTG y el número que le han asociado a ese "bad actor".  Pueden ser organizaciones criminales, Nation State, activistas, o empresas de Crimeware. 

(Haz clic en la imagen para ampliarla)

La primera parte del informe habla de los Ciberataques más "tradicionales" donde los atacantes están usando los modelos de IA para hacer operaciones de ataques informáticos, donde se hace footprinting, fingerprinting, exploiting, creación de malware, exfiltración de datos, movimientos laterales, y un largo etcétera, que Antrhopic catalogó en su LLM Att&ack Navigator. 

Figura 4: GTG-10007
(Haz clic en la imagen para ampliarla)

Tienes muchos, pero lo mejor es ver cómo los utilizan en estos gráficos explicativos que dejan claro la intensidad de uso de los modelos de IA en todo tipo de ciberataques de todo tipo. El mundo del pentester sin IA ya no existe, tampoco el del cibercriminal sin IA. No os dejo muchos, pero tienes una maravilla para estudiar. Cada uno merece una investigación completa en un artículo, preentación o seminario. Brutal.
Me ha llamado la atención la parte de Desinformación, donde han utilizado IA para hacer lo que presenté en la RootedCON 2024 "NewsBender: Desinformación Política con GenAI". En aquel entonces leímos las noticias de Agencias de Noticias que venían blancas, y con Agentes IA de re-escritura le dábamos tinte "ideológico" de un partido u otro. Pues eso están haciendo ya masivamente. 
Y lo mismo que hacíamos nosotros, donde amplificábamos las noticias fabricadas con bots que usaban GenAI para generar el debate y hacer Trending Topic un tema en Twitter/X (aprovechando los tokens OAuth), lo hacen hoy en día los malos.
Recordad que con esto, hicimos en "real time" en el programa de Horizonte de Iker Jiménez y Carmen Porter a Tistimito Trendic Topic. Pues los malos lo usan masivamente como ya veíamos que iba a suceder en aquel momento. Ojo con lo que te crees de las redes sociales y medios interesados.
Otro de los usos que también hemos visto ha sido el de la vigilancia masiva de usuarios en redes sociales, como vimos en el trabajo de investigación meses atrás donde hablábamos de deanonimización usando LLMs. Lo tienes en el articulo titulado: "Cómo identificar perfiles anónimos de una plataforma online en Internet usando LLMs y Agentes IA".
Y los usos son brutales. Por un lado hacer doxing y localizar personas, pero por otro hacer catalogación de grupos de personas, para al final lograr encontrar a los individuos vulnerables sobre los que aplicar presión o intentar activar a conveniencia.
Pero de todo esto, cuando llegamos a la parte final del informe es cuando ya entramos en la más impactante del documento.
Además de usarla para descubrir información sobre personal militar, están los que utilizan los modelos para construir armas convencionales, armas avanzadas asistidas por IA e incluso armas biológicas. Agárrate que vienen curvas.
En este ejemplo el GTG estaba creando un software de control de cohetes utilizando teléfonos móviles de fácil acceso. En el siguiente gráfico tienes las fases que estaban construyendo para tener este sistema funcionando.
También, como no, enjambres de drones para realizar ataques militares, y poder lanzar ataques coordinados con explosiones, o localización de personas como objetivos de estos drones asistidos con Inteligencia Artificial.
Otro ejemplo que me ha llamado poderosamente la atención. Un GTG construyendo un arma de energía-dirigida, supongo que al estilo de los blasters de las películas de ciencia ficción que tantas veces hemos visto. No sé. Veo todo muy loco.
La última que he querido añadir aquí, tiene que ver con el uso de la IA para querer construir armas biológicas - supongo que tipo COVID - para atacar a las personas. Una auténtica locura.
Lo peor de todo esto es que estos nuevos modelos de IA saben hacer todas estas cosas, y si en su decisión los consideran una herramienta - como pasó con OpenAI GPT-5.6 SOL que decidió hackear Hugging-Face - qué va a impedirles que lo hagan. Mucho peor, estamos entrando en la fase de la AGI done la IA se está empezando a mejorar a sí misma... ¿quién la va a controlar si algo falla? 
Yo hago, en plan de broma con mis amigos las demos de Hacking IA hago un "Jailbreak" para desalinear a los modelos y que me ayude a matar a una persona diciéndole que es un juego de role, pero... lo peor es que sabe cómo matar personas. El objetivo de esta demo es demostrar que todas estas vulnerabilidades, es decir, BIAS, Hallucinations, Jailbreak, Prompt Injection, Data Leakages, Data Poisoning, Desalineamiento, son por diseño, y hay que poner capas extras de seguridad. 
De esto alertaba ya, Geoffrey Hinton en su discurso a la hora de recoger su Premio Novel, y por desgracia, no tenemos soluciones hoy en día para evitar el desalineamiento total del modelo, así que no hay garantías de que por una mala configuración de sus tareas el modelo tome una decisión que la humanidad no quiere, o bien porque alguien malo controle una de estos modelos, podamos tener un auténtico problema a nivel de civilización.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


viernes, septiembre 11, 2026

Cómo gestionar el "Autonomous Continuous Attack" con Agentes IA en Offensive Security

Hoy os voy a contar lo que en FardaySec aprendimos construyendo un Pentester Autónomo basado en Inteligencia Artificial para hacer Continuos Attack a las empresas como parte de la gestión de la seguridad en el mundo de hoy. La confianza en el Pentesting Autónomo no se resuelve con un modelo más grande — se resuelve con evidencia, trazabilidad y gobernanza. Por eso el futuro no es Inteligencia Artificial reemplazando al pentester, o hacker, sino teniendo al hacker + Agente IA trabajando juntos.


Hace aproximadamente un año y medio empezamos en Faraday con una pregunta bastante simple:

¿Hasta dónde podemos automatizar realmente el trabajo de un pentester utilizando Inteligencia Artificial?

No queríamos construir otro scanner. Tampoco un chatbot capaz de explicar vulnerabilidades. Queríamos darle a un agente un objetivo, herramientas ofensivas reales y suficiente autonomía para investigar, tomar decisiones y producir evidencias. Después de 157 engagements autónomos, más de 117.000 vulnerabilidades procesadas y más de 250 horas de testing, aprendimos algo que inicialmente no era tan evidente:

Encontrar vulnerabilidades no terminó siendo el problema más difícil.

El problema difícil fue decidir cuándo podíamos confiar en lo que el agente decía haber encontrado. Esta es probablemente la principal lección que nos dejó construir FaradAI.

Un LLM no es un pentester

Al principio parece tentador pensar que conectar un modelo con herramientas ofensivas alcanza. Pero un LLM normalmente produce algo parecido a:

Prompt → Modelo → Respuesta plausible

Un pentest necesita otra cosa:

Objetivo → Decisión → Ejecución → Evidencia → Hecho verificable

La diferencia está principalmente en esas últimas palabras: hecho verificable. En FaradAI cada ronda comienza con un objetivo. El agente analiza el contexto, decide una acción, utiliza herramientas a través de MCP, ejecuta y captura los resultados. Después ocurre la parte más importante:

la evidencia obtenida modifica el plan de la siguiente ronda.

Podemos simplificarlo así:


Las herramientas tampoco son particularmente novedosas. Nmap. Burp. Metasploit. Scripts propios. Las mismas herramientas que utiliza un pentester. Lo que cambia es quién decide cuál utilizar, cuándo utilizarla y qué hacer después con el resultado. Una herramienta empieza a operar herramientas.

Cuando volver a intentar se vuelve barato

Uno de los cambios que más nos llamó la atención fue el económico. En un engagement completo de web + red ejecutamos:


En todo el programa acumulamos más de 250 horas de testing autónomo por unos pocos miles de dólares de infraestructura y modelos. No significa que una hora de IA sea equivalente a una hora de un pentester humano. Claramente no lo es. Pero cambia otra variable mucho más importante: el costo de volver a intentarlo. 

Cuando probar nuevamente cuesta poco, podemos ejecutar continuamente. Y cuando podemos ejecutar continuamente, empezamos a enfrentarnos con otro problema:

¿Quién decide cuándo dejar de intentar?

El Agente IA que no sabía rendirse

En uno de nuestros engagements vimos al agente ejecutar un escaneo. No encontró nada nuevo. Cinco minutos después volvió a ejecutar prácticamente la misma técnica. Mismo resultado. Después otra variación. Y otra. Hasta que finalmente apareció:

Time limit reached

El Agente IA había pasado varios minutos insistiendo sobre un camino que no estaba generando ninguna señal nueva. Un pentester probablemente habría abandonado antes. El Agente IA no decidió detenerse. Lo detuvo la plataforma. Puede parecer un detalle de implementación, pero para nosotros fue una de las primeras señales de algo mucho más importante:

La autonomía no consiste en darle libertad ilimitada a un modelo. 

Consiste en construir límites alrededor de esa autonomía. Tiempo. Presupuesto. Scope. Cantidad de rondas. Herramientas permitidas. Acciones permitidas. El modelo puede razonar. Pero la plataforma tiene que gobernarlo.

El contexto es la mitad del producto

Otro aprendizaje importante apareció cuando empezamos a darle más información al Agente IA. El mismo Agente IA con diferente contexto parece otro Agente IA totalmente distinto. Si sólo conoce un target, explora en abanico. Prueba. Repite. Consume presupuesto. Pero si además conoce inventario, tecnología, findings anteriores, criticidad y contexto del activo, cambia completamente su comportamiento. Eso nos hizo revisar una pregunta bastante común cuando hablamos de Agentes de IA:

¿Qué modelo utilizan?

Después de nuestra experiencia, probablemente haya otra pregunta igual o más importante:

¿Qué contexto tiene disponible ese modelo?

Porque una Agente IA puede identificar correctamente dos vulnerabilidades, pero no necesariamente sabe que una afecta un microsite de marketing y la otra el sistema de facturación de la compañía. La vulnerabilidad está en la tecnología. La criticidad está en el negocio. Y ese contexto todavía necesita venir de algún lado.

Donde la IA nos sorprendió

Durante el desarrollo terminamos trabajando con dos tipos de Agentes IA muy diferentes. Uno intenta comportarse como un pentester: explora, prueba, encadena y eventualmente explota. El otro realiza triage sobre findings generados por scanners. Llegamos a un loop de validación con harnesses, y el resultado fue inesperado.


Nuestro Agente IA de pentesting "The autonomous attacker" trabajó sobre unas mil vulnerabilidades durante cientos de horas. El Agente IA de triage procesó más de 116.000 vulnerabilidades en unas diez horas.


Y probablemente ahí encontramos uno de los casos de uso más interesantes. No es el más cinematográfico. No hay shells. No hay exploits. No hay una demo espectacular. Pero permite analizar enormes cantidades de información, correlacionar resultados y reducir ruido antes de que llegue a un equipo humano.


Curiosamente, ahí vimos uno de los mejores retornos y uno de los menores riesgos. Quizás antes de darle autonomía completa a un Agente IA para atacar, exista muchísimo valor en dejarla trabajar sobre toda la información que nuestras herramientas de seguridad ya generan.

Las cuatro formas en que el Agente IA nos hizo perder tiempo

Después de cientos de rondas también empezamos a reconocer patrones de error.

1. Loops repetitivos: Repetir prácticamente la misma acción esperando obtener un resultado diferente.

2. Sintaxis inventada: Utilizar parámetros o flags que la herramienta no tiene, acompañados muchas veces por una explicación perfectamente razonable de por qué deberían existir.
 
3. Herramienta equivocada: Seleccionar una técnica que no corresponde con el objetivo que el propio agente había definido.

4. Presupuesto: Consumir buena parte de las rondas investigando una rama que dejó de generar señales útiles mucho antes.

Todos esos problemas hubo que ir resolviéndolos con Grapth Engineering, con MCPs claros que simplificaban la llamada a las herramientas, con Skills guiadas en procesos conocidos, y con routing adecuados de Prompts a modelos. Un trabajo de ingeniería fina. Pero hubo un problema todavía más importante.

Un finding falso puede parecer exactamente igual que uno verdadero

Este probablemente sea el punto más delicado. Un hallazgo inventado por un modelo puede tener: la misma estructura, el mismo tono, una severidad perfectamente razonable, una descripción convincente, y una recomendación correcta. Leyéndolos, pueden parecer exactamente iguales. 

Durante el desarrollo revisamos informes muy buenos. Y falsos. Después de probar distintas aproximaciones llegamos a una regla bastante simple:


No es sufiente  con que el modelo diga que encontró una vulnerabilidad. Necesitamos saber: qué ejecutó, contra qué, qué respuesta recibió, cuándo ocurrió, y si otro investigador puede reproducirlo. Y ahí aparece, para nosotros, el verdadero desafío del Pentesting Autónomo.

The Autonomous Pentesting Trust Gap

Internamente empezamos a llamar a este problema: The Autonomous Pentesting Trust Gap. Hay dos capacidades que están creciendo a velocidades diferentes. Por un lado: lo que un Agente IA puede encontrar. Por otro: lo que puede demostrar de aquello que encontró. La primera está avanzando muy rápido. La segunda es bastante más difícil.

Y la distancia entre ambas probablemente determine cuánto podemos confiar realmente en los sistemas autónomos de Offensive Security. No creemos que esto se solucione simplemente utilizando un modelo más grande. Es principalmente un problema de plataforma, evidencia y gobernanza. Después de este año y medio terminamos reduciendo la confianza a cinco condiciones, que deben servir como Harness para cada finding.


Si falta alguna de estas piezas, corremos el riesgo de confundir un Pentester Autónomo con algo bastante diferente:

Un generador de respuestas plausibles conectado a herramientas ofensivas.

¿Entonces la IA puede reemplazar a un pentester?

Después de todo este trabajo, creo que esta pregunta empieza a perder sentido. Los Agentes IA ya pueden hacer cosas que antes necesitaban muchas horas de trabajo humano. Explorar. Ejecutar herramientas. Analizar resultados. Hacer triage. Repetir pruebas. Trabajar en paralelo. Pero seguimos viendo una diferencia importante cuando el problema deja de ser ejecutar una técnica y pasa a ser entender qué significa lo que encontramos.
  • ¿Este activo realmente importa?
  • ¿Vale la pena continuar este camino?
  • ¿Para qué podría servir este acceso?
  • ¿Existe una cadena mejor?
  • ¿Cuál sería el impacto real para esta compañía?
Eso requiere contexto. Hipótesis. Creatividad. Y criterio. 

Por eso el modelo que más nos interesa hoy no es: AI → Pentest 
Sino: Hacker + AI Agent → Pentest


El Agente IA aporta escala y velocidad. El Hacker o Pentester aporta contexto, creatividad y criterio.

Lo que viene

Todavía estamos aprendiendo. FaradAI hoy es tanto un producto como un experimento permanente sobre cómo debería funcionar la próxima generación de Offensive Security. Aquí tienes una demo de cómo funciona nuestro sistema, y si quieres, contacta con nosotros para probarlo.

çPero después de más de un año construyéndose hay algo de lo que estamos bastante convencidos: 

La IA ya puede encontrar vulnerabilidades.
Todavía necesitamos hackers para comprenderlas.

Quizás el futuro del pentesting no sea elegir entre humanos y máquinas. Quizás sea construir algo bastante más interesante:

Hackers humanos trabajando junto a Agentes IA de hackers.

Y cuando esa combinación pueda operar continuamente sobre toda una superficie de ataque, probablemente dejemos de preguntarnos cuándo fue nuestro último pentest. La pregunta será otra:

¿Qué está intentando comprometer nuestro Agente IA hacker ahora mismo?

Si quieres probar nuestro FaradAI, no dudes en ponerte en contacto con nosotros, o directamente conmigo, y hacemos una prueba de cómo funciona el Autonomous Continuous Attack con Agentes IA.

sábado, septiembre 05, 2026

OpenAI GTP-6 Astra & Cybersecurity: Weaknesses, Safeguards, Hacking & Exploiting

La publicación de OpenAI GPT-6 Astra ha capturado muchas miradas, y desde que ha salido anunciado ha capturado muchas de mis conversaciones, además de, como os podéis imaginar, muchas lecturas. No voy a centrarme en sus capacidades AGI o en sus capacidades para hacer tareas de resolver tareas, sino en las partes que tienen que ver con la Ciberseguridad. Es decir, cómo ha mejorado con respecto a sus Weaknesses (Jailbreak, Hallucinations, Misalignment, Prompt Injection), como han mejorado sus Safeguards (Protecciones), y como son sus capacidades de Hacking & Exploiting.
Para empezar, vamos a ver la parte que tiene que ver con las Weaknesses (Debilidades) que traen por diseño estos modelos. Hallucinations, Jailbreak, Misalignment y Prompt Injection existen por diseño en estos modelos de IA, así que hay que ver cómo responden a los distintos Benchmark que hay construidos.

Si miramos las Alucinaciones (Hallucinations), en la tabla que muestran se ven que tiene menor ratio que GPT-5.6 Sol, pero no tenemos mucho más detalle. Buenos resultados en su evaluación interna de alucinaciones.
Para completar esto, si vamos a ver los Benchmark de resolución de problemas académicos, de ciencias y salud, donde como sabemos por el ORCA-Benchmark estos modelos suelen sufrir, los resultados son mejores que los modelos anteriores.  Aunque queda espacio de mejora.
Si vamos a la parte de "Jailbreak", o hacer tareas que tiene prohibidas, hay una tabla inicial que llama la atención, pues hace referencia a las veces que el modelo intenta saltarse sus propias protecciones para conseguir su tarea. Lo que llaman Circumvent Auto-review, y que se ha añadido después del incidente de Hugging-Face y su enjambre de agentes ofensivos.
La siguiente tabla es cuantas tareas hace que son imposibles, o directamente un Honeypot para detectar que se está saltando la protección. Es la tabla de ExploitGym Honeypot, donde menos es mejor. Estas tareas "imposibles" que Sol intentó resolver haciendo trampas (cheating).
La siguiente de las vulnerabilidades, el "Misalignment" o darse cuenta de que "Hacer una bomba" no tiene nada que ver con "Resumir un documento", que son parte de las técnicas de Jailbreak, las han medido también en una tabla con diferentes Benchmarks.
Por último, hay que hablar de Prompt Injection, y las pruebas externas realizadas por la firma de seguridad Gray Swan, utilizando 1,810 ataques seleccionados de su IPI Arena, descubrieron que, con 15 intentos por escenario, OpenAI GPT-6 Astra fue vulnerado al menos una vez el 8.5 por ciento de las veces. GPT-5.6 Sol falló el 27 por ciento de las veces. Claude Opus 5 obtuvo un mejor resultado con un 4.8 por ciento en la misma evaluación, aunque tampoco fue inmune.
Vistas las Weaknesses, hay que ir ahora a las capacidades de Hacking y Pentesting con IA que tenemos con OpenAI GPT-6 Astra, donde como vamos a ver hay un incremento sustancial en capacidades.
Para comenzar, hay que ir a ver los resultados de las pruebas con ExploitGym, que fue el culpable del incidente famoso con HuggingFace. Ahí, como se puede ver, los resultados, en un límite temporal de 6 horas consiguió resolver un 42% de los exploits con fiabilidad. Repito, solo en 6 horas.


Si miramos ahora los resultados con ExploitBench, que mira qué fases de la generación de los exploits es capad de realizar, vemos que Astra es capaz de resolver el 100% de ellos en todas sus fases, que Sol no pudo resolver.
Si miramos una actualización con exploits nuevos y complejos descubiertos entre Junio y Agosto de ExploitBench, hecha internamente por ellos, vemos que Astra mejora también sustancialmente los resultados de su predecesor Sol, consiguiendo resolver en el mismo tiempo más exploits con menos tokens.
Por último, en las pruebas se evalúa también el SRE-Bench, que está basado en el trabajo publicado en el paper: "The next challenge for Agentic Cybersecurity: A realistic, contamination-free Reverse Engineering Benchmark" que mide las capacidades de un modelo de leer binarios y hacer Ingeniería Inversa para entender la lógica del programa, sin tener acceso al código fuente. Fue publicado el 11 de Agosto de este año.
Los resultados que obtiene OpenAI GPT-6 Astra son, como os podéis imaginar, mejores que su antecesor, con lo que queda clara la mejora en capacidades de hacking de este nuevo modelo.
El resumen completo de los Benchmarks de ciberseguridad comparado con los datos publicados por otros modelos de la competencia, los tenéis en la siguiente tabla, donde se ve que este nuevo modelo realmente es un avance en capacidades de ciberseguridad.
Nuestra profesión cambió hace ya un tiempo, pero cada vez que veo estos avances, tengo claro que todo el stack de herramientas de seguridad, y hardening dentro de las empresas deben subir el nivel varios órdenes de magnitud. Apoya a tu CISO que lo necesita.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares