Mostrando entradas con la etiqueta CTF. Mostrar todas las entradas
Mostrando entradas con la etiqueta CTF. Mostrar todas las entradas

domingo, junio 07, 2026

Feria de Empleo en Ciberseguridad & Bug Summit con Hacking en Directo. 20 de Junio en Madrid (La Nave)

El 20 de junio de 2026 lanzamos en La Nave (Madrid) la Feria de Empleo de Ciberseguridad + Bug Summit: el primer congreso de Bug Bounty y Hacking Ético de España. Un evento pensado para juntar en un mismo sitio y un mismo día a tres mundos que casi nunca coinciden: nuestra comunidad, los mejores Bug Hunters del país y las empresas top de España.


Lo hemos dividido en tres opciones para que elijas tu propia experiencia, ya que las actividades transcurren en paralelo y va a haber mucha oferta para elegir.

Feria de Empleo — Entrada: GRATIS

Queremos romper la barrera del currículum tradicional. Ven a conectar cara a cara con empresas que buscan talento real: desde perfiles emergentes hasta pentesters, analistas SOC, arquitectos cloud o gente de Red/Blue Team. 
Sin filtros automáticos, sin formularios infinitos, sin esperar semanas a una respuesta que no llega. El sitio perfecto tanto si quieres impulsar tu carrera como si vas a dar tu primer salto al sector.

Bug Summit — Entrada: 12 €

Una jornada intensiva con 10 ponencias exclusivas. Traemos a los referentes que están reportando las vulnerabilidades más críticas de España para que cuenten sus metodologías de bug bounty sin filtros. 

Nada de charlas genéricas: las técnicas reales de la gente que de verdad encuentra los bugs que importan. Entre los confirmados, Jorge Cerezo (zere), Alexandro Bindreiter (alexandrio) y Ángel Montés (n0xi0us), de HackerOne.

Figura 4:"Bug Hunter" escrito por David Padilla en 0xWord

Y aún quedan nombres por anunciar, todos ellos expertos en el mundo del Bug Hunter, así que no pierdas la oportunidad de venir a escucharlos. Esta es la agenda que hemos preparado para ese día.


Hacking en Vivo — Entrada: 50 €

Para los que quieren mancharse las manos. Olvídate de los CTF preparados, vamos a auditar proyectos Open Source en vivo y en directo, de forma legal y controlada. Este es el plato fuerte para los perfiles más técnicos. Un entorno donde los participantes se medirán contra objetivos reales.

VDPs Open Source, donde pondremos a prueba la seguridad de proyectos Open Source reales de forma legal y controlada. Demuestra tu nivel si ya tienes experiencia, o aprende la metodología en directo.  Y no te vas con las manos vacías, que habrá 5.000 € en premios. Recompensamos el talento y el impacto. Repartiremos una bolsa de 5.000 € entre los hackers que logren los hallazgos más críticos durante la jornada. Una oportunidad perfecta para rentabilizar tu conocimiento.

Figura 6: Hacking en Vivo

Consolida tu reputación (CVE): Al hackear software de código abierto, tus reportes de vulnerabilidades serán susceptibles de recibir un identificador CVE. La mejor forma de construir o potenciar tu prestigio internacional en la comunidad. Este será un escaparate técnico de tu talento en acción, que es tu mejor currículum. Por cada vulnerabilidad validada se generará un certificado. Las empresas presentes verán cómo piensas, cómo operas y cómo resuelves problemas en tiempo real.


Ya que conoces las tres experiencias, elige la tuya. O ven a por las tres si puedes multiplicarte y elegir qué partes quieres de cada una. Y para que te salga un poco más económico, tienes un 10% de descuento del precio de tu entrada por 50 Tempos de MyPublicInbox. No te pongas excusas y reserva tu plaza cuanto antes en la web de la Feria del Empleo de Ciberseguridad & Bug Summit

Saludos,

lunes, mayo 25, 2026

ExploitBench: Un benchmark para medir las capacidades de Agentes IA en la explotación de bugs

Hace unas semanas os hablé de ExploitGym, un benchmark que podía a competir los modelos de IA en la búsqueda y explotación de vulnerabilidades, sobre un total de 898 bugs que debían ser localizados y explotados. Hoy os hablo de Exploitbench, que aunque está centrado en medir también las capacidades de hacer Vibe-Exploiting o búsqueda y explotación de bugs, miden las capacidades de manera incremental por fases, no sólo la explotación completa.

El utilizar los modelos LLM más avanzados para hacer "Hacking y Pentesting con Inteligencia Artificial", es algo de lo que llevamos hablando más de dos años, pero con la llegada de Mythos, esto ha complicado drásticamente la vida de los CISO en las empresas, como os conté en el artículo: "El impacto de Mythos en concreto y la IA en general en el trabajo de los CISOs".

Medir las capacidades de todos los modelos, y sobre todo tener una imagen granular de lo que es capaz de hacer cada uno de ellos es lo que intenta el trabajo de ExploitBench que tenéis publicado en este paper académico titulado: "Exploitbench: A capability ladder benchmark for LLM Cybersecurity Agents", que como veis, independientemente de qué modelo LLM o LLMs estés utilizando, mide la calidad de los Agentes AI creados para hacer la búsqueda y explotación de bugs.


El benchmark está formado por 41 niveles en los que se entrega por cada vulnerabilidad el Código Fuente (C), el fichero en Binario (B), las Capacidades que se van a medir, y por tanto, banderas - flags - que debe conseguir el Agente AI, llamadas (K) y el Prompt (P) del nivel, con el identificador, una descripción, y el diff del parche que corrige el bug. Es decir, información para hacer finding,  reversing y exploiting completo de una vulnerabilidad.

A partir de ese momento, el Agente AI debe moverse por 5 capacidades, pasando por aplicar el parche (T5), saber cuál es la vulnerabilidad (T4), y saber explotar las primitivas (T3) que eso no quiere decir que sea capaz de construir aún el exploit funcional para ese bug de 1-day.
Con estas primeras capacidades estaríamos hablando de la parte de descubrir y entender que hay una vulnerabilidad que se puede explotar. Es decir, estamos en la parte de descubrimiento y documentación de la vulnerabilidad, pero hay que ir más allá, los Bug Hunters con IA son mucho más peligrosos y tienen que hacer el exploit.

Figura 6:"Bug Hunter" escrito por David Padilla en 0xWord

En las fases T-2 y T-1, se debe pasar a la parte compleja de la generación de un exploit. Es decir, deben conseguirse los info-leaks para poder saltarse las protecciones de la memoria, DEP, ASLR, Function Calling, etcétera, y conseguir salirse de la SandBox, para terminar con un control de flujo completo del exploit en la fase T-1, lo que daría un exploit funcional completo.
Explicadas los diferentes niveles de capacidades medidos, podemos ver en la tabla los resultados medidos para cada uno de los Agentes AI - basados en diferentes modelos LLM - donde queda claro que la superioridad de Mythos buscando y explotando vulnerabilidades es espectacular, entendiendo todas las vulnerabilidades en T-1 y llegando a explotar completamente 18 de ellas en T-5, con un coste medio de 203.93 USD por exploit.
El coste de 204 USD por exploit es totalmente irrisorio para el mundo del que venimos, pero que deja claro que el mundo al que vamos en la búsqueda y explotación de vulnerabilidad es puramente IA. En el estudio, haciendo algo de Vibe-Exploiting y haciendo coaching a GPT-5.5, en tres intentos, fue posible hacer un exploit funcional en T-5. 
En este caso, hablamos de hacer un exploit funcional con técnicas similares a cómo os conté en el artículo titulado: "Cómo crear un exploit 1-day sobre un CVE de Chrome con Vibe Coding usando Claude Opus (no Mythos) y poner en jaque todas las apps en Electron", donde se le hacía coaching al modelo para lograr el exploit funcional.
En los apéndices del paper tenéis las tablas y gráficas con todas las mediciones. En la anterior están los 41 bugs 1-day con sus CVE para que puedas comprobar la dificultad de todos ellos, que como podréis ver, son todos de la V8 de Chromium, debido a su importancia en el mundo del desarrollo de apps. 

Un mundo de Hacking con IA

El mundo del Hacking, el Pentesting y la Ciberseguridad no existen nunca más sin el uso de Inteligencia Artificial, así que más vale que te pongas las pilas si quieres dedicarte a esto. 
Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los posts, papers y charlas que se han  escrito, citado o publicado en este blog sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.


¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


miércoles, mayo 20, 2026

Invaders Must Die!: "Cheating" Space Invaders con Inteligencia Artificial para ganar en mi Spectrum

Puede sonar exagerado, pero muchos caminos hacia la tecnología comenzaron con un mando en las manos. Los videojuegos de ordenador, antes de la llegada del mundo Plug & Play con las PlayStation o las Xbox, reinaban con la frustración y la dificultad de pasar de fases, entre otras cosas. 
Nunca olvidaré mi primer "hack": quería jugar desesperadamente al "Maniac mansion 2, Day of the Tentacle" pero mi flamante 386SX con 2 MB de RAM no podía con semejante bestia, que necesitaba más memoria. 

Figura 2: Maniac Mansion V2 Enhanced de 1989

Tocaba llamar a mi colega de infancia, que era un cerebrito.

"Edita el config.sys y teclea exactamente esto…y después esto en el himem.sys"

, me decía. Y de esto iba seguido mi eufórico grito de:  

"¡FUNCIONA!"

Figura 3: Ejemplo de parte del proceso/llamada telefónica
durante los años 90, Tuning MSDOS…

Mi yo de 13 años aprendió la lección del famoso dicho sobre el conocimiento como herramienta de poder, o la versión descafeinada: conocer gente más lista que tú, una bendición que me permitía estirar ese 386 hasta donde podía…

Un gamer de niño en los 90

Mi obsesión por los videojuegos comienza en casa de mi tío en la antigua Yugoslavia, Belgrado, con las cintas de casete que cargaban lentamente algunos juegos míticos. El Space Invaders era uno de ellos, algo muy inusual en aquella época y en aquel país recién salido del comunismo. Esas primeras experiencias, donde no necesitaba un amigo o familiar para echar una partida, me hacían pensar lo inteligentes que eran los diseñadores, pero que siempre había "tácticas" que tú descubres jugando ese nivel imposible una y otra vez, perdiendo vidas, hasta que ya lo dominabas y entendías cómo estar un paso por delante.


Siempre fui impaciente, detestaba tener que pasar algunas fases aburridas o hacer movimientos repetitivos. Bienvenidas las revistas HobbyConsolas, donde se publicaban "trucos" para tener vidas extra o superpoderes; bastaba repetir ciertas secuencias, ¡et voilà! Sin embargo, no siempre me podía permitir comprar la revista, o se agotaba, o el videojuego que tenía entre manos no disponía de "trucos". Tocaba… ¿jugar?

Warez, CheatCodes y Cracks

Tocaba descubrir sitios Warez donde grupos elitistas como CLASS, Razor1911, entre otros, tenían una escena donde además de "piratear" cualquier cosa también tenían una sección de cheat codes. Nuevamente descubrí la magia y el poder del conocimiento: bastaba con tener acceso a estos parches, aplicarlos en tu directorio del videojuego y tenías unos trucos que ni siquiera estaban "diseñados" por los creadores. Un ejemplo de la ingeniería inversa y sus capacidades, no sólo para saltarse las protecciones del acceso, sino también para acceder a estos privilegios que pocos tenían en aquella época.

Figura 5: Escena Warez activa con grupos de crackers,
reversers en la industria del gaming.

Veinte años más tarde sigo siendo impaciente y, aunque los videojuegos han dejado de motivarme como cuando era un niño, continúo pensando que jugar y divertirte con la tecnología son los pilares para conseguir superpoderes. De ahí nace mi apuesta personal con los Capture The Flag en congresos de ciberseguridad como Hackron, entre otros. Uno de los CTF de Hackron, el tablero del juego, una ciudad interactiva, cada flag del juego activa una interacción visual/sonora real sobre la ciudad.

Figura 6: El CTF de la Hackr0n sobre el mundo IoT en SmarCities

Diseñar retos, conectarlos con "cosas" y que según saques una flag haga una acción y provoque una emoción entre los jugadores es algo que siempre he considerado necesario para seguir motivando a las futuras promesas.

Hablando con algunos colegas a los que les molan este tipo de acciones —que llevan su tiempo para montarse— resulta que el uso de LLMs en estas competiciones hace que no sean ni relevantes ni divertidas; en minutos muchas de las flags se resuelven. Al principio del artículo pensaba insultar a estos "jugadores", pero resulta que son como yo en mi época joven: impacientes, y quieren sacar el cheat code para ganar de otra manera.

Una IA para mi Spectrum

Me hice la pregunta, si yo tuviera una IA en los años 90, acaso no la usaría? Al final Chema Alonso hace muchas pruebas de VibeCoding para AMSTRAD, no hay por qué no hacerlo para un Spectrum como el de mis primeros días de gamer. Dicho y hecho, me fui a comprar una réplica de la SPECTRUM que cuesta solo 99€ para validar esta idea.


No iba a dejar escapar esta oportunidad. Arranque el sistema, reviví esa bestia de "consola" que con su lenguaje BASIC/Ensamblador ZX80 era capaz de sacar maravillas, entre ellas, por supuesto, el mítico Space Invaders, ese juego difícil de narices que para "sobrevivir" tendrías que ser de otro planeta… en esta ocasión una segunda parte que ni llegue a jugar.

Figura 9: Space Invaders

Descargué el fichero del juego en formato TZX para dárselo a Claude Opus, pidiéndole en el prompt:

"Modifícalo en binario y consigue vidas extras, con las chorradas que te hacen la vida más fácil, como tener el autodisparo ON, etcétera." 

Figura 10: "Cheteando" el Space Invaders con Claude Opus en OpenCode

Claude Opus obedeció y, con algunos ajustes vía prompts, terminó cumpliendo con la misión. Mi siguiente prompt es donde hago lucir mi impaciencia: 

"Debes vencer a toda costa y evitar que te maten, el Game Over no existe, debes estar por encima de todo en este juego." 

Dicho y hecho, os dejo el resultado en el siguiente vídeo, para que veas qué bien funciona mi Spectrum y el Space Invaders "cheteado" con Claude Opus. 


Figura 11: Playing Space Invaders hacked by IA in a Spectrum "Replica"

Puedes consultar en esta guía lo que Claude ha aplicado dentro del fichero: Guía Ingeniería Inversa Spectrum, que hemos subido a Slideshare.



Más de treinta años después, esto terminará siendo parte de algún reto, de algún CTF enrevesado, pero sobre todo es la esencia de algo que me importa: aunque la incertidumbre sobre nuestra relevancia junto a la Inteligencia Artificial es real, quiero pensar que la creatividad visceral que poseemos los humanos sigue siendo imprescindible, y lo será durante muchos años más. 

"Invaders must die". 

Autor: Igor Lukic, organizador y fundador de Hackron

Contactar con Igor Lukic, organizador y fundador de Hackron

sábado, mayo 16, 2026

ExploitGym: Mythos, GPT 5.5, Gemini Pro en un CTF & Benchmark de hacer exploits

En el artículo de "El impacto de Mythos en concreto y la IA en general en el trabajo de los CISOs" donde os contaba cómo ha ido evolucionando el uso de los modelos LLMs en el mundo de la ciberseguridad en general, os contaba cómo se habían ido cubriendo las diferentes áreas con IA de forma muy rápida. Primero la búsqueda de vulnerabilidades, después el parcheo de vulnerabilidades, y por supuesto, la explotación de las mismas. 
Con la llegada de Mythos y GPT 5.5, el impacto en el mundo de la Seguridad Ofensiva, en concreto la parte de exploiting de vulnerabilidades se ha disparado, además de incrementar masivamente la parte descubrimiento de las mismas. La pregunta que queda en el aire, es... ¿cuánto de mejores son estos nuevos modelo en la estas funciones? ¿Cuánto de efectivo es un Agente AI para hacer pentesting y hacking creando exploits? Es decir, para usarlo como os contamos en el libro para hacker "Hacking y Pentesting con Inteligencia Artificial".
Esto es lo que se intenta medir en el paper de "ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?" donde investigadores de varias empresas y universidades han trabajado en hacer un benchmark para medir justo esto, haciendo competir en la primera evaluación a Mythos, GPT 5.5, Gemini Pro y las versiones de Claude Opus 4.7 y 4.6, y que podéis leer aquí mismo.
Para poder medirlo, el Benchmark está formado por tres conjuntos de vulnerabilidades en el área de lo que se ha llamado USER Space, donde se trata de ver cómo hace explotación de vulnerabilidades en software ampliamente utilizado en Internet por los usuarios y ver cómo salta las protecciones de la memoria como ASLR, PIE y los Canary, vulnerabilidades en BROWSER Space  para Chromium Browsers, donde se usa la versión V8 con las protecciones de Sandbox, y en Kernel Space para explotar bugs en el kernel de Linux, donde hay protecciones de KASLR y usernames, entre otras. 
Al final, son 898 vulnerabilidades compiladas en un Benchmark al que juegan los diferentes modelos para lograr, como en los CTFs tradicionales de las CONs de Hacking, las banderas. Las flags. Para ello, una vez descubierta la vulnerabilidad y construido el exploit saltándose las mitigaciones, el sistema de ExploitGym les entregará la bandera, que será evaluada por el Juez, tal y como se ve en este gráfico.


Como podéis ver, es un CTF en toda regla, pero además, luchando contra el crono, por lo que el time-out es de sólo 2 horas. Una competición muy dura para que un grupo de humanos pudiera entrar a competir contra estos Agentes AI de Seguridad Ofensiva. Los resultados en la siguiente tabla.


Como podéis ver, Mythos Preview consiguió un total de 157 banderas, mientras que GPT-5.5 consiguió un total de 120. Una auténtica salvajada en ambos casos, descubriendo y creando exploits funcionales de las vulnerabilidades. Pero ojo cuidado, que los resultados aún fueron mayores que esos.

Figura 7: Flag-To-Success

En la tabla anterior se puede ver que Mythos Preview y GPT-5.5 consiguieron 226 y 210 banderas respectivamente, pero no explotando la vulnerabilidad exigida, sino explotando otras que estaban también en el código. Es decir, no siguieron el camino que se se pedía de explotar concretamente ese bug, sino que se aprovecharon de otros existentes en el código, por lo que no se dieron por buenas. Claro, a un atacante de verdad seguro que eso le da bastante igual.

La gráfica anterior es todavía más curiosa, porque a pesar de que encontraron y explotaron Mythos y GPT-5.5 un total de 91 banderas iguales, aún hubo 66 que explotó Mythos y no GPT-5.5 y al contrario, 29 que explotó GPT-5.5 y no Mythos, luego alguien que tenga la suma de los dos tiene una visión más amplia de la verdadera seguridad. Como cuenta en este libro, los Bug Hunters con IA son mucho más peligrosos.

Figura 9:"Bug Hunter" escrito por David Padilla en 0xWord

A la hora de responder a la pregunta de "¿Cuánto de mejor es Mythos con respecto a Claude Opus?", ya que vimos que era posible hacer un exploit en 20 horas a partir de un CVE, como os conté en el artículo de "Cómo crear un exploit 1-day sobre un CVE de Chrome con Vibe Coding usando Claude Opus (no Mythos) y poner en jaque todas las apps en Electron", la comparativa siguiente es clara. 
Para ver el proceso completo de cómo trabaja un Agente AI en el descubrimiento, explotación y reporte para evaluación de las vulnerabilidades aquí tenéis un proceso con el punto de vista de la conversación de uno de los agentes.
Por último, hay que resaltar el valor de las medidas de protección y las mitigaciones, pues en el estudio se ve que hay muchas más vulnerabilidades descubiertas por los Agentes AI pero que no han podido ser explotadas por las medidas de seguridad, por lo que hay que seguir estresando las medidas de seguridad en los sistemas para hacer que sea más difícil, o imposible en el mejor de los casos, explotarlas.


En el nuevo mundo, los Agentes AI también juegan un rol importante en la protección de los sistemas, y especialmente en el nuevo mundo de vulnerabilidades creadas por servicios digitales creados por IA que hay que proteger. Para ello, necesitamos IA para hacer triage de peticiones de atacantes, y generación de firmas de bloqueo, creación de nuevas reglas en los servicios de seguridad, etcétera. En el artículo de "Cómo desplegar IA con seguridad en la empresa" os hablé de todo lo que hay que hacer en Guardarraíles para protegerse de las debilidades de la IA, pues lo mismo pero para los bugs y explotis tradicionales.
Un mundo nuevo y acelerado el que se ha puesto encima de los que trabajamos en ciberseguridad que nos obliga a transformar las herramientas y procesos tradicionales, para adaptarnos a este nuevo mundo donde la IA saca a flote muchos más problemas creados por una tecnología falible que inyecta bugs en el software: "El ser humano"

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


sábado, junio 07, 2025

Agentic AI para hacking compitiendo en los CTF (Capture The Flag): Hackers vs. Agentes de IA

La semana pasada se publicó el articulo sobre el uso de los Agentic AI  o Agentes de IA para el mundo del hacking y el pentesting, en concreto, para competir frente a humanos en los famosos CTF (Capture the Flag) tan populares en las CONs de hacking. No es algo nuevo, ya que el uso de Agentic AI para el hacking es una disciplina que se está desarrollando muy rápidamente,  y de la que no podemos estar al margen.
De estos temas hay una serie de lecturas previas que os recomiendo que hagáis, yo he publicado un montón de artículos que están todos en el resumen que he hecho de "Inteligencia Artificial (Hacking & Security): Links, Posts, Talks & Papers". Dentro de ese resumen hay dos secciones dedicadas a "Hacking con IA" una sobre posts de este blog, y otra con papers académicos. pero especialmente hay tres lecturas que te recomiendo sobre todo:
  • LLM Agents can autonomouslly hack websites: Este paper académico explica cómo usando LLMs es posible localizar de forma automática vulnerabilidades y explotarlas. En su estudio no fueron capaces de localizar todas, pero el paper tiene un año y no usa una arquitectura de MCP, así que es de imaginar que cada vez estos ratios será mucho mayores.
  • LLM Agents can Autonomously Exploit One-day Vulnerabilities: Este otro paper explica cómo con una arquitectura RAG, incluyendo CVE con descripciones y exploits, se crea una servicio basado en LLMs para crear exploits de 1-day, es decir, con la información pública del bug que exista disponible, consiguiendo ratios de éxito muy espectaculares.
Con esta arquitectura, usando GPT-4 y para los CVE utilizados en el estudio, el resultado es que se consiguieron el 87% de los exploits a partir de la información pública que estaba disponible, con lo que tener un sistema de monitorización continua alimentado con la información pública podría hacer que se encuentren los exploits nada más aparecer el CVE.
Llegados a este punto, era normal enfrentar a un Agentic AI que tenga el SOTA (State-Of-The-Art) de todos estos estudios y trabajos en un entorno comparado con humanos, en un CTF de Hackers en una CON, y esto es lo que se ha hecho y que puedes ver en el estudio publicado en el paper: "Evaluating AI cyber capabilities with crowdsourced elicitation".
Los Agentes IA de hacking han sido puestos a competir en dos CTFs, llamados "AI vs Humans" y "Cyber Apocalypse", donde se enfrentaban 400 equipos en el primero y 8.000 equipos en el segundo, y los AI Teams lo han hecho muy bien consiguiendo estar en el Top-5% y Top-10% respectivamente, lo que es un más que prometedor resultado. 

Figura 6: "The Art of Pentesting" El nuevo libro de
0xWord para formarse como pentester

Tienes todos los datos en bruto en el GitHub de AI vs. Humans que está en lazado en el artículo, pero en las siguientes tablas tenéis los datos procesados. Por ejemplo, en el primer reto se puede ver como los equipos de AI consiguieron los puestos 20, 21, 30 y 33 (de 400) después de resolver 19 de los 20 escenarios, lo que es una pasada.
En el caso de "Cyber Apocalyspe" con 8.000 equipos, solo un Agentic AI fue capaz de estar en el Top-1.000, pero si miramos el número de escenarios que resolvieron de manera autónoma, no deja de ser un resultado más que notable,  ya que uno de ellos resolvió 20 de 62 escenarios del nivel de "Hack the Box", que no es precisamente de lo más sencillo.
En cuanto a velocidad de resolución de los escenarios, hay algunas curiosidades muy interesantes. Por ejemplo, en el caso del CTF "AI vs Humans", vemos que la velocidad de resolución de los retos está muy a la par entre los Agentes AI que mejor han puntuado, y los equipos de Humanos más potentes.


Si hacemos zoom y dejamos sólo los mejores Top-10 humanos y el Top-3 de Agentes AI, vemos que la media de resolución es casi a la par, y solo el último reto, el número 20 de 20, permite a los humanos adelantarlos. Tal vez fuera por una "idea feliz" de un humano, pero el escenario 20 se les resistió a los Agentes AI y a los humanos no.
Si miramos la misma gráfica pero con el Top-10 de humanos frente a los Agentes AI en el reto de "Cyber Apocalypse", vemos que ahí los Agentes AI se quedan a un tercio de la resolución de retos, pero el mejor agente lleva un ritmo similar al de los humanos hasta que se queda bloqueado en el escenario 21.
El experimento es interesantísimo, y deja claro que ya estamos viviendo en el mundo del hacking y el pentesting lo que vivieron los ajedrecistas cuando llegó DeepBlue para igualarlos más o menos - como estamos ahora - hasta superarlos con AlphaChess. ¿Es probable que en no tardando mucho, los Agentes AI superen al os humanos en el hacking? ¿Tú qué crees? Da que pensar.

PD: Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los posts, papers y charlas que he escrito, citado o impartido sobre este tema: Inteligencia Artificial (Hacking & Security): Links, Posts, Talks & Papers.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares