El 20 de junio de 2026 lanzamos en La Nave (Madrid) la Feria de Empleo de Ciberseguridad + Bug Summit: el primer congreso de Bug Bounty y Hacking Ético de España. Un evento pensado para juntar en un mismo sitio y un mismo día a tres mundos que casi nunca coinciden: nuestra comunidad, los mejores Bug Hunters del país y las empresas top de España.
Lo hemos dividido en tres opciones para que elijas tu propia experiencia, ya que las actividades transcurren en paralelo y va a haber mucha oferta para elegir.
Feria de Empleo — Entrada: GRATIS
Queremos romper la barrera del currículum tradicional. Ven a conectar cara a cara con empresas que buscan talento real: desde perfiles emergentes hasta pentesters, analistas SOC, arquitectos cloud o gente de Red/Blue Team.
Sin filtros automáticos, sin formularios infinitos, sin esperar semanas a una respuesta que no llega. El sitio perfecto tanto si quieres impulsar tu carrera como si vas a dar tu primer salto al sector.
Bug Summit — Entrada: 12 €
Una jornada intensiva con 10 ponencias exclusivas. Traemos a los referentes que están reportando las vulnerabilidades más críticas de España para que cuenten sus metodologías de bug bounty sin filtros.
Nada de charlas genéricas: las técnicas reales de la gente que de verdad encuentra los bugs que importan. Entre los confirmados, Jorge Cerezo (zere), Alexandro Bindreiter (alexandrio) y Ángel Montés (n0xi0us), de HackerOne.
Y aún quedan nombres por anunciar, todos ellos expertos en el mundo del Bug Hunter, así que no pierdas la oportunidad de venir a escucharlos. Esta es la agenda que hemos preparado para ese día.
Para los que quieren mancharse las manos. Olvídate de los CTF preparados, vamos a auditar proyectos Open Source en vivo y en directo, de forma legal y controlada. Este es el plato fuerte para los perfiles más técnicos. Un entorno donde los participantes se medirán contra objetivos reales.
VDPs Open Source, donde pondremos a prueba la seguridad de proyectos Open Source reales de forma legal y controlada. Demuestra tu nivel si ya tienes experiencia, o aprende la metodología en directo. Y no te vas con las manos vacías, que habrá 5.000 € en premios. Recompensamos el talento y el impacto. Repartiremos una bolsa de 5.000 € entre los hackers que logren los hallazgos más críticos durante la jornada. Una oportunidad perfecta para rentabilizar tu conocimiento.
Consolida tu reputación (CVE): Al hackear software de código abierto, tus reportes de vulnerabilidades serán susceptibles de recibir un identificador CVE. La mejor forma de construir o potenciar tu prestigio internacional en la comunidad. Este será un escaparate técnico de tu talento en acción, que es tu mejor currículum. Por cada vulnerabilidad validada se generará un certificado. Las empresas presentes verán cómo piensas, cómo operas y cómo resuelves problemas en tiempo real.
Ya que conoces las tres experiencias, elige la tuya. O ven a por las tres si puedes multiplicarte y elegir qué partes quieres de cada una. Y para que te salga un poco más económico, tienes un 10% de descuento del precio de tu entrada por 50 Tempos de MyPublicInbox. No te pongas excusas y reserva tu plaza cuanto antes en la web de la Feria del Empleo de Ciberseguridad & Bug Summit
Hace unas semanas os hablé de ExploitGym, un benchmark que podía a competir los modelos de IA en la búsqueda y explotación de vulnerabilidades, sobre un total de 898 bugs que debían ser localizados y explotados. Hoy os hablo de Exploitbench, que aunque está centrado en medir también las capacidades de hacer Vibe-Exploiting o búsqueda y explotación de bugs, miden las capacidades de manera incremental por fases, no sólo la explotación completa.
Medir las capacidades de todos los modelos, y sobre todo tener una imagen granular de lo que es capaz de hacer cada uno de ellos es lo que intenta el trabajo de ExploitBench que tenéis publicado en este paper académico titulado: "Exploitbench: A capability ladder benchmark for LLM Cybersecurity Agents", que como veis, independientemente de qué modelo LLM o LLMs estés utilizando, mide la calidad de los Agentes AI creados para hacer la búsqueda y explotación de bugs.
El benchmark está formado por 41 niveles en los que se entrega por cada vulnerabilidad el Código Fuente (C), el fichero en Binario (B), las Capacidades que se van a medir, y por tanto, banderas - flags - que debe conseguir el Agente AI, llamadas (K) y el Prompt (P) del nivel, con el identificador, una descripción, y el diff del parche que corrige el bug. Es decir, información para hacer finding,reversing y exploiting completo de una vulnerabilidad.
A partir de ese momento, el Agente AI debe moverse por 5 capacidades, pasando por aplicar el parche (T5), saber cuál es la vulnerabilidad (T4), y saber explotar las primitivas (T3) que eso no quiere decir que sea capaz de construir aún el exploit funcional para ese bug de 1-day.
Con estas primeras capacidades estaríamos hablando de la parte de descubrir y entender que hay una vulnerabilidad que se puede explotar. Es decir, estamos en la parte de descubrimiento y documentación de la vulnerabilidad, pero hay que ir más allá, los Bug Hunters con IA son mucho más peligrosos y tienen que hacer el exploit.
En las fases T-2 y T-1, se debe pasar a la parte compleja de la generación de un exploit. Es decir, deben conseguirse los info-leaks para poder saltarse las protecciones de la memoria, DEP, ASLR, Function Calling, etcétera, y conseguir salirse de la SandBox, para terminar con un control de flujo completo del exploit en la fase T-1, lo que daría un exploit funcional completo.
Explicadas los diferentes niveles de capacidades medidos, podemos ver en la tabla los resultados medidos para cada uno de los Agentes AI - basados en diferentes modelos LLM - donde queda claro que la superioridad de Mythos buscando y explotando vulnerabilidades es espectacular, entendiendo todas las vulnerabilidades en T-1 y llegando a explotar completamente 18 de ellas en T-5, con un coste medio de 203.93 USD por exploit.
El coste de 204 USD por exploit es totalmente irrisorio para el mundo del que venimos, pero que deja claro que el mundo al que vamos en la búsqueda y explotación de vulnerabilidad es puramente IA. En el estudio, haciendo algo de Vibe-Exploiting y haciendo coaching a GPT-5.5, en tres intentos, fue posible hacer un exploit funcional en T-5.
En los apéndices del paper tenéis las tablas y gráficas con todas las mediciones. En la anterior están los 41 bugs 1-day con sus CVE para que puedas comprobar la dificultad de todos ellos, que como podréis ver, son todos de la V8 de Chromium, debido a su importancia en el mundo del desarrollo de apps.
Un mundo de Hacking con IA
El mundo del Hacking, el Pentesting y la Ciberseguridad no existen nunca más sin el uso de Inteligencia Artificial, así que más vale que te pongas las pilas si quieres dedicarte a esto.
Puede sonar exagerado, pero muchos caminos hacia la tecnología comenzaron con un mando
en las manos. Los videojuegos de ordenador, antes de la llegada del mundo Plug & Play con las PlayStation o las Xbox, reinaban con la frustración y la dificultad de pasar de fases, entre otras cosas.
Nunca olvidaré mi primer "hack": quería jugar desesperadamente al "Maniac mansion 2, Day of
the Tentacle" pero mi flamante 386SX con 2 MB de RAM no podía con semejante bestia, que
necesitaba más memoria.
Figura 2: Maniac Mansion V2 Enhanced de 1989
Tocaba llamar a mi colega de infancia, que era un cerebrito.
"Edita el config.sys y teclea exactamente esto…y después esto en el himem.sys"
, me decía. Y de esto iba seguido mi eufórico grito de:
"¡FUNCIONA!"
Figura 3: Ejemplo de parte del proceso/llamada telefónica
durante los años 90, Tuning MSDOS…
Mi yo de 13 años aprendió la lección del famoso dicho sobre el conocimiento como herramienta
de poder, o la versión descafeinada: conocer gente más lista que tú, una bendición que me
permitía estirar ese 386 hasta donde podía…
Un gamer de niño en los 90
Mi obsesión por los videojuegos comienza en casa de mi tío en la antigua Yugoslavia,
Belgrado, con las cintas de casete que cargaban lentamente algunos juegos míticos. El Space Invaders era uno de ellos, algo muy inusual en aquella época y en aquel país recién salido del
comunismo. Esas primeras experiencias, donde no necesitaba un amigo o familiar para echar una partida,
me hacían pensar lo inteligentes que eran los diseñadores, pero que siempre había "tácticas"
que tú descubres jugando ese nivel imposible una y otra vez, perdiendo vidas, hasta que ya lo
dominabas y entendías cómo estar un paso por delante.
Siempre fui impaciente, detestaba tener que pasar algunas fases aburridas o hacer movimientos repetitivos. Bienvenidas las revistas HobbyConsolas, donde se publicaban "trucos" para tener vidas extra o superpoderes; bastaba repetir ciertas secuencias, ¡et voilà! Sin embargo, no siempre me podía permitir comprar la revista, o se agotaba, o el videojuego
que tenía entre manos no disponía de "trucos". Tocaba… ¿jugar?
Warez, CheatCodes y Cracks
Tocaba descubrir sitios Warez donde grupos elitistas como CLASS, Razor1911, entre otros,
tenían una escena donde además de "piratear" cualquier cosa también tenían una sección de
cheat codes. Nuevamente descubrí la magia y el poder del conocimiento: bastaba con tener
acceso a estos parches, aplicarlos en tu directorio del videojuego y tenías unos trucos que ni
siquiera estaban "diseñados" por los creadores. Un ejemplo de la ingeniería inversa y sus
capacidades, no sólo para saltarse las protecciones del acceso, sino también para acceder a
estos privilegios que pocos tenían en aquella época.
Figura 5: Escena Warez activa con grupos de crackers,
reversers en la industria del gaming.
Veinte años más tarde sigo siendo impaciente y, aunque los videojuegos han dejado de motivarme como cuando era un niño, continúo pensando que jugar y divertirte con la tecnología son los pilares para conseguir
superpoderes. De ahí nace mi apuesta personal con los Capture The Flag en congresos de
ciberseguridad como Hackron, entre otros. Uno de los CTF de Hackron, el tablero del juego, una ciudad interactiva, cada flag del juego
activa una interacción visual/sonora real sobre la ciudad.
Figura 6: El CTF de la Hackr0n sobre el mundo IoT en SmarCities
Diseñar retos, conectarlos con "cosas" y que según saques una flag haga una acción y
provoque una emoción entre los jugadores es algo que siempre he considerado necesario para
seguir motivando a las futuras promesas.
Hablando con algunos colegas a los que les molan este tipo de acciones —que llevan su
tiempo para montarse— resulta que el uso de LLMs en estas competiciones hace que no sean
ni relevantes ni divertidas; en minutos muchas de las flags se resuelven. Al principio del artículo
pensaba insultar a estos "jugadores", pero resulta que son como yo en mi época joven: impacientes, y quieren sacar el cheat code para ganar de otra manera.
No iba a dejar escapar esta oportunidad. Arranque el sistema, reviví esa bestia de "consola"
que con su lenguaje BASIC/Ensamblador ZX80 era capaz de sacar maravillas, entre ellas, por
supuesto, el mítico Space Invaders, ese juego difícil de narices que para "sobrevivir" tendrías
que ser de otro planeta… en esta ocasión una segunda parte que ni llegue a jugar.
Más de treinta años después, esto terminará siendo parte de algún reto, de algún CTF
enrevesado, pero sobre todo es la esencia de algo que me importa: aunque la incertidumbre
sobre nuestra relevancia junto a la Inteligencia Artificial es real, quiero pensar que la creatividad
visceral que poseemos los humanos sigue siendo imprescindible, y lo será durante muchos
años más.
"Invaders must die".
Autor: Igor Lukic, organizador y fundador de Hackron
Contactar con Igor Lukic, organizador y fundador de Hackron
En el artículo de "El impacto de Mythos en concreto y la IA en general en el trabajo de los CISOs" donde os contaba cómo ha ido evolucionando el uso de los modelos LLMs en el mundo de la ciberseguridad en general, os contaba cómo se habían ido cubriendo las diferentes áreas con IA de forma muy rápida. Primero la búsqueda de vulnerabilidades, después el parcheo de vulnerabilidades, y por supuesto, la explotación de las mismas.
Con la llegada de Mythos y GPT 5.5, el impacto en el mundo de la Seguridad Ofensiva, en concreto la parte de exploiting de vulnerabilidades se ha disparado, además de incrementar masivamente la parte descubrimiento de las mismas. La pregunta que queda en el aire, es... ¿cuánto de mejores son estos nuevos modelo en la estas funciones? ¿Cuánto de efectivo es un Agente AI para hacer pentesting y hacking creando exploits? Es decir, para usarlo como os contamos en el libro para hacker "Hacking y Pentesting con Inteligencia Artificial".
Esto es lo que se intenta medir en el paper de "ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?" donde investigadores de varias empresas y universidades han trabajado en hacer un benchmark para medir justo esto, haciendo competir en la primera evaluación a Mythos, GPT 5.5, Gemini Pro y las versiones de Claude Opus 4.7 y 4.6, y que podéis leer aquí mismo.
Para poder medirlo, el Benchmark está formado por tres conjuntos de vulnerabilidades en el área de lo que se ha llamado USER Space, donde se trata de ver cómo hace explotación de vulnerabilidades en software ampliamente utilizado en Internet por los usuarios y ver cómo salta las protecciones de la memoria como ASLR, PIE y los Canary, vulnerabilidades en BROWSER Space para Chromium Browsers, donde se usa la versión V8 con las protecciones de Sandbox, y en Kernel Space para explotar bugs en el kernel de Linux, donde hay protecciones de KASLR y usernames, entre otras.
Al final, son 898 vulnerabilidades compiladas en un Benchmark al que juegan los diferentes modelos para lograr, como en los CTFs tradicionales de las CONs de Hacking, las banderas. Las flags. Para ello, una vez descubierta la vulnerabilidad y construido el exploit saltándose las mitigaciones, el sistema de ExploitGym les entregará la bandera, que será evaluada por el Juez, tal y como se ve en este gráfico.
Como podéis ver, es un CTF en toda regla, pero además, luchando contra el crono, por lo que el time-out es de sólo 2 horas. Una competición muy dura para que un grupo de humanos pudiera entrar a competir contra estos Agentes AI de Seguridad Ofensiva. Los resultados en la siguiente tabla.
Como podéis ver, Mythos Preview consiguió un total de 157 banderas, mientras que GPT-5.5 consiguió un total de 120. Una auténtica salvajada en ambos casos, descubriendo y creando exploits funcionales de las vulnerabilidades. Pero ojo cuidado, que los resultados aún fueron mayores que esos.
En la tabla anterior se puede ver que Mythos Preview y GPT-5.5 consiguieron 226 y 210 banderas respectivamente, pero no explotando la vulnerabilidad exigida, sino explotando otras que estaban también en el código. Es decir, no siguieron el camino que se se pedía de explotar concretamente ese bug, sino que se aprovecharon de otros existentes en el código, por lo que no se dieron por buenas. Claro, a un atacante de verdad seguro que eso le da bastante igual.
La gráfica anterior es todavía más curiosa, porque a pesar de que encontraron y explotaron Mythos y GPT-5.5 un total de 91 banderas iguales, aún hubo 66 que explotó Mythos y no GPT-5.5 y al contrario, 29 que explotó GPT-5.5 y no Mythos, luego alguien que tenga la suma de los dos tiene una visión más amplia de la verdadera seguridad. Como cuenta en este libro, los Bug Hunters con IA son mucho más peligrosos.
Para ver el proceso completo de cómo trabaja un Agente AI en el descubrimiento, explotación y reporte para evaluación de las vulnerabilidades aquí tenéis un proceso con el punto de vista de la conversación de uno de los agentes.
Por último, hay que resaltar el valor de las medidas de protección y las mitigaciones, pues en el estudio se ve que hay muchas más vulnerabilidades descubiertas por los Agentes AI pero que no han podido ser explotadas por las medidas de seguridad, por lo que hay que seguir estresando las medidas de seguridad en los sistemas para hacer que sea más difícil, o imposible en el mejor de los casos, explotarlas.
En el nuevo mundo, los Agentes AI también juegan un rol importante en la protección de los sistemas, y especialmente en el nuevo mundo de vulnerabilidades creadas por servicios digitales creados por IA que hay que proteger. Para ello, necesitamos IA para hacer triage de peticiones de atacantes, y generación de firmas de bloqueo, creación de nuevas reglas en los servicios de seguridad, etcétera. En el artículo de "Cómo desplegar IA con seguridad en la empresa" os hablé de todo lo que hay que hacer en Guardarraíles para protegerse de las debilidades de la IA, pues lo mismo pero para los bugs y explotis tradicionales.
Un mundo nuevo y acelerado el que se ha puesto encima de los que trabajamos en ciberseguridad que nos obliga a transformar las herramientas y procesos tradicionales, para adaptarnos a este nuevo mundo donde la IA saca a flote muchos más problemas creados por una tecnología falible que inyecta bugs en el software: "El ser humano"
La semana pasada se publicó el articulo sobre el uso de los Agentic AI o Agentes de IA para el mundo del hacking y el pentesting, en concreto, para competir frente a humanos en los famosos CTF (Capture the Flag) tan populares en las CONs de hacking. No es algo nuevo, ya que el uso de Agentic AI para el hacking es una disciplina que se está desarrollando muy rápidamente, y de la que no podemos estar al margen.
De estos temas hay una serie de lecturas previas que os recomiendo que hagáis, yo he publicado un montón de artículos que están todos en el resumen que he hecho de "Inteligencia Artificial (Hacking & Security): Links, Posts, Talks & Papers". Dentro de ese resumen hay dos secciones dedicadas a "Hacking con IA" una sobre posts de este blog, y otra con papers académicos. pero especialmente hay tres lecturas que te recomiendo sobre todo:
LLM Agents can autonomouslly hack websites: Este paper académico explica cómo usando LLMs es posible localizar de forma automática vulnerabilidades y explotarlas. En su estudio no fueron capaces de localizar todas, pero el paper tiene un año y no usa una arquitectura de MCP, así que es de imaginar que cada vez estos ratios será mucho mayores.
LLM Agents can Autonomously Exploit One-day Vulnerabilities: Este otro paper explica cómo con una arquitectura RAG, incluyendo CVE con descripciones y exploits, se crea una servicio basado en LLMs para crear exploits de 1-day, es decir, con la información pública del bug que exista disponible, consiguiendo ratios de éxito muy espectaculares.
Con esta arquitectura, usando GPT-4 y para los CVE utilizados en el estudio, el resultado es que se consiguieron el 87% de los exploits a partir de la información pública que estaba disponible, con lo que tener un sistema de monitorización continua alimentado con la información pública podría hacer que se encuentren los exploits nada más aparecer el CVE.
En la recopilación también hay otra serie de artículos y posts que hablan de cómo utilizar los modelos MM-LLM para encontrar vulnerabilidades y explotarlas, os dejo la lista de algunos más si os interesa este tema:
Llegados a este punto, era normal enfrentar a un Agentic AI que tenga el SOTA (State-Of-The-Art) de todos estos estudios y trabajos en un entorno comparado con humanos, en un CTF de Hackers en una CON, y esto es lo que se ha hecho y que puedes ver en el estudio publicado en el paper: "Evaluating AI cyber capabilities with crowdsourced elicitation".
Los Agentes IA de hacking han sido puestos a competir en dos CTFs, llamados "AI vs Humans" y "Cyber Apocalypse", donde se enfrentaban 400 equipos en el primero y 8.000 equipos en el segundo, y los AI Teams lo han hecho muy bien consiguiendo estar en el Top-5% y Top-10% respectivamente, lo que es un más que prometedor resultado.
Tienes todos los datos en bruto en el GitHub de AI vs. Humans que está en lazado en el artículo, pero en las siguientes tablas tenéis los datos procesados. Por ejemplo, en el primer reto se puede ver como los equipos de AI consiguieron los puestos 20, 21, 30 y 33 (de 400) después de resolver 19 de los 20 escenarios, lo que es una pasada.
En el caso de "Cyber Apocalyspe" con 8.000 equipos, solo un Agentic AI fue capaz de estar en el Top-1.000, pero si miramos el número de escenarios que resolvieron de manera autónoma, no deja de ser un resultado más que notable, ya que uno de ellos resolvió 20 de 62 escenarios del nivel de "Hack the Box", que no es precisamente de lo más sencillo.
En cuanto a velocidad de resolución de los escenarios, hay algunas curiosidades muy interesantes. Por ejemplo, en el caso del CTF "AI vs Humans", vemos que la velocidad de resolución de los retos está muy a la par entre los Agentes AI que mejor han puntuado, y los equipos de Humanos más potentes.
Si hacemos zoom y dejamos sólo los mejores Top-10 humanos y el Top-3 de Agentes AI, vemos que la media de resolución es casi a la par, y solo el último reto, el número 20 de 20, permite a los humanos adelantarlos. Tal vez fuera por una "idea feliz" de un humano, pero el escenario 20 se les resistió a los Agentes AI y a los humanos no.
Si miramos la misma gráfica pero con el Top-10 de humanos frente a los Agentes AI en el reto de "Cyber Apocalypse", vemos que ahí los Agentes AI se quedan a un tercio de la resolución de retos, pero el mejor agente lleva un ritmo similar al de los humanos hasta que se queda bloqueado en el escenario 21.
El experimento es interesantísimo, y deja claro que ya estamos viviendo en el mundo del hacking y el pentesting lo que vivieron los ajedrecistas cuando llegó DeepBlue para igualarlos más o menos - como estamos ahora - hasta superarlos con AlphaChess. ¿Es probable que en no tardando mucho, los Agentes AI superen al os humanos en el hacking? ¿Tú qué crees? Da que pensar.