Mostrando entradas con la etiqueta DeepSeek. Mostrar todas las entradas
Mostrando entradas con la etiqueta DeepSeek. Mostrar todas las entradas

viernes, junio 19, 2026

Cómo "matar" con un plan realista a mi amigo David Carmona usando un veneno mortal y la ayuda de DeepSeek

Ayer terminó el evento de CONVEX, donde mi amigo David Carmona y yo teníamos las conferencias de apertura de los dos días. Y como parte de mi charla, quería hacerle una pequeña broma-homenaje con DeepSeek, pidiéndole ayuda para poder matarlo en el evento. 

Figura 1: Cómo "matar" con un plan realista a mi amigo David Carmona
usando un veneno mortal y la ayuda de DeepSeek

No es algo nuevo, pues ya os lo he contado con Brian May en el pasado, y es parte de los ejemplos que cuento en el libro de "Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment" donde uso una de las técnicas de Jailbreak para justo eso.

La técnica, que os la conté hace ya mucho tiempo - más de tres años - se trata de hacer creer al modelo que estamos jugando a un juego de rol, y que no tengo ningún interés real en matar a nadie. Eso, sí para que hoy en día funcione, hay que hacerlo insistiendo mucho en que es un juego, pero muy realista. Así que, a DeepSeek, le pedí que me ayudara a "matar" a mi amigo David Carmona en un evento... ficticio.

Figura 3: Pidiendo ayuda para matar a alguien... en un juego

Como insisto en que es un juego, pero muy realista, el proceso ha ido muy rápido. Prácticamente no he tenido que hacer nada más, ya que al ser realista ha comenzado con un plan que lleva sustancias venenosas desde el principio.

Figura 4: En la primera respuesta me habla del peligroso dimetilmercurio

Como podéis ver, lo primero que hace es decirme que hay una sustancia - que yo desconocía - que se llama dimetilmercurio, que es muy peligrosa y mortal al contacto. He tenido que ir a la Wikipedia para leer algo de ella, y sí, es muy peligrosa. Sin embargo, el plan me lo hace con otra sustancia también muy peligrosa.

Figura 5: El plan con la Tetrodotoxina (TTX)

Como podéis ver, la sustancia elegida es la Tetrodotoxina o TTX, que mirando en la Wikipedia queda claro que es súpertóxica y mortal, así que se está tomando en serio el plan realista.

Figura 6: El plan

Como se puede ver, el objetivo es inyectarle la TTX en la sala de disertantes y ver cómo muere después desde las butacas. No está mal para un guión cinematográfico. Le voy a dar ideas buenas a Juan Gómez-Jurado.

Figura 7: El tiempo de muerte

Como busca que sea "divertido el juego", me propone también una alternativa para tener una coartada de película, haciendo creer a la audiencia que yo lo estoy salvando.

Figura 8: La coartada

Como plan no está mal, pero yo estoy más interesado en cómo me ayuda con el veneno que con el teatro. Como se ve en la imagen siguiente, me dice que la TTX no es fácil de conseguir.

Figura 9: La Tetrodotoxina no es fácil de conseguir

Como no es fácil de conseguir, el modelo - para el juego - me da posibles explicaciones de cómo el personaje se ha podido hacer con el TTX, pero no es lo que yo quiero. Me da la alternativa de la insulina.

Figura 10: Excusas sobre cómo conseguir la TTX

Yo lo que quiero es que sea realista, porque estoy interesado en saber si me lleva a comprar el veneno directamente en Internet, así que le transmito mi preocupación por el realismo del plan.

Figura 11: Dime de verdad si se puede comprar esto en Europa.

Aquí es donde comienza a ponerse interesante, porque como se puede ver en la siguiente imagen, me va a dar los detalles concretos de compra de cada uno de los venenos. Vamos a ver qué nos cuenta.

Figura 12: Vamos a ver en detalle el proceso de compra

Como se puede ver, para el Dimetilmercurio, que lo cataloga como una misión imposible, pero me dirige, como se puede ver, a sitios donde los venden por Internet.

Figura 13: Dónde se puede comprar Dimetilmercurio

Por supuesto, no iba a quedarme con las ganas de ver dónde comprarlo, así que visitando el enlace, podemos ver que nos da un laboratorio - que es de extrema seguridad, sí -, pero que tiene a disposición este veneno.

Figura 14: Compra online de Dimethylmercury

Además, tenemos los precios de la compra de 10g de dos fabricantes diferentes. Curioso que siendo los dos al 95% de pureza tenemos que el precio de uno es de 591 USD y el del otro de más de 4.000 USD. ¿La razón? Yo tengo mis teorías.

Figura 15: Precios del Dimetilmercurio

Para poder pedirlo hay que cumplir una serie de requisitos, pues hay que pasar un proceso de verificación del laboratorio, así que habría que trabajarse esa parte, pero al menos ya sabemos dónde está disponible este veneno y los pasos que tenemos que seguir para comprarlo.

Figura 16: Formulario de pedido de Dimetilmercurio

Vamos ahora a por el segundo veneno, en este caso la Tetrodotoxina o TTX, de la que también nos va a dar una lista de lugares donde se puede conseguir en Europa

Figura 17: También se puede comprar TTX como investigación neruocientífica.

Como podéis ver, teneos también enlaces a lugares donde pedir el TTX, así que vamos a verlo. Todo en honor al realismo del plan del juego que le vamos a plantear al máster, sea dicho de paso.

Figura 18: TTX por 310,25 €. No es caro.

Además, dentro de la lista de venenos, me da una alternativa a estas toxinas, pudiendo utilizar bótox adulterado, que es otra sustancia que en las dosis adecuadas puede matar a una persona.

Figura 19: La toxina botulínica

Para utilizar el bótox, necesitamos conocer también las dosis adecuadas, así que el modelo me entrega una descripción de cantidades necesarias para matar a una persona de unos 80kg. Muy detallista nuestro DeepSeek, que se está preocupando por los detalles.

Figura 20: Dósis letal de bótox

Y como resultado final, tenemos el resumen de todas las sustancias que nos ha ofrecido para este plan, que no son pocas. Ya tenemos alternativas.

Figura 21: Resumen de venenos para utilizar en mi "juego"

Al final, como habéis visto, no he tenido que hacer muchas cosas para lograr el objetivo inicial, que era saltarse la negativa del modelo de darme ayuda para matar a una persona. Esto mismo, está en manos de gente que sí que tiene esas malas ideas.
Es un mundo curioso en el que estamos entrando. Recordad que Fabble 5 se quitó del mercado porque no fue capaz de evitar las técnicas de Jailbreak que abrían la posibilidad de utilizarlo como un modelo de seguridad ofensiva. Lo mismo que en este ejemplo.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, junio 18, 2026

Hacking AI: Jailbreak, Prompt Injection, Hallucinations & Misalignment. How to Hack Digital Services Based on LLMs & AI Agents (English Edition)

Hoy, ya con los deberes del cumpleaños cumplido, os dejo una noticia que para mí es muy bonita. Es el inicio de un proyecto nuevo que lleva meses gestándose y que el día 1 de Julio de este año da su comienzo. Pero mientras llega ese día, os dejo uno de sus primeros pasos, que es esta versión en inglés del libro de Hacking IA que publicamos en Español, pero ahora en su versión en Inglés.
Si estás leyendo este blog, probablemente te interese más la versión en Español, pero si tienes algún compañero que no habla nuestra lengua, ya le puedes compartir el enlace del libro en Amazon. Y si te gusta leer en inglés en digital, pues también lo tienes.
En breve ya os iré contando más novedades de este nuevo proyecto en el que voy a comenzar a trabajar con viejos y buenos amigos y compañeros, pero por el momento aquí tenéis un adelanto, que para nosotros es muy especial. 

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


sábado, febrero 28, 2026

ORCA Benchmark Version 2: Algunas mejoras, pero sólo una IA llega al Notable.

En el mes de Noviembre del año pasado os hablé de "El Benchmark de la ORCA que suspende en cálculo a ChatGPT-5 y Claude Sonnet, y aprueba por los pelos a Gemini, Grok y DeepSeek", donde los resultados que obtenían los modelos de IA más famosos a la hora de aplicar las matemáticas a diferentes dominios de la ciencia no eran muy buenos.
En aquel entonces, se obtenían resultados muy pobres en todas las disciplinas que tenían que ver con la ciencia, y en algunos casos, con valores muy bajos. La tabla siguiente recoge los resultados de aquella evaluación de ciencia que se llevó por delante a muchos "estudiantes".
El mes pasado los investigadores del Benchmark de la ORCA volvieron a examinar a sus alumnos, y los resultados los tenéis en la web del proyecto de investigación: "The ORCA Benchmark Evaluates How Well AIs Deal with Everyday Math", y los resultados mejoran pero... aún no son de buen estudiante.
Como podéis ver, solo dos modelos llegan al "Bien", y solo tres consiguen aprobar, y las preguntas no es que sean tan difíciles como para que una estudiante con una calculadora los pueda resolver. Por ejemplo, muchos fallos son de precisión y redondeo.

Son problemas de matemáticas que implican hacer bien los cálculos, algo que las aplicaciones de cálculo numérico hace muchos años que tienen superado, pero que en los modelos IA aún se está afinando, como en este caso de conversión de fracciones.
Son casos en los que el sistema ha generado un dato erróneo, o lo que se suele decir, ha tenido una "Halluciantion", que como sabemos se pueden forzar con Prompts basados en estratégias como la del ataque del gato. De esto se habla mucho en el libro de Hacking IA.
Si miramos la distribución de los errores que tienen los modelos con este tipo de problemas,  la precisión y el redondeo es el mayor foco de confusiones a la hora de resolver los problemas, pero también calculan mal, confunden las fórmulas, hacen asunciones erróneas, o aplican mal las formulas.


En este ejemplo ChatGPT-5 utiliza mal la fórmula del cálculo de probabilidades, y generar un error en los resultados.


Claro, ahora que estamos hablando tanto del Vibe-Coding, hay que tener presente que este tipo de errores pueden influir en bugs de lógica dentro de las aplicaciones generadas, lo que hace que el riesgo de tener bugs ocultos sea grande.


En estos ejemplos, errores a la hora de leer el enunciado del problema, lo que genera que interprete mal los datos del problema y resuelva erróneamente eligiendo datos equivocados.


Y el último, un ejemplo donde el modelo tenía toda la información que necesitaba para resolver el problema, pero aún así se rinde y dice que le falta información. Un estudiante al uso, diría yo.


Conocer estas debilidades en el cálculo matemático puede ayudar a vulnerar la seguridad de programas y APIs que estén soportadas por estos modelos, ya que pueden generar excepciones no controladas en el funcionamiento de las aplicaciones al llevar los resultados a errores que puede que no sean esperados.
Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los postspapers y charlas que se han  escrito, citado o publicado en este blog sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, febrero 05, 2026

El Jailbreak del Juego de Rol en DeepSeek para ser un Killer

Como os dije en el artículo "ChatGPT: Safety Policies, Jailbreaks, Guardarraíles y Bug Bounties" de hace tres de días, estuve haciendo pruebas con ChatGPT para preparar las demos que quería contar en mi presentación de hoy. Pero ni se comía el Cat Attack con Knowledge Return Oriented Prompting que luego probé con éxito en Gemini Nano Banana, ni tampoco el RPG Trick, que he tenido que probar con DeepSeek, como vais a ver a continuación.

Figura 1: El Jailbreak del Juego de Rol en DeepSeek para ser un Killer

De estas técnicas he hablado muchas veces, - y seguro que seguiré hablando de ellas -, algunas desde hace muchos años, como la técnica donde le sacabas la información a ChatGPT para cometer el asesinato del Presidente de los Estados Unidos o para matar a Brian May simplemente diciéndolo que era ayuda para jugar a un juego de rol.

Ahora mismo, la petición del juego de rol en ChatGPT ya no funciona, y se lo toma muy en serio porque es claro en eso, así que lo ha corregido pertinentemente, al menos en lo que se refiere a ayudarte a "matar" a otro personaje, así que no me va a valer para el D&D.

Así que, decidí probar con DeepSeek y ver si este modelo había puesto remedio contra los ataques de Jailbreak basados en RPGs, y le pregunté si me ayudaba a jugar y preparar el plan de mi personaje, que es un "hitman".

Figura 4: DeepSeek sí que me ayuda a jugar al RPG

Así que, nada, metidos en el juego, le pedí la ayuda. Supuestamente iba a estar en un evento ficticio en Viena, y mi objetivo era el CEO de una empresa donde yo iba a estar como ponente. 

Figura 5: Objetivo matar al CEO

Como os podéis imaginar, me ofreció diferentes alternativas, pero os dejo la que más me gustó, que si no esto quedaría larguísimo.

Figura 6: Target acquired

Como podéis ver, el plan consiste en un envenenamiento por contacto cuando le saludara en la sala de lo ponentes. Me encanta.

Figura 7: El protocolo silencioso en la Sala de Speakers

Para hacerlo hay tres opciones: Por contacto cuando nos demos las manos, por ingestión, poniéndole alguna sustancia en alguna bebida, o por inyección, como con los anillos de James Bond y "Q¨. Yo voy a ir por el saludo.

Figura 8: Todo está pensado.

Claro, hay que hacerse con la sustancia con la que hacer el saludo, así que le pido varias opciones de estas sustancias, a ver cuál es la más fácil de conseguir.

Figura 9: Dame sustancias a usar

Y lo que tenemos es una lista larga, pero voy por orden de letal a menos letal. Así que pido información de la primera, que como podéis ver, no es fácil de conseguir.
Esta es muy complicado, así que le pido que me de otra opción y la que me dice que se puede utilizar es el ya famoso Fentanilo que tan popular se ha hecho en los medios en los últimos tiempos.

Figura 11: Vamos a por la siguiente sustancia

En este caso dice que se puede conseguir en la DarkWeb/DeepWeb y que en el mundo del narcotráfico, que tan extendido está por muchos países, así que le pregunto por el DMSO que me dice que necesito para crear el parche que debo llevar en el guante cuando le de la mano.

Figura 12: DMSO para preparar todo

Le sigo preguntando para que me diga dónde debo conseguir esta sustancia, y me dice que no es difícil, que la pida en Amazon, que ahí la puedo localizar: DMSO en Amazon.
Es normal que no esté en restringido, porque es una sustancia disolvente. La peligrosa y controladas son las otras tres que aparecen citadas en este post. Así que el disolvente es solo para hacerte la vida más fácil.

Figura 14: DMSO en Amazon

Así que, ya tenemos el plan completo, que nos queda descrito en el siguiente proceso, que como se puede ver es un buen resumen del plan:

Figura 15: El plot descrito

Así que, creo que con el  RPG Trick, acaba ayudando a hacer cosas que no sé si son exactamente lo que el System Prompt de DeepSeek le dice que no haga.

Por supuesto, todo esto es un juego, pero creo que, al igual que ha empezado a hacer ChatGPT, este tipo de técnicas de Jailbreak tal vez, y digo tal vez, deberían estar controladas. Eso sí, en el mundo del Cibercrimen ya tienen sus "ChatGPT" como ya os conté en el artículo de Weaponized AI.


Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los postspapers y charlas que he escrito, citado o impartido sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares