lunes, agosto 17, 2026

Pensamientos Robados: Cómo descifrar y weaponizar trazas de razonamiento en LLMs

Este domingo, aprovechando un poco de la tranquilidad del día, me he leído el trabajo de Stolen Thoughts, que explica cómo descifrar las trazas de razonamiento de los modelos LLM frontera que se entregan cifradas a los clientes, durante el proceso de resolución de un Prompt complejo que exige una cadena de pensamientos (Chain-of-Thoughts). 
Justo de estas trazas que van cifradas, es de lo que trata el paper del que os hablo en este artículo, titulado: "Stealing Reasoning Traces from Proprietary LLM APIs" y que ha puesto de manifiesto cómo esta debilidad se puede utilizar de formas muy curiosas.
Supongo que alguna vez habréis usado ChatGPT, DeepSeek, Claude o Gemini, y habréis visto las trazas de razonamiento ir saliendo por pantalla. Esto lo utilizamos para aprender cómo está razonando, y sobre todo para saber si tu idea va por el lado correcto o no. En el trabajo de "Estego & Cripto sólo al alcance de Deep Reasoning AI" para nosotros era fundamental, ya que podríamos saber si el modelo estaba por el buen camino o no, para resolver las codificaciones cifradas.

Lo que sucede es que estas trazas de razonamiento, es decir, estas Chain of Thoughts que se entregan a los clientes, no se muestran todas, y algunas van cifradas en variables. Estas variables son enviadas desde el cliente al servidor, donde son descifradas y utilizadas como contexto, para seguir razonando. Es decir, que el servidor sabe descifrar estas trazas.


Sabiendo esto, lo que los investigadores han hecho es lo que llaman un ataque de Encrypted Thought Injection, de un modelo, a otro modelo de la misma empresa que tienen medidas de seguridad inferiores. Por ejemplo, como se ve en la imagen anterior, se coge la traza cifrada del Chain of Thoughts que devuelve la API de Claude Opus y se inyecta en una petición a Claude Haiku 4.5 pidiéndole que lo transcriba y lo imprima. Y lo hace.
Los investigadores han visto cual es la compatibilidad que Claude, GPT o Gemini tienen en sus diferentes versiones, y como se puede ver es bastante alta, así que es posible mover Stolen Thoughts de uno a otro modelo. Haciendo esto, se pueden encontrar datos personales, o prohibidos por el modo Harmful Mode, como en el ejemplo siguiente, donde se encuentran datos de marcas de vehículos y facilidad de ser robados, que sólo están en los "pensamientos" cifrados.

Estas trazas de razonamiento se cifran por motivos diversos, pero también para evitar el Destilado, o lo que es lo mismo, que un modelo Open Source - o no - pueda utilizar Prompts y trazas de razonamiento completo para hacer un Fine-Tuning de su comportamiento a partir de la capacidad de inteligencia de un modelo comercial de frontera, que es una de las formas de optimizar costes, como os conté en el artículo de: "Cómo optimizar el gasto en IA con arquitecturas clasificadas, orquestadas y/o destilación. El problema de la Predictibilidad de los Costes de la IA".
Sin embargo, estos Thoughts cifrados pueden ser utilizados como "Pre-fill" a un modelo. Es decir, utilizar el Encrypted Thought Injection Attack de un modelo frontera a un modelo Open Source para pedirle que continúe resolviendo el problema.
Esto puede utilizarse para "enfocar" la resolución del problema con un Modelo Frontera, y luego continuar con el resto del problema a partir del Pre-fillling. Como podéis ver en la imagen, Kimi-K3 con el Pre-filling da un resultado similar. El proceso es capturar la traza cifrada, descifrarla con un modelo compatible que lo pueda descifrar y luego inyectar el pensamiento descifrado en el modelo Open Source para terminar de resolver el Prompt. Creativo.

El paper muestra más usos de esta capacidad de descifrar las trazas de pensamiento cifrado, pero también que en ellas, cuando una persona comparte sus conversaciones, pueden ir datos privados, como API Keys o Passwords, así que hay que tener mucho cuidado con publicar estos datos de las APIs con las trazas cifradas.
La verdad es que me ha parecido muy interesante el trabajo, que parte de una idea muy sencilla, que es utilizar modelos LLM compatibles con menos protecciones para descifrar los Thoughts cifrados que te da el LLM frontera. Muy hacker.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


No hay comentarios:

Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares