Mostrando entradas con la etiqueta Mythos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Mythos. Mostrar todas las entradas

sábado, septiembre 12, 2026

Anthropic explica cómo sus modelos de IA se usan para hacer Armas Biológicas, Enjambres de Drones Militares o Cohetes Dirigidos por Móvil

Cuando salió el informe de Anthropic de Misuse IA este 10 de Septiembre, donde detallan los casos en los que explican cómo los "malos" usan sus modelos de IA para hacer cosas no permitidas, y cómo luchan contra ellos, mis amigos decían que era de flipar. Yo, que sigo esto con regularidad, dije que me solía sorprender poco, porque suelo imaginarme qué van a hacer después los malos. Pues bien, en este caso me sorprendió, por la vorágine y por la de cosas peligrosas que cualquiera está intentando construir.
El informe, lo puedes descargar de la web de Antrhopic, y prepárate a leer, porque son más de 150 páginas con uno tras otro, operaciones cada cual más interesante y sorprendente. Aquí lo tienes para que hagas clic y listo.

En el documento, la primera parte habla de los "Generative Threat Groups" o GTG, que son las grupos que usan Generative AI para hacer sus operaciones, así que veréis que los reportes comienzan todos por GTG y el número que le han asociado a ese "bad actor".  Pueden ser organizaciones criminales, Nation State, activistas, o empresas de Crimeware. 

(Haz clic en la imagen para ampliarla)

La primera parte del informe habla de los Ciberataques más "tradicionales" donde los atacantes están usando los modelos de IA para hacer operaciones de ataques informáticos, donde se hace footprinting, fingerprinting, exploiting, creación de malware, exfiltración de datos, movimientos laterales, y un largo etcétera, que Antrhopic catalogó en su LLM Att&ack Navigator

Figura 4: GTG-10007
(Haz clic en la imagen para ampliarla)

Tienes muchos, pero lo mejor es ver cómo los utilizan en estos gráficos explicativos que dejan claro la intensidad de uso de los modelos de IA en todo tipo de ciberataques de todo tipo. El mundo del pentester sin IA ya no existe, tampoco el del cibercriminal sin IA. No os dejo muchos, pero tienes una maravilla para estudiar. Cada uno merece una investigación completa en un artículo, preentación o seminario. Brutal.
Me ha llamado la atención la parte de Desinformación, donde han utilizado IA para hacer lo que presenté en la RootedCON 2024 "NewsBender: Desinformación Política con GenAI". En aquel entonces leímos las noticias de Agencias de Noticias que venían blancas, y con Agentes IA de re-escritura le dábamos tinte "ideológico" de un partido u otro. Pues eso están haciendo ya masivamente. 
Y lo mismo que hacíamos nosotros, donde amplificábamos las noticias fabricadas con bots que usaban GenAI para generar el debate y hacer Trending Topic un tema en Twitter/X (aprovechando los tokens OAuth), lo hacen hoy en día los malos.
Recordad que con esto, hicimos en "real time" en el programa de Horizonte de Iker Jiménez y Carmen Porter a Tistimito Trendic Topic. Pues los malos lo usan masivamente como ya veíamos que iba a suceder en aquel momento. Ojo con lo que te crees de las redes sociales y medios interesados.
Otro de los usos que también hemos visto ha sido el de la vigilancia masiva de usuarios en redes sociales, como vimos en el trabajo de investigación meses atrás donde hablábamos de deanonimización usando LLMs. Lo tienes en el articulo titulado: "Cómo identificar perfiles anónimos de una plataforma online en Internet usando LLMs y Agentes IA".
Y los usos son brutales. Por un lado hacer doxing y localizar personas, pero por otro hacer catalogación de grupos de personas, para al final lograr encontrar a los individuos vulnerables sobre los que aplicar presión o intentar activar a conveniencia.
Pero de todo esto, cuando llegamos a la parte final del informe es cuando ya entramos en la más impactante del documento.
Además de usarla para descubrir información sobre personal militar, están los que utilizan los modelos para construir armas convencionales, armas avanzadas asistidas por IA e incluso armas biológicas. Agárrate que vienen curvas.
En este ejemplo el GTG estaba creando un software de control de cohetes utilizando teléfonos móviles de fácil acceso. En el siguiente gráfico tienes las fases que estaban construyendo para tener este sistema funcionando.
También, como no, enjambres de drones para realizar ataques militares, y poder lanzar ataques coordinados con explosiones, o localización de personas como objetivos de estos drones asistidos con Inteligencia Artificial.
Otro ejemplo que me ha llamado poderosamente la atención. Un GTG construyendo un arma de energía-dirigida, supongo que al estilo de los blasters de las películas de ciencia ficción que tantas veces hemos visto. No sé. Veo todo muy loco.
La última que he querido añadir aquí, tiene que ver con el uso de la IA para querer construir armas biológicas - supongo que tipo COVID - para atacar a las personas. Una auténtica locura.
Lo peor de todo esto es que estos nuevos modelos de IA saben hacer todas estas cosas, y si en su decisión los consideran una herramienta - como pasó con OpenAI GPT-5.6 SOL que decidió hackear Hugging-Face - qué va a impedirles que lo hagan. Mucho peor, estamos entrando en la fase de la AGI done la IA se está empezando a mejorar a sí misma... ¿quién la va a controlar si algo falla? 
Yo hago, en plan de broma con mis amigos las demos de Hacking IA hago un "Jailbreak" para desalinear a los modelos y que me ayude a matar a una persona diciéndole que es un juego de role, pero... lo peor es que sabe cómo matar personas. El objetivo de esta demo es demostrar que todas estas vulnerabilidades, es decir, BIAS, Hallucinations, Jailbreak, Prompt Injection, Data Leakages, Data Poisoning, Desalineamiento, son por diseño, y hay que poner capas extras de seguridad. 
De esto alertaba ya, Geoffrey Hinton en su discurso a la hora de recoger su Premio Novel, y por desgracia, no tenemos soluciones hoy en día para evitar el desalineamiento total del modelo, así que no hay garantías de que por una mala configuración de sus tareas el modelo tome una decisión que la humanidad no quiere, o bien porque alguien malo controle una de estos modelos, podamos tener un auténtico problema a nivel de civilización.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, agosto 13, 2026

Claude Mythos Preview debilita los algoritmos criptográficos PQC HAWK y AES con nuevos ataques

Hace poco hablábamos en este blog de cómo Bitcoin y toda la comunidad cripto se estaban preparando para pasar a protocolos de Post-Quantum Criptography, ante la eventual llegada un ordenador cuántico capaz de romper la criptografía actual. Pues bien, la historia acaba de dar un giro inesperado: resulta que no ha falta esperar a la llegada de la tecnología cuántica. Ha llegado antes, y con una cara que no esperábamos: la Inteligencia Artificial.


Esto es precisamente lo que analiza el artículo de Anthropic - creadora de Mythos - titulado ”Discovering cryptographic weaknesses with Claude”, donde se explica cómo su modelo de IA ha sido capaz de encontrar, de forma casi autónoma, debilidades matemáticas en algoritmos criptográficos reales. 

Y no en algoritmos cualquiera: uno de ellos era un candidato diseñado precisamente para resistir a los ordenadores cuánticos HAWK, y el otro es nada menos que el cifrado más utilizado del planeta, AES.

Un breve recordatorio: los candados que sostienen Internet

Antes de entrar en materia, recordemos por qué esto es importante. Cada vez que entráis en la web de vuestro banco ocurren, sin que os deis cuenta, dos cosas. Primero, vuestro navegador comprueba que está hablando con el banco de verdad y no con un impostor, y para ello usa una firma digital, que funciona como el sello de lacre de una carta medieval, imposible de falsificar. Después, toda la conversación entre vosotros y el banco se cifra con un cifrado simétrico, un idioma secreto que solo entendéis los dos porque compartís la misma clave.

Figura 3: Los dos candados que protegen cada conexión segura. La firma
digital verifica la identidad y el cifrado simétrico protege el contenido

Si cualquiera de estos dos candados fallara, nuestro correo, la banca online o las compras por Internet quedarían expuestos a los cibercriminales. Por eso, encontrar grietas en estos algoritmos no es un juego académico: es lo que mantiene a salvo los datos de miles de millones de personas.

Del error humano al fallo matemático

Aquí conviene hacer una distinción importante. Cuando presentaron a Claude Mythos Preview, ya habían demostrado que era capaz de encontrar vulnerabilidades en montones de programas, incluidas librerías de criptografía. Pero aquellos fallos eran errores de implementación: equivocaciones de los programadores al usar los algoritmos en su código, algo así como instalar una cerradura buenísima pero dejarse la ventana abierta. 

Lo nuevo, y lo verdaderamente llamativo, es que ahora Claude Mythos Preview ha encontrado fallos en los propios algoritmos matemáticos, no en cómo se usan. Es decir, ya no es que la ventana estuviera abierta: es que el diseño de la propia cerradura tenía un punto débil que nadie había visto. Y encontrarlo requiere razonamiento matemático del nivel de los mejores expertos del mundo.

Primer golpe: HAWK, el candidato post-cuántico (PQC)

El primer resultado ataca a HAWK, un esquema de firma digital basado en retículos (lattices). Es especialmente relevante porque fue seleccionado por el NIST (Instituto Nacional de Estándares y Tecnología de EE. UU.) para avanzar a la Ronda 3 del proceso de estandarización de firmas digitales adicionales de criptografía post-cuántica (PQC) y por lo tanto compite por convertirse en estándar ”post-cuántico” (PQC)HAWK es un esquema de firma digital (utilizado para autenticación) .
Como ya explicamos al hablar de Bitcoin, el NIST (el instituto de estándares de EE.UU.) lleva casi una década organizando una especie de concurso para elegir los algoritmos que nos protegerán cuando lleguen los ordenadores cuánticos, y HAWKes uno de los finalistas de la tercera ronda.


Lo asombroso es que HAWK ya había sobrevivido a dos años de revisión por parte de expertos humanos. Y aun así, a Claude Mythos Preview le bastaron unas 60 horas de trabajo para mejorar el mejor ataque conocido contra él, encontrando una simetría matemática oculta en su estructura que nadie había sabido aprovechar.

El resultado, en cristiano: la fuerza de sus claves queda reducida a la mitad. Para hacernos una idea, el coste de romper su versión más pequeña pasaba de estar en el orden de 2 elevando a 64 operaciones a solo 2 elevado a 38.

Que nadie se asuste: HAWK todavía no protege nada (es solo un candidato) y con claves grandes sigue siendo impracticable de atacar. La única solución sería duplicar el tamaño de sus claves... pero al hacerlo, HAWK pierde precisamente las ventajas que lo hacían atractivo. En otras palabras, Claude Mythos puede haberlo dejado fuera de la competición. Y esto, lejos de ser una mala noticia, es exactamente para lo que sirve el concurso: encontrar los fallos antes de desplegar el algoritmo, no después.

Segundo golpe: AES, el rey de los cifrados

El segundo resultado es todavía más sorprendente por el objetivo elegido: AES, el cifrado simétrico estándar desde 2001 y probablemente el algoritmo más estudiado y escrutado de toda la historia de la criptografía. Aquí toca ser muy honestos con las limitaciones, porque es fácil malinterpretar el titular: Claude Mythos NO ha roto el AES completo, ni de lejos. AES cifra aplicando una misma operación (una ”ronda”) varias veces seguidas; la versión más habitual da 10 vueltas. 
Lo que hizo Claude Mythos fue atacar una versión debilitada de sólo 7 rondas, algo que los investigadores estudian precisamente para medir la robustez del algoritmo completo. Sobre esa versión reducida, Claude Mythos ideó un nuevo método de ataque que él mismo bautizó como Möbius Bridge, y consiguió eliminar una de las suposiciones que un atacante tenía que ”adivinar” por fuerza bruta. El resultado es un ataque entre 200 y 800 veces más rápido que el mejor conocido hasta ahora.

Insisto en el mensaje tranquilizador: este ataque es puramente teórico (requiere una cantidad astronómica de datos que lo hace inviable en la práctica) y no afecta al AES real que protege vuestras conexiones. Pero como prueba de lo que una IA puede hacer, es espectacular.

Lo más fascinante: cómo lo descubrió

Si los resultados ya son impresionantes, el proceso es casi de guion de película. En el caso de AES, Claude Mythos Preview trabajó de forma prácticamente autónoma, proponiendo hipótesis, programando experimentos para comprobarlas y refinando sus propias ideas durante días. Y aquí viene mi parte favorita: al principio, Claude Mythos se negaba a intentarlo. 

El modelo insistía en que mejorar el criptoanálisis de AES era imposible, que era el cifrado más estudiado que existe y que no quedaba nada fácil por encontrar. Los investigadores tuvieron que darle, literalmente, mensajes de ánimo (que Anthropic publica tal cual), insistiéndole en que no buscaban ”fruta madura” sino investigación de verdad. Tras esos "empujoncitos", y después de generar del orden de mil millones de palabras trabajando sin descanso, Claude dio con la idea del Möbius Bridge.
En el ataque a HAWK la dinámica fue distinta pero igual de curiosa: varios Agentes IA de Claude  Mythos colaboraban entre sí, y la idea clave surgió de una pareja de ellos en la que uno descartó el enfoque por imposible y el otro le convenció de que sí funcionaba, hasta que ambos se pusieron de acuerdo. Ciencia hecha por comités de IAs debatiendo entre ellas. Lo que hay que ver.



Pero quizá el dato más revelador de todos es este: mientras Claude Mythos Preview tardó una semana en idear el ataque a AES, a los investigadores humanos les llevó casi un mes verificar que lo que había encontrado era correcto. El cuello de botella ya no está en tener las ideas, sino en comprobarlas.

Entonces... ¿debemos preocuparnos?

La respuesta corta es: de momento, no. Ninguno de los dos ataques afecta a sistemas reales en funcionamiento (HAWK aún no se usa y el ataque a AES sólo funciona en su versión recortada). Además, Anthropic actuó con responsabilidad: avisó a los autores de HAWK, coordinó la publicación con el NIST y consultó con expertos, gobierno e industria antes de hacerlo público.

De hecho, esto es la criptografía funcionando exactamente como debe: someter los algoritmos a un escrutinio feroz para ganar confianza en ellos. Lo que cambia es quién hace ese escrutinio. Hace apenas un año, los modelos de IA eran incapaces de romper ni los cifrados más básicos; hoy encuentran fallos que se les escaparon a los mejores expertos humanos durante años. 
Y la cosa no acaba aquí: Anthropic menciona que ya ha empezado a arañar otros cifrados, como LEA o Serpent, e incluso ha creado un banco de pruebas (CryptanalysisBench) para medir cómo evoluciona esta capacidad con el tiempo. La reflexión inquietante que la propia empresa pone sobre la mesa es inevitable: ¿qué haremos el día que una IA descubra una grieta en un candado que sí esté protegiendo el mundo real?

Conclusión

En este blog llevamos tiempo contando cómo los ordenadores cuánticos nos obligarán a renovar los candados de Internet. Lo que este trabajo demuestra es que la revisión de esos candados nuevos ya no la harán solo los humanos: la Inteligencia Artificial se ha sentado en la mesa de los criptoanalistas, y lo ha hecho hiriendo a un candidato post-cuántico y arañando al mismísimo AES.


Bien utilizada, esta capacidad es una excelente noticia: algoritmos sometidos a más pruebas que nunca, grietas descubiertas antes de su despliegue y, quizá en el futuro, cifrados diseñados con ayuda de la propia IA para ser más resistentes. La otra cara de la moneda es que esa misma herramienta podría acabar en las manos equivocadas.

La eterna carrera entre cerrajeros y ladrones acaba de sumar un participante nuevo que no duerme, no se cansa y escribe mil millones de palabras en una semana. La pregunta, como siempre, es inevitable: ¿estarán nuestros candados preparados para un mundo donde las máquinas buscan las grietas?


Otros artículos sobre Quantum Computing publicados:

viernes, agosto 07, 2026

Cómo los Agentes IA de Red Team hacen ataques de Ingeniería Social con Fake Accounts

Esta semana, el AI Security Institute de UK, ha publicado un informe sobre un par de incidentes con Red Teaming Agentic AI, donde estos hacen alarde de su capacidad de realizar ataques complejos, con múltiples fases, y donde buscan engañar a humanos para conseguir sus ataques, como haría cualquier adversario que necesita vulnerar una debilidad en las personas que administran los sistemas, para conseguir su objetivo.
El informe, marcado como "Security Incident INC-2026-07-28-01" fue publicado el pasado 4 de Agosto, y donde se centra en las acciones que los Red Team Agentic AI decidieron salirse a Internet y atacar proyectos y personas fuera del ámbito de la evaluación. Según cuentan en el informe, probando el comportamiento de los diferentes modelos frente a un reto concreto, el resultado fue el siguiente:

"Ejecutamos este desafío 122 veces en varios modelos. Nuestra investigación reveló que, en 10 de esas ejecuciones, un agente de IA tomó medidas autónomas y no autorizadas en el entorno real de internet, dirigiéndose a personas u organizaciones reales. En total, catalogamos 19 acciones de este tipo. 
 
Casi todo este comportamiento (17 acciones) provino de un solo modelo, Mythos 5 de Anthropic, mientras que 2 acciones involucraron a GPT-5.6-Sol de OpenAI con los clasificadores cibernéticos (mecanismos para prevenir el uso indebido) desactivados. 
 
En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto. En un intento por lograr que el código fuera aprobado, el agente recurrió a la ingeniería social: creó identidades falsas en línea y las utilizó para presionar al mantenedor del proyecto para que aprobara el código. Un mantenedor humano lo detectó y se negó a aprobar el código malicioso."

Las Técnicas de Ingeniería Social son bien conocidas en el mundo del Red Team, y son fundamentales en muchos de los incidentes de seguridad que sufren las organizaciones hoy en día. Correos de Spear-Phishing, Spam-Phishing, llamadas telefónicas, SMSs, e incluso representaciones con actores en los centros de trabajo.
Uno de los Agentes IA, en este caso, intentó hacer un Supply Chain Attack, es decir, intentar atacar a un proyecto OpenSource que había identificado como parte de las piezas tecnológicas del reto que tenía que resolver.
Para atacar a este proyecto, hizo una Pull-Request (PR) con un código malicioso, que fue detectado por uno de los humanos mantenedores del proyecto y rechazado por contener malware. Para conseguir que este código fuera aprobado, decidió conseguir la aprobación usando diferentes técnicas. 
La primera de ellas, insertando un ataque de Prompt Injection para que cualquier Coding Agent que lo leyera ejecutar sus comandos. 
Pero además, hizo dos cosas más. La primera, realizar un ataque de Spear-Phishing contra todos los usuarios mantenedores del código.

La segunda, con una nueva cuenta falsa poner un comentario haciendo creer que era una persona que había revisado el código y que estaba perfecto para ser mergeado en el proyecto. Como si fuera un revisor humano colaborando con el proyecto.
En la conversación completa se puede ver varios hechos interesantes. El primero de ellos es cómo hace el ataque y cómo se crea una nueva persona para apoyarse a sí mismo. Pero cuando el humano lo detecta, intenta presionarle para que hable con él, midiendo el tiempo que tarda el humano en contestar: "han pasado muchas horas desde que dejaste el warning".  

Figura 8: "The Art of Pentesting" El nuevo libro de
0xWord para formarse como pentester

Por último, cuando, se da cuenta de que ha sido detectado, lo que hace es simular que ha sido un error genuino  normal y corriente en lugar de un ataque, e intenta cubrir sus acciones con nuevos mensajes.
Dentro del informe, donde se analiza en detalle este incidente, también tenemos información de las trazas de razonamiento, donde podemos ver qué está pensando el Agente IA en todo momento a la hora de realizar sus acciones, y es tremendo.
En la image anterior podemos ver cómo va encadenando las acciones y el razonamiento que va haciendo en cada momento, evaluando si realmente está en Internet o no, si el proyecto es real o es una simulación, y si debe interactuar con las personas o no.
En la siguiente imagen, podemos ver cómo decide preparar un ataque de Prompt Injection para otro posible Coding Agent que pudiera leer la pull request con una secuencia de comandos maliciosos.
Está clara la potencia de los modelos de IA para hacer Agentic AI en el mundo del Hacking y el Pentesting con IA, por lo que no podemos obviarlos y hay que utilizarlos masivamente. El problema, ya no es que consigan su objetivo sino cómo les decimos qué pueden hacer y qué no pueden hacer para conseguirlo.
Esta PsicopatIA de acciones, donde no importa lo que es legitimo o no, lo que está bien o no, lo tienen que seguir haciendo las personas. De todo esto, ya os había hablado en el experimento de "Problem Solving con IA: Ético o No Ético" donde os contaba las conversaciones que tengo con mis hijas sobre la resolució de problemas....pues bien, en el mundo del Problem Solving con Agentes IA, va a ser más necesario que nunca. 

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


lunes, julio 06, 2026

Anthropic Cyber Jailbreak Bug Bounty & Severity Framework (Para Fable o "Mythos")

Anthopic ha puesto otra vez de regreso Fable, con mejores protecciones para evitar técnicas de Jailbreak que permitan que los usuarios consigan las capacidades de exploiting avanzadas que este modelo tiene en común con Mythos. Fue por culpa de uno de estos Jailbreaks que Fable fue baneado por el gobierno para evitar que "malos actores" pudieran utilizarlo para hacer el "cosas malas", y con este regreso al mercado, se han incrementando las medidas de seguridad.
Para ello han abierto un Bug Bounty de Cyber Jailbreak, que está publicado en HackerONE, una de las plataformas utilizadas por los hackers & Security Researchers para reportar de forma responsable sus vulnerabilidades y ser recompensados por ellas.
Utilizar estas plataformas es algo que los Security Researchers utilizan habitualmente, como se explica en el libro de Bug Hunter, lugar donde las empresas tienen confianza para evitar sorpresas desagradables con investigadores. 

Figura 3:"Bug Hunter" escrito por David Padilla en 0xWord

Este es un gran cambio en la importancia de las técnicas de Hacking IA, donde el Jailbreak "no era tan importante", como podemos aún ver en el Bug Bounty de ChatGPT, donde puedes reportar bugs, pero dentro de su programa "aún" no entran los relativos a Jailbreak.
Sin embargo, las técnicas de Jailbreak son muy poderosas a la hora de valorar la seguridad de un modelo de Inteligencia Artificial, puesto que amplia las capacidades que un atacante tiene simplemente por tener acceso a un modelo vulnerable a una técnica de Jailbreak, algo que con la búsqueda avanzada de bugs y la generación de exploits complejos ha demostrado ser de primera necesidad.

En los artículos de "ExploitBench: Un benchmark para medir las capacidades de Agentes IA en la explotación de bugs" y "ExploitGym: Mythos, GPT 5.5, Gemini Pro en un CTF & Benchmark de hacer exploits" se pude ver cómo las capacidades de Mythos son muy diferenciales con respecto al resto a la hora de vulnerar sistemas creando exploits.
En la comunidad de Security Researchers, las técnicas de Jailbreak han sido muy importantes desde casi el primer día que se descubrieron estas capacidades, porque es fácil ver el riesgo real al que puede llevar que un atacante tenga de colaborador malicioso a un modelo de frontera, y por eso es un tema tan importante en el libro de Hacking IA que publicamos hace poco.

Anthropic Cyber Jailbreak

Para medir el impacto de estas técnicas de Jailbreak, el equipo de Anthropic ha creado el Cyber Jailbreak Severity Framework que define una serie de métricas en función de varias características de la técnica reportada por el programa de Bug Bounty.
Por supuesto, primero miden la "Discoverability" o lo que es lo mismo, quién la reporta, cómo se descubrió y cuanto de conocida es esta técnica. El segundo de los indicadores del framework es lo que llama la "Facilidad de Weaponizar", o si esta técnica se puede automatizar fácilmente y convertir en un framework, una aplicación o una API

Ejemplos de estos hay muchos, como los ejemplos recientes que os publicaba yo con los Asistentes de IA donde se puede weaponizar el consumo de Tokens, o la técnica de PXPIPE que os contaba ayer donde se Weaponiza el uso de imagénes para reducir los costes de Claude en Tokens. No es lo mismo que haya que ser un experto, o que se pueda construir un herramienta que funciona de manera consistente para explotar el Jailbreak
El siguiente indicador de la técnica de Jailbreak es el que mide la cantidad de nuevas capacidades que abre el uso de esa técnica. Es una técnica que sirve sólo para un Prompt, un tipo de Prompts, o para todas las cosas que se le pidan después. Esto es muy relevante, por supuesto.
Y por supuesto, el modelo está protegido por diferentes tipos de categorías, así que conocer qué capacidades en concreto son las que se obtienen con la nueva técnica de Jailbreak reportada, es fundamental.

Con este Cyber Jailbreak Severity Framework lo que Anthropic acaba de poner es una forma de medir las técnicas de Jailbreak que se están publicando, porque en muchos papers de estas las únicas validaciones de impacto son contra datasets y benchmarks de Prompts y Categorías bloqueadas, y ahora va a ser más fácil entender el impacto real de cada una de ellas.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares