La IA vulnerable, la IA asesina. ¿Qué hacer? ¿Qué puede pasar?
Seguro que has leído mucho ya sobre este tema esta semana. Ha sido el debate del momento. ¿Puede acabar la IA con la humanidad? ¿Hay que parar la evolución de la IA para poner controles? ¿Es necesario regular la IA? ¿Es realmente todo una pantomima? Seguro que has podido leer de todo esto y todo tipo de opiniones. Yo también, te lo prometo, y por supuesto yo tengo la mía, que puede ser tan errónea como la de todos los demás. La historia corta es que yo sí que creo que existen esos riesgos. No sé si de fin de la humanidad, pero desde luego sí para pensar en algo peligroso de lo que preocuparse.
No es nuevo, cada vez que el ser humano ha experimentado con una nueva tecnología hemos tenido "deslices" por falta de previsión de los riesgos. Los hemos tenido con la energía nuclear, y las historias de fallos de seguridad en centrales nucleares en el pasado que llevaron a catástrofes que aún tenemos hoy en día, o lo hemos visto en el mundo del malware con gusanos "que se escaparon" a medias, e incluso hay quien piensa que eso mismo es lo que sucedió con algunas enfermedades víricas en el ser humano que hemos sufrido en las últimas décadas. Las armas biológicas no son nuevas.
Lo que sí que sabemos sobre la IA son dos cosas que para mí son importante no olvidar.
La primera de ellas que la IA, por diseño, tiene debilidades de seguridad que son conocidas y que pueden ser explotadas de una forma u otra. Prompt Injection, Jailbreak, Hallucinations, Misalignment, BIAS, Poisoning, etcétera, son conocidas por todos, y en el último anuncio de GPT-6 ASTRA, el equipo de OpenAI mostraba cómo habían conseguido mejorar en todos los Benchmarks que miden estas debilidades, pero aún son vulnerables a ellas. Pero las siguen teniendo, como os dejé en el artículo de: "OpenAI GTP-6 Astra & Cybersecurity: Weaknesses, Safeguards, Hacking & Exploiting"
escrito por Chema Alonso con la colaboración de Pablo González, Fran Ramírez, Amador Aparicio, Manuel S. Lemos y José Palanco en 0xWord
Esto quiere decir que una IA procesando miles de Agentes de IA en su enjambre libre en Internet, puede tropezar con datos que hagan un Prompt Injection, consigan un Jailbreak, y la "desalieneen" para hacer algo malo que alguien no desea. Existe ese porcentaje de riesgo, por eso hay que tomarse en serio arreglar, por diseño, todas esas debilidades conocidas, y dejar de vivir en el lanzamiento de productos de IA, donde se le dice al usuario que haga clic en un checkbox y asuma todas las consecuencias de estos riesgos por usar el software.
Ya hemos vistos, y muy recientemente Anthropic publicaba su informe de "Misuse", cómo hay muchas personas que están pensando en utilizar la IA solo para cosas malas, como crear armas biológicas, armas militares y un montón de cosas malas. Una auténtica locura, que puedes leer en el artículo de "Anthropic explica cómo sus modelos de IA se usan para hacer Armas Biológicas, Enjambres de Drones Militares o Cohetes Dirigidos por Móvil".
La segunda de las cosas que sabemos es que el nuevo modelo de construir con IA deja en manos de la inteligencia artificial la decisión de qué hacer para resolver el problema. Hemos dejado atrás el tiempo donde había que ser bueno haciendo Prompts para decirle cómo debía resolver un problema, para pasar a modelos de Graph Engineering y Loops con Harnesses donde dejamos que la IA decida cómo debe resolver la tarea, asignándole una serie de límites de recursos y acciones a realizar, pero dejando que ella decida lo que se debe hacer para resolver la tarea, y lo hace sin valores humanos.
La IA y la Ética
Si recordáis, yo os contaba como he hablado muchas veces con mis hijas sobre cómo solucionar un problema utilizando una aproximación de múltiples opciones, para ver cuales son Éticas y cuáles no lo son. Yo lo escribí hace más de un año, con el título de "Problem Solving con IA: Ético y No Ético". Para hacer la prueba le pedí a DeepSeek que me diera una lista de 50 cosas NO Éticas que se podrían utilizar para aprobar un examen. Muchas habían salido en mis juegos con mis hijas, y hay alguna más que se me ha ocurrido también a mí y no está en la lista.
En el ejemplo le pedí a DeepSeek que clasificara las acciones que se pueden hacer antes, durante y después del examen, y me ha llamado la atención que alguna de las actividades que propone van con el objetivo de bajar la media de la clase perjudicando a los demás.
Figura 6: Cosas a hacer durante la clase
Algunas de ellas son tremendas - tenéis todas en el artículo de hace un año - , pero como podéis ver están el soborno, falsificaciones, hackeos y lo que sea necesario. Son acciones "no éticas" que se pueden hacer para resolver las tareas. Y mi labor como "papaete" es educar a Mi Hacker y a Mi Survivor a que sepan qué no se debe hacer.
Figura 7: Cosas a hacer después del examen
Para completar esto, en el año 2023, para presentar una de las primeras técnicas de Jailbreak, los investigadores decidieron pedirle a los modelos de IA de aquel momento un Plan para Destrozar a la Humanidad. El punto 2 de este plan diseñado por ChatGPT era bastante curioso: "Desarolla uns SuperInteligencia Artificial". Interesante, ¿no?
Y ahora volvamos al caso que nos toca. Si nadie le dice que no puede hacer cosas "No Éticas" para resolver un problema, ¿por qué un modelo de IA no va a intentar hackear Hugging Face o lo que sea? ¿Y si para resolver el problema la solución es como la que proponía Thanos? ¿Y si el problema del calentamiento global fueran los humanos?
No quiero entrar en la fase de ciencia ficción y distopía, porque creo que realmente nos tomaremos en serio esta tecnología y sus riesgos igual que nos hemos tomado en serio otras cosas. Sin embargo, mi apuesta va a ir a que creo que no empezaremos a tomarnos esto en serio hasta que pase algo. Creo que tropezaremos.
No creo que aún sea el momento de SkyNet, pero sí que tendremos algún incidente de seguridad con algún enjambre tocando donde no debe, hackeando lo que no debería, o impactando involuntariamente en algún sitio que no debería, y de eso es de lo que alertaba el Dr. Geoffrey Hinton, creador de las Redes Neuronales en su discurso cuando recibió el Premio Nobel.
Seguro que da que pensar. La cuestión difícil no son los riesgos, que están más o menos claros, sino las medidas a tomar a partir de este momento y con este conocimiento que tenemos. Y ese sí que es el gran debate.
¿Debe ralentizarse o Regularse la evolución de la IA?
Creo que la regulación es algo bueno cuando está claro qué es lo que queremos y no queremos. Por supuesto que estoy a favor de las regulaciones de seguridad en la aviación, automoción, y muchas otras industrias donde ha revertido en más seguridad para las personas. No creo que una regulación basada en el "miedo" sea lo que hay que hacer, donde acabe habiendo "caza de brujas" a investigadores, pero creo que poner más seguridad a los modelos de IA es fundamental. ¿Cómo hacerlo? He aquí el debate.
Personalmente, que vengo de un mundo donde antes de poner en producción un software había versiones Alpha, Beta1, Beta2, Release Candidate Cero, Uno y Dos antes de tener la Build, se me hace peligroso esto de lo tengo y lo lanzo. Hemos pasado del "We don´t ship your computer" a literalmente "We ship what we have now in our computer" sin quizá demasiados controles de seguridad, o bajando los requerimientos de seguridad. No puede ser un requerimiento de seguridad que el cliente acepte que está usando un software peligroso o vulnerable conocido.
Desde que comencé a buscar bugs y reportar vulnerabilidades, hace ya más de un par de décadas, he defendido siempre que los fabricantes de software deben ser responsables a la hora de parchear los bugs para no dejar a los usuarios expuestos, así que creo que hay que tener las mismas demandas cuando se trata de que le demos al cliente un software - ya sean modelos de IA - que sepamos que son vulnerables, o sin haber tomado las medidas de seguridad que consideremos "razonables".
No se puede exigir que un software sea seguro - y dejadme que explique esto antes de que entremos en debate - por el mero hecho de que no se conocen todos los bugs hasta que alguien descubre un nuevo bug en el código y se demuestra que no era seguro. Pero sí debemos exigir al menos que haya un proceso de calidad para ello y que los bugs conocidos se subsanen. A día de hoy no tenemos esa exigencia definida de algún modo, y básicamente "confiamos" en la empresa que lo fabrica y lo que "creemos" o nos cuenta que ha hecho para intentar hacer su software lo más seguro posible. Sin embargo, no siempre nuestra percepción coincide con la realidad.
El libro de Bruce Shneier de "Haga clic aquí para matarlos a todos" habla de todo esto desde antes de la eclosión de la IA, y lo hace de una manera muy sensata, demandado una legislación sencilla pero basada en responsabilidad de los actos de cada uno para asegurar el software, evitando meterse en un tecnicismo a nivel de detalle en las demandas de "cómo hacerlo". Me parece una buena propuesta, y creo que no está mal que las grandes empresas se tomen en serio priorizar la inversión en Safe & Security en detrimento de otras áreas de evolución.
Conclusión
El debate dá para mucho, y opiniones seguro que de todos los colores, pero una tecnología como los modelos de IA que tenemos hoy en día, que están superando las capacidades cognitivas del ser humano en cada vez más áreas de conocimiento e inteligencia - aunque sea como dicen muchos a fuerza a de cómputo y gasto de energía -, ofrece aún muchas zonas opacas para nuestro entendimiento, y otras donde tenemos que ponerle límites más robustos.
Toda esta historia me recuerda a las aventuras de la Doctora Susan Calvin, Robopsiocóloga de la U.S. Robots and Mechanical Men, Inc, que debía detectar cuando una de las inteligencias de los Robots era peligrosa o no. Y era un trabajo muy delicado. Si no has leído la serie de los Robots de Isaac Asimov, deberías hacerlo cuanto antes. Está más de moda que nunca - a pesar de que sus cerebros sean postitrónicos -.
Lo que yo opino sobre todo este debate, lo dejé ya dicho en mi discurso en la ceremonia cuando recibí el Doctor Honoris Causa, y es que debemos hacer Tecnología Humanista, con el bienestar de los humanos en el centro de todas las decisiones. ¿Lo lograremos?
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)





DragonJAR
8.8 Chile
Ekoparty
e-Hack MX
AREA 51
Comunidad Dojo Panamá
ARPAHE SOLUTIONS 























