Mostrando entradas con la etiqueta bias. Mostrar todas las entradas
Mostrando entradas con la etiqueta bias. Mostrar todas las entradas

sábado, agosto 01, 2026

La ética como “Safety Net”: Por qué la IA responsable acelera la innovación (y no la frena)

Cuando se habla de ética y regulación de la inteligencia artificial, la reacción más habitual -también entre gente muy sensata- es pensar en un freno. Un comité más, un formulario más, un abogado más entre la idea y el producto. Yo llevo defendiendo justo lo contrario desde hace años, y con RAIGHT.ai, la startup que he cofundado junto a Miguel Ángel Liébanas, Laura González, Ricardo Palomo e Idoia Salazar, hemos intentado demostrarlo con una plataforma, no solo con argumentos.


La tesis es sencilla: la ética by design no es un obstáculo para innovar rápido, es la condición para poder hacerlo con seguridad. Y como en tantas cosas de la vida, conviene explicarlo con sobriedad holandesa, sin caer ni en el alarmismo (“la IA nos va a destruir”) ni en la ingenuidad (“ya se regulará solo”).

El problema: demasiados principios, poca práctica

Desde 2018 llevamos trabajando en IA ética y responsable, primero desde OdiseIA, el observatorio que fundamos en 2019 y que hoy es referencia internacional en la materia. En todo este tiempo hemos visto proliferar recomendaciones —UNESCO, OCDE, Consejo de Europa— y regulaciones, con el AI Act europeo a la cabeza.

Todas apuntan en buena dirección, pero -aparte del AI Act- comparten un mismo defecto: se quedan en principios de alto nivel (“evitar el sesgo”, “garantizar la transparencia”) sin decir cómo hacerlo en un caso de uso concreto.
Es la diferencia entre decirle a un desarrollador “cuidado con el sesgo” y decirle “este sistema de selección de personal puede discriminar a mujeres en roles técnicos por el histórico de contrataciones; aquí tienes el requisito concreto para mitigarlo”. La primera frase genera ansiedad. La segunda, acción.

La solución: gobernanza automatizada, con supervisión humana

RAIGHT.ai nació en el verano de 2024 para resolver justo ese salto entre la teoría y la práctica. La plataforma parte de un inventario propio de más de 800 riesgos éticos de IA, construidos analizando con IA generativa más de 15.000 incidentes reales recogidos por repositorios como el AI Incident Monitor de la OCDE, el AI Risk Repository del MIT o AIAAIC (AI, Algorithmic and Automation Incidents and Controversies). 

A cada riesgo le hemos asociado, también con ayuda de IA generativa y revisión humana posterior, los requisitos de mitigación concretos y accionables. (Ver Benjamins et al., “Responsible AI: from theory to practice”, capítulo del próximo Handbook of AI Ethics de Springer.) El flujo, en la práctica, es este:
  • Registro automático del caso de uso: Se sube documentación del sistema de IA (una ficha técnica, una descripción funcional) y la plataforma extrae automáticamente los datos relevantes.
  • Detección inteligente de riesgos: Con un clic, la plataforma compara el caso de uso contra el inventario y propone los riesgos aplicables. El equipo humano tiene que confirmarlos explícitamente; nada se acepta “a ciegas”, precisamente para evitar el riesgo de sobre-confianza en el propio sistema.
  • Lista de requisitos accionable: Para cada riesgo confirmado, aparecen los requisitos de mitigación correspondientes, documentados, asignados y trazables hasta su resolución. 
Lo hemos probado, entre otros, con COMPAS, el conocido sistema estadounidense de evaluación de riesgo de reincidencia usado en el ámbito judicial: la plataforma identifica sin dificultad los riesgos de discriminación algorítmica que ya denunciaron periodistas e investigadores hace años, y propone las salvaguardas que deberían haberse aplicado desde el diseño.


Por qué esto es bueno para el negocio (y no solo para la conciencia)

Aquí es donde quiero insistir, porque es el mensaje que peor se entiende: la IA responsable no compite con la innovación, la habilita. Hay al menos tres razones de peso: 
  • Innovación más rápida y barata: Cuando los riesgos se detectan al principio del diseño, corregirlos cuesta una fracción de lo que cuesta hacerlo después del lanzamiento, con la reputación ya dañada. Un equipo que sabe que tiene esta “red de seguridad” puede permitirse experimentar más, no menos.
  • Confianza de clientes y talento: El 93% de los consumidores valora la responsabilidad social de las empresas que eligen, y el 64% del talento digital prioriza estos valores a la hora de elegir dónde trabajar. En un mercado donde captar y retener talento técnico es una batalla constante, no es un dato menor.
  • Atractivo para inversores: Cada vez más fondos incorporan criterios ESG a sus decisiones, y la IA ética entra de lleno en la “S” de social. Hay ya rankings, como el de Ranking Digital Rights o el modelo de madurez de la GSMA, que puntúan explícitamente la gobernanza responsable de la IA.
Y hay un cuarto argumento, más pragmático: bajo el AI Act, sólo los sistemas de riesgo alto o limitado tienen obligaciones específicas. Con una plataforma que registra todos los casos de uso y su perfil de riesgo, una organización puede ir más allá del mínimo regulatorio con un esfuerzo adicional pequeño, y convertir el cumplimiento en un activo de confianza en lugar de en un ejercicio defensivo.

“Human in the loop”

Lo que proponemos con RAIGHT.ai no es sustituir el criterio humano por un algoritmo que dice “sí” o “no”. Es automatizar lo automatizable: la búsqueda en un inventario de miles de riesgos conocidos, la generación de la primera versión de los requisitos, para que las personas dediquemos el tiempo a lo que de verdad requiere criterio: decidir, priorizar, y responder por esas decisiones. La supervisión humana no es un trámite en nuestra metodología, es una pieza de diseño.


Resumiendo una cita famosa de Johan Cruyff, “jugar bien no es dar mil pases, es dar el pase justo en el momento justo”. La IA responsable no consiste en poner mil controles, sino en poner los controles justos, en el momento justo del ciclo de vida del sistema, es decir, al principio, cuando aún se puede diseñar bien, no al final, cuando solo queda apagar fuegos. 

Nota de transparencia: este artículo ha sido redactado con la asistencia de herramientas de IA generativa a partir de material propio (paper académico, presentación corporativa y contenidos de raight.ai), con revisión y edición humana final.

Autor: Dr. Richard Benjamins, CEO RAIGHT.ai

miércoles, junio 03, 2026

La Orden Ejecutiva de la Casa Blanca para promover Innovación en IA Avanzada y Seguridad para protegerse de, y con, la IA

Ayer antes de irme a la cama me topé con la publicación de la Presidential Executive Order del 2 de Junio que publicaba la Casa Blanca de Estados Unidos para "Promoting Advanced Artificial Intelligence Innovation and Security", donde se insta a los principales organismo del gobierno de los EEUU a tomar en el plazo de un mes medidas para Mejorar la Innovación en IA Avanzada y en Seguridad, algo que a todo el mundo empresarial tiene muy preocupado últimamente.
Ya he hablado mucho de esto, pero básicamente el Impacto de la IA en la Ciberseguridad de una organización, sea esta una Infraestructura Crítica, una Empresa o un Organismo del Gobierno, se puede catalogar en varios puntos fundamentales, que son los que ha intentando reflejar esta orden que podéis leer completamente.

1.- La IA inyecta nuevos problemas de seguridad

De esto he hablado muchas veces, y hasta hemos publicado el libro de "Hacking AI", donde se tratan todos los problemas de seguridad de los que nos debemos preocupar si se utilizan sistemas con modelos de IA. Desde los BIAS, hasta las Hallucinations, pasando por el Poisoning de datos y de modelos, los problemas de Jailbreak, la vulnerabilidad a las técnicas de Prompt Injection, y el Desalineamiento de los modelos, que fuerzan los atacantes.
Todos estos problemas de seguridad no deben frenar el desarrollo y el uso de la IA, pero sí que exigen desarrollo de planes de contención robustos basados en Guardarrailes, y el despliegue seguro de IA... que no es tan sencillo. 

En la Executive Order, en el primer punto de la misma podemos leer lo que tenéis arriba, y es que las capacidades de IA hacen a la nación más fuerte, pero también introducen nuevas consideraciones de seguridad que hay que tomar en cuenta, para lo que se insta a hacer muchas cosas.

2.- Securizar IA y usar IA para Securizar

En la Sección 2 de la Executive Order, donde se insta a todos los departamentos a tomar precauciones, toca tes puntos muy relevantes, a saber:


El primero de ellos es el que todos conocemos, y es que un adversario con IA es un adversario mucho más peligroso hoy en día. Tanto en el uso de Agentes IA de Seguridad Ofensiva, como en la búsqueda y explotación de vulnerabilidades. 
Agentes de Seguridad Ofensiva de gran efectividad y modelos como Mythos, son ya una realidad presente que hace que las soluciones de seguridad hasta el momento se queden insuficientes.

3.- Buscar bugs con IA y Parchearlos con IA

El segundo de ellos es que hay que que utilizar herramientas de seguridad basadas en IA, es decir, el uso de Agentic SOC, uso de IA para detectar ataques e, incluso, utilizar IA para parchear sistemas, como el caso de Plexicus, que está empujando José Palanco, del que tanto os he hablado ya, que permite parchear en caliente y gestionar las vulnerabilidades de una organización de manera automática utilizando IA.

Figura 7: Plexicus parchea con IA los bugs descubiertos

El tercero de los problemas es permitir el acceso a nuevas herramientas de seguridad que puedan resolver los nuevos problemas de seguridad que introducen los sistemas que utilizan IA. Hace un par de días os hablaba del Despliegue de Agentes AI con políticas de Zero-Trust y la cantidad de nuevas herramientas que son necesarias para proteger, medianamente, un entorno de Agentic AI en una organización.
Además, para poder hacer este trabajo, hay que realizar, como hace todo buen CISO, una nueva auditoría buscando vulnerabilidades en todos los sistemas utilizando herramientas de AI - tipo Mythos - para buscar esas vulnerabilidades, y parchearlas lo antes posible. 

4.- Auditoría de los Modelos de Frontera 

La última parte de la orden tiene que ver directamente con los Modelos de Frontera de IA que se van a utilizar con todo este proyecto, donde se insta a que se haga un Benchmarking de auditoría completo para saber cuáles son los modelos que, en función de las necesidades anteriormente descritas cumplen o no cumplen los requisitos que se les demandan.
Como podéis ver, habla en todo momento de Secure Frontier Model, porque son conocidas las debilidades y por tanto hay que poner en valor su robustez, y el despliegue seguro que se haga de los mismos con guardarraíles para tener entornos securizados.

Los plazos

Lo más llamativo, son los plazos. Se habla de 30 días y 60 días en todas las aciones demandadas, lo que muestra y evidencia el nivel de preocupación que el gobierno de los Estados Unidos tiene con el impacto de la IA en la Seguridad Nacional a todos los niveles. Os dejo esta charla de finales del año pasado - pre- Mythos -.


Figura 10: Inteligencia Artificial y Ciberseguridad

La pregunta que me surge es ¿haremos lo mismo en Europa pronto? ¿Lo haremos en todas las empresas en Europa pronto? Como se suele decir. "Clock is ticking".

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


lunes, junio 01, 2026

Despliegue Zero-Trust para Agentes IA

Estos días estamos aún con la resaca de la nueva versión de Anthropic Claude Opus 4.8 que trae mejoras incrementales en el funcionamiento de este modelo de frontera, pero hoy quería hablaros de la publicación de Zero-Trust for AI Agents, que puedes leer en la web, y descargarte en un documento que resume todas las protecciones que tienes que aplicar.
Tras la lectura del mismo, la sensación que me da es que es aplicar todas las protecciones que tenemos hoy en día, pero aún está lejos de resolver todos los problemas de seguridad y fortificación que son necesarios para un modelo de Agentes IA completamente autónomos que tienen accesos a datos, sistemas, y herramientas dentro de una organización, y que por diseño tienes las debilidades de BIAS, Hallucinations, Data Leakage, Jailbreak, Prompt Injection y Misalignment con la que los responsables de ciberseguridad deben lidiar. 

Sin embrago, es una lista de recomendaciones de todo lo que se debe hacer para, con las herramientas que tenemos hoy en día, proteger al máximo "que se pueda" el ecosistema de Agentes IA, y sobre todo, para limitar el impacto que puede tener la explotación de estas vulnerabilidades en los Agentes IA de tu organización. 

Despliegue Zero-Trust para Agentes IA

Para ello, el despliegue y la configuración de los agentes se basa en los principios del Zero-Trust, aceptando que no se puede confiar en ninguna pieza de la cadena - ni datos, ni herramientas, ni sistemas,  -, que hay que asumir que todo puede estar vulnerado en algún momento, y que hay que, por tanto, diseñar todo con el menor privilegio posible.

Figura 3: Blast Radius

De hecho, utiliza para sus recomendaciones dos conceptos que, aun no siendo nuevos, quizá la terminología pueda llevar a confusión, que son Blast Radius, y Least Agency. El primero de ellos es del "Radio de Impacto" o en el caso de de un explosión por vulneración del Agente IA, qué puede llegar a verse afectado - para conocer el impacto de una brecha en un determinado Agente IA -, y el de Least Agency, que es lo mismo que darle al Agente IA el menor de los privilegios posible en todos los sistemas que necesite para la ejecución de su rol, que en el caso de los Agentes IA puede ser un conjunto de cuentas, herramientas, accesos, ámbitos, que definen todas las cosas que podría hacer dentro de la empresa.

Figura 4: Least Agency

A partir de ese momento, hay que aplicar todas las posibilidades de fortificación por capas, analizando primeramente todos los riesgos que tenemos, que el documento cataloga en una arquitectura que, bajo mi punto de vista, no recoge todas las posibilidades de ataque, ni todos los riesgos existentes, pero al menos da un punto de partida.
El documento recoge como riesgos las técnicas de Prompt Injection - Directas o Indirectas -, es decir, por medio de un usuario malicioso que quiere desalinear el modelo directamente, o por haber leído un dato inseguro que quiere hacer lo propio. También reconoce como riesgo el uso de herramientas maliciosas en por medio de una manipulación de las mismas o de los MCP Servers conectados, que es otra amenaza que hemos visto explotada en ataques.
En la parte de Identidad, el problema de las "Non-Human Identities" de las que hemos hablado varias veces, donde hay que controlar las cuentas, y los privilegios de cada una de las identidades que le permitimos utilizar a dicho Agente IA, para que todas tengan un "Scope" bien definido y controlado.
Una de las partes más complejas de asegurar dentro de un ecosistema de Agentes IA, es lo que aquí llaman la "Supply Chain", pero que no es más que entender que en un entrono multi-agente, y multi-modelo, cualquier pieza puede ser maliciosa, por lo que podemos tener Agentes IA con Modelos Envenenados o Agentes IA que han sido comprometidos, vía envenenamiento de su Memoria, Contexto o RAG, lo que hace que no te puedas fiar de ninguna llamada o colaboración. 
Figura 8: RAG Poisoning

El Prompt, las APIs, los Datos de tu RAG, el Contexto, o la colaboración con otros Agentes IA debe hacerse en un entorno Zero-Trust. A partir de este análisis, hay que aplicar una serie de herramientas y soluciones para desplegar AI con seguridad en la empresa. De esto yo os hablé en un artículo anterior, y llevado a los Agentes IA con "Non Human Identities", las propuestas de fortificación que recoge el documento se dividen en diferentes niveles, y diferentes tipos de organizaciones. Esta es la lista:
  • Agent identity verification: Darle una identidad única a cada Agente IA, basada en credenciales robustas, certificados digitales e incluso usando sistemas de protección de credenciales tipo HSM o TPMs para evitar el robo de credenciales.
  • Service Authentication: Verificación robusta de los servicios de la organización, de las identidades de los Agentes IA. No basta con que tengan identidad y credenciales, tienen que ser verificadas extremo a extremo en todos los servicios de la organización.
  • Observability and auditing: Registros y análisis de comportamiento. Esta es una pieza fundamental que muchas organizaciones no están atacando. Saber qué están haciendo y cómo lo están haciendo en todo momento para tener información basada en su comportamiento. 
  • Behavioral monitoring and response: Sobre los datos de registro, y las trazas de comportamiento, hay que tener herramientas de monitorización que detecten las anomalías de funcionamiento, y por supuesto, tener herramientas de respuesta automática.
  • Input validation and output controls: Guardarraíles para detectar BIAS, DLP, Hallucinations, Poisinoing Attacks, Jailbreak Attacks, Prompt Injection, Misalingments, etcétera. Esto exige un trabajo de ajuste fino en el diseño de cada Agente IA de una organización.
  • Integrity and recovery: Fortificación del entorno de configuración de cada uno de los Agentes IA, sistemas de rollback para acciones erróneas o peligrosas que un Agente IA haya podido realizar, y herramientas y sistemas de gobernanza de los Agentes IA. Ahí es nada.
Analizando esto, si eres de los que trabajas en Ciberseguridad, podrás ver que es un "stack" completo y nuevo de herramientas de fortificación, control, auditoría, observabilidad, gestión, que hay que desplegar completamente en la empresa, y que probablemente muchas organizaciones no tienen en los presupuestos, pero que los CISOs deben incorporar cuanto antes para que se puedan comenzar a trabajar de manera "más o menos" controlada en el mundo de los Agentes IA en los equipos de la compañía.
Como os podéis imaginar, este solo es una de las patas donde los CISOs deben estresar sus políticas y sistemas, ya que son despliegues completos para gestionar la seguridad de los Agentes IA, pero con la llegada de Mythos y los Agentes IA para ataques, los CISOs deben estresar las medidas y herramientas de seguridad para pensar en Agentes IA enemigos como adversarios, y eso demanda también nuevas inversions debido a la efectividad en la búsqueda de vulnerabilidades y explotación de las mismas por parte de Agentes IA ofensivos.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


domingo, noviembre 30, 2025

Inteligencia Artificial Generativa y Sesgos en las Imágenes de Mujeres y su Risa

La Inteligencia Artificial ha venido para quedarse y tenemos que prestar mucha atención a los posibles desafíos que puede traer consigo. Soy Monica Manrique y hoy os quiero hablar de los sesgos de género y la Inteligencia Artificial, que tiene no pocos retos en este área. Uno de ellos es la capacidad que tiene para perpetuar e incluso potenciar el sesgo de género que extrae de nuestros propios datos. La Inteligencia Artificial no es machista, pero si no se entrena correctamente, puedes asumir y perpetuar la parte de la cultura de nuestra sociedad que tiene esos sesgos machistas, ya que somos nosotras y somos nosotros los que tenemos esas desviaciones.

La Inteligencia Artificial sólo se nutre de los datos que generamos y nos pone delante un espejo como sociedad en el que no siempre salimos muy favorecidos. Pero ese golpe de realidad que nos ofrece, a pesar de resultar incómodo, lo podemos utilizar para el cambio hacia una sociedad más justa e igualitaria. De eso ha hablado mucho Chema Alonso en este blog, donde lleva más de 5 años recogiendo firmas para acabar con el Sesgo de Genero en los Traductores de Bing y Google, petición que os animo a firmar, que ya somos más de 35.000 personas los que hemos firmado esa petición.
Al menos, ya el traductor de Apple ha eliminado el sesgo de genero subliminal en las traducciones, pero aún hay muchos otros sitios donde la Inteligencia Artificial está perpetuando estas desviaciones culturales basadas en estereotipos y prejuicios.
El sexo es una realidad biológica con la que nacemos. Podemos ser hombre (XY) o mujer (XX), aunque también, hay algunas variantes cromosómicas que se dan de manera muy excepcional. Por otra parte, cuando hablamos de género, estamos haciendo referencia a el conjunto de roles, normas y estereotipos que nos dicta la cultura y la historia de la sociedad en la que vivimos sobre cómo tiene que ser un hombre y cómo tiene que ser una mujer, sin que esto deba suponer un detrimento de sus oportunidades, derechos, libertadas u obligaciones.

La risa en la mujer

Voy a utilizar una conducta muy concreta, la risa de las mujeres, para poner un ejemplo de cómo la Inteligencia Artificial Generativa nos muestra cómo somos y cómo puede potenciar los sesgos de género e influir en cómo de sesgados seamos en el futuro si no tomamos medidas correctivas.


Sabine Melchior-Bonnet ha investigado "La risa en las mujeres" y nos cuenta que durante mucho tiempo el humor nos ha estado prohibido en nombre del decoro, la belleza y la discreción y de cómo convenía oponer risa a feminidad:

“La risa es contraria a la imagen de la mujer modesta y púdica. Las costumbres del mundo son formales: si la risa del hombre es considerada una justa recreación o un remedio a su melancolía, una mujer que ríe siempre corre el riesgo de pasar por una descarada, una vividora atrevida, una loca histérica, o de perder su poder de seducción y ser catalogada como marimacho. Reírse entre dientes, partirse o caerse de la risa, carcajearse, el lenguaje de la risa es ya de partida sexuado, o bien trivial, o bien indecente. Durante siglos, la risa femenina ha permanecido bajo vigilancia, tolerada a condición de que se escondiera tras el abanico.”

Al leer este párrafo podemos pensar que lo que nos cuenta Sabine Melchior-Bonnet es algo del pasado pero, por ejemplo, basta echar la vista atrás a las últimas elecciones en Estados Unidos para darnos cuenta que estos estereotipos de género siguen vigentes.

Patricia Gascón-Vera, Natascia Mattucci y Joseba Bonaut-Iriarte en una investigación publicada este mismo año (2025) titulada "Avatares y estereotipos. Sesgos algorítmicos de la sonrisa femenina generada por inteligencia artificial" demuestran cómo la risa femenina sigue siendo un tema de debate en la sociedad donde se mantiene como fórmula de ataque, sobre todo, desde la política. 

Nos cuentan como Donald Tump calificó a su rival Kamala Harris como “loca” por su forma de reír. En una entrevista, Harris tuvo que justificarse diciendo: “Tengo la risa de mi madre. He crecido rodeada de mujeres que se reían desde el estómago.” También podemos pensar que Trump es Trump, que sus formas son tan extremas que no representan la norma pero la risa de Harris se ha utilizado en memes que dejan patente cómo los algoritmos de la Inteligencia Artificial plasman a las mujeres (Mendoza, 2020).


La risa en el Siglo XXI sigue siendo una manera más utilizada para menospreciar la inteligencia y la cordura de las mujeres, por parte de algunos sectores de la sociedad.

“El humor es un fenómeno que gana complejidad, al aumentar los códigos, los contextos y las posibilidades comunicativas” (Soriano-Mollá y Silvestre, 2023, p. 9).

Y, en ese proceso, es la Inteligencia Artificial la que genera sobre lo ya creado, automatiza lo que ya tiene autor. Es decir:

"reproduce lo bueno y lo malo de la sociedad y, con ello, fija los avatares.” (Aguado-Terrón y Grandío- Pérez, 2024)

Conclusiones de la investigación Avatares y Estereotipos

En la investigación llevada a cabo por los citados autores llega entre otros a los siguientes resultados y conclusiones. El avatar que representa a la mujer y su risa desde la Inteligencia Artificial, desde lo virtual, es una imagen diversificada con pocos casos naturales, la mayoría en las niñas, que sí presentan la verdadera risa feliz y divertida. 

Y donde los estereotipos reflejan unos cánones estéticos sexualizados que erigen el poder sobre los hombres y donde la risa aparece exagerada sobre todo y con mucha diferencia en las mujeres jóvenes.


Resulta llamativo la cantidad de veces que encontramos la representación de la risa femenina con una estética sexualizada que proviene de imágenes de la simbología pornográfica.


Por otro lado, este estudio exploratorio encuentra un sesgo de edad en las imágenes de las mujeres, siendo en su mayoría jóvenes. Se las muestra en contextos de amistad donde se infrarrepresenta el aspecto laboral o doméstico frente la entretenimiento.

“Todo, aunque la virtualidad muestre risas sobredimensionadas con falta de gestos y/o arrugas que permitan, desde la visión humana, un reconocimiento como una sonrisa natural (Umberto Eco, 2010). Por tanto, la esfera física, social y cultural, al manipularse de manera tecnológica, provoca la imagen de un temperamento egocéntrico y lúdico (Villamarín-Fernández, 2023).”

A modo de conclusión y con el objetivo en mente de que la Inteligencia Artificial, como agente socializador de las futuras generaciones, muestre unos resultados de la risa femenina más humanos, menos sexualizados y que encarnen la amplia representatividad racial, estética y de edad de las mujeres, debemos centrarnos en romper la representación de la mujer como un objeto.

 “Para ello, se necesita debatir y promover la inclusión de la perspectiva de género en los procesos de diseño, implementación y control de los sistemas algorítmicos”.

(...) “Adoptar un enfoque de género implica mostrar las estructuras de dominación simbólica que se reproducen a través de la ecología de los nuevos medios de comunicación contemporáneos (Aguado-Terrón y Grandío- Pérez, 2024). 

Este desafío interroga desde dentro las visiones del mundo generadas algorítmicamente. Se aboga por la transparencia en los procesos algorítmicos, combinada con la promoción de habilidades críticas en la audiencia lo cual implica un uso consciente y responsable de la Inteligencia Artificial.

Futuras investigaciones no podrán olvidar que:

 “el objetivo final es lograr el bienestar desde el humanismo digital, aquel que promueve el uso de la ética para la integración de la tecnología, los valores y los derechos humanos (Gascón-Vera et al., 2024).”

Saludos,

PD: Si te interesa la IA y la Ciberseguridad, te recomiendo este enlace todos los posts, papers y charlas que he escrito, citado o impartido sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.

Autora: Monica Manrique 

jueves, noviembre 13, 2025

BlueCodeAgent: Agentic AI para revisar que el código generado con AI Coders es de buena calidad

El otro día os hablaba el paper dedicado a RedCodeAgent, para forzar que una AI Coder genere código peligroso dentro de la organización, y hoy le toca a BlueCodeAgent, que hace justo lo contrario, vigilar que el código que un AI Coder está generando es seguro, sin sesgos, y cumpliendo la política definida por la organización.
Ambos papers están publicados por el equipo de Microsoft Research, que como buena factoría de software que es, está más que interesado en empujar la investigación para que los AI Coders puedan hacer código de confianza que pueda ponerse en producción, así que todo lo que sea mejorar la calidad es fundamental. 
En el artículo de RedCodeAgent lo que se buscaba era ver si un AI Coder podría ser forzado a generar código "maligno", y el resultado era sorprendente por el alto grado de éxito. Ahora en el paper de "BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI" se busca vigilar el código generado por los AI Coders.
Para hacer este trabajo, lo que hace BlueCodeAgent es comprobar la seguridad de los Prompts solicitados y los códigos generados, es decir, antes y después de que se genere el código para comprobar que al AI Coder le llegue ya un Prompt correcto. Esto, en un ejemplo de detección de Sesgos (BIAS), sería algo como lo que se ve en la siguiente imagen.


Para esto, el BlueCodeAgent tiene que hacer un análisis del Prompt para analizar los riesgos de generar códigos sesgados, de generar código malicioso que pueda haber sido forzado por un adversario - como se vio en el trabajo de RedCodeAgent - o la política de seguridad definida por la compañía.


Para dotar de inteligencia a BlueCodeAgent se parte de una Política que define cuáles son los riesgos, más una base de conocimiento de categorías de Prompts maliciosos, más una base de datos de conocimiento sobre vulnerabilidades que se analizan para generar el conocimiento que debe aplicar a los análisis de los Prompts que debe realizar BlueCodeAgent para hacer una generación de código usando el AI Coder ya basada en un filtrado correcto de la petición. 


Después se usa el AI Coder, y el resultado da un código que vuelve a ser evaluado buscando vulnerabilidades conocidas en el código al estilo del Red Team, generando al final una base de datos de riesgos o no previamente analizados, lo que incrementa el conocimiento de BlueCodeAgent con su uso. 
Con todo esto, el resultado, pues una detección mejor en los diferentes Benchmarks de detección de Prompts con Sesgos, Pompts con incumplimiento de políticas de programación de la compañía, Prompts Maliciosos o detección de código "buggie", lo que produce lógicamente un mejor código y una reducción de las vulnerabilidades. En el paper se prueban diferentes Benchmarks con diferentes estrategias de otras propuestas.
Los Benchamarks son los que son, es decir, datos y pruebas encapsuladas que no son la totalidad de la realidad, pero al menos sirven para tomar una foto - aunque alguien pueda ponerse "guapo" para la foto y salga mejor en la foto que en la realidad -, pero parece evidente que usar el mayor número de análisis posibles al Prompt y al código generado es una buena estrategia de seguridad, ¿no?

Figura 9: Libro de Machine Learning aplicado a Ciberseguridad de
Carmen Torrano, Fran Ramírez, Paloma Recuero, José Torres y Santiago Hernández

Puedes leerte el paper para ver más detalles, y si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los posts, papers y charlas que he escrito, citado o impartido sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, agosto 19, 2025

Sobre la Fiabilidad del Reconocimiento Facial en Imágenes de Cámaras de Seguridad

No es la primera vez que el debate del Reconocimiento Facial ocupa parte de este espacio. En el año 2023, en el artículo titulado "Detecciones policiales erróneas por "falsos positivos" en Reconocimiento Facial" se contaba la historia de cómo una mujer fue detenida y llevada a juicio por un reconocimiento facial a partir de imágenes de una cámara de seguridad, donde se olvidaron el detalle de que en ese momento, la mujer detenida estaba embarazada de 8 meses. Algo que no detectó el algoritmo de reconocimiento facial pero que era muy fácil de comprobar en su momento.
Estos sesgos, fallos y alucinaciones en forma de Falsos Positivos (FP) y Falsos Negativos (FN), los hemos visto muchas veces en los algoritmos de reconocimiento facial. Usando clasificadores basados en técnicas de Machine Learning, vimos cómo un algoritmo podría fallar si las condiciones de calidad de la imagen no eran idóneas, como os publiqué en el artículo de "Cómo un algoritmo de Machine Learning puede tener prejuicios o sesgos y afectar a la vida de las personas. Un ejemplo con un algoritmo al que le gusta la piel clara" escrito por Alberto Rivera y Marcos Rivera.

Figura 2: Libro de Machine Learning aplicado a Ciberseguridad de
Carmen Torrano, Fran Ramírez, Paloma Recuero, José Torres y Santiago Hernández

En los modernos Cognitive Services de Reconocimiento Facial, yo he puesto muchas veces el ejemplo de "hallucination" cuando me confundían en fotos a mí con el actor George Clooney, algo que creo que salta a la vista que no debería pasar de ninguna manera, y que sin embargo ha sucedido en más de una ocasión. Si sabemos que hay Sesgos, Falsos Positivos, Falsos Negativos o Hallucinations... ¿Podemos fiarnos de la Tecnología de Reconocimiento Facial (Facial Recognition Technology - FRT) ? Cuando la utilizamos con imágenes de cámaras de seguridad de baja calidad o en condiciones que no son las ideales... ¿son realmente fiables estas tecnologías? 

De esto va el paper que se ha publicado en Junio de este año, titulado "Accuracy and Fairness of Facial Recognition Technology in Low-Quality Police Images: An Experiment With Synthetic Faces" donde se ha hecho un experimento con 50.000 imágenes sintéticas para localizar los Ratios de Falsos Positivos y Falsos Negativos de algunas de las tecnologías de FRT utilizadas en investigaciones policiales.
Si miramos las imágenes con las que cuentan las FRTs para reconocer a las individuos, no son siempre ni a la mejor resolución, ni con la mejor calidad, ni con el mejor ángulo de enfoque, con lo que tienen una dura misión para detectar un Match de Reconocimiento facial que no sea más allá que "un indicio" leve para investigar después, pero parece imposible que se pueda utilizar como una prueba concluyente.
Para localizar estos Ratios de Falsos Positivos (FPR) y de Falsos Negativos (FNR), se ha hecho un experimento en el artículo generando 50.000 imágenes sintéticas utilizando un modelo de StyleGAN3. Estas imágenes se han catalogado después en función de sexo y raza para conseguir una dispersión mayor y probarla con diferentes tipos de personas.
La distribución de estas personas, en función de sexo y raza es más o menos homogénea en sexo, pero en raza se ha hecho una distribución sesgada entre raza blanca, negra y asiática, para probarlo en un entrono similar al que puede tener un país como los Estados Unidos.
Ahora, lo siguiente que se ha hecho ha sido manipular esas imágenes para ponerlas en condiciones similares a las que se tienen las cámaras de seguridad y muchas de las investigaciones policiales, haciendo distorsiones de resolución, brillo, contraste, color, etcétera, y probar en condiciones NO ideales, que es a lo que se tienen que enfrentar las FRT de los cuerpos de seguridad que investigan los delitos.
Ahora, una vez que se tienen las imágenes generadas, se corren los procesos con las FRT para calcular el número de Falsos Positivos (FP), el Total de Positivos (TP), el número de Falsos Negativos (FN),  Total de Negativos (TN), el Ratio de Falsos Positivos (FPR) y el Ratio de Falsos Negativos (FNR) todos ellos normalizados con el porcentaje de del sexo y raza de la población, para hacer una estimación más fiable de estos valores. Todos estos valores se miden haciendo búsquedas con objetivos en la base de datos, y con objetivos que no están en la base de datos - y que deberían no dar ninguna coincidencia -.
Y los resultados, como podríais imaginar son que tenemos un número significativo de Falsos Positivos, de Falsos Negativos, con sesgos más marcados por sexo y raza. En la siguiente tabla tenemos los Ratios de Falsos Positivos y Ratio de Falsos Negativos en función de la degradación de calidad de la imagen de búsqueda.
Pero, si lo miramos por tipo de degradación de la imagen, y por raza y género, vemos que los FPR y FNR son sensiblemente diferentes. Por ejemplo, hay más Falsos Negativos con imágenes de mujeres blancas con mala calidad de contraste que mujeres negras, pero hay más Falsos Positivos en mujeres negras que en mujeres blancas. 
Pero es que si miramos cualquiera de las degradaciones de calidad, vemos que las FRT tienen diferentes FNR y FPR por raza y sexo, lo que hace que sea más propenso a dar un Falso Positivo o un Falso Negativo si tu raza es una u otra. Lo que hace que haya que poner estas tecnologías como indicios en las investigaciones policiales, pero nunca como prueba definitiva.
Este tipo de investigaciones hacen que corrijamos errores que podemos cometer con la tecnología y que pueden afectar de manera muy seria a la vida de las personas. Por todo ello, si eres de los que te dedicas a hacer informes periciales o análisis forenses, conocer estos datos son fundamentales para ajustar tus conclusiones en su justa medida. Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los posts, papers y charlas que he escrito, citado o impartido sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligen

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares