Mostrando entradas con la etiqueta Cognitive Intelligence. Mostrar todas las entradas
Mostrando entradas con la etiqueta Cognitive Intelligence. Mostrar todas las entradas

domingo, abril 12, 2026

Captchas Cognitivos: Más fácil con IA que con ojos

Ya os he contado muchas veces que los Catpchas Cogntivos se están convirtiendo  en una molestia para el usuario más que en una protección real contra los ataques automatizados de los robots, porque cada vez es más sencillo resolverlos con Inteligencia Artificial que hacerlo siendo un humano con tus propias capacidades cognitivas.

Figura 1: Captchas Cognitivos - Más fácil con IA que con ojos

En el mundo del cibercrimen, donde tienen de todo para el crimeware as a service, entre otros servicios, cómo no, están los negocios de resolución de Captchas Cognitivos as a Service, que están sacando el máximo partido posible al mundo de la Inteligencia Artificial. Así que, si los malos pueden, tú también puedes sacarle partido a la IA para hacer cosas buenas.
Yo he estado jugando con ellos, ya que los utilizan HBO MaxLinkedinTwitter/X, etcétera, y os he ido dejando artículos para que pudierais ver cómo funcionan:
Pues bien, el otro día, un ReCaptcha de Google me pidió que resolviera en esta imagen - que aquí tienes ampliada - en qué recuadros hay motocicletas. Y ya no es que sean imágenes pequeñas o parciales, es que además están procesadas para hacerlas más confusas aún.

Figura 3: Las imágenes donde hay que buscar motocicletas

Ni me lo pensé. Fijaos que en la imagen de la izquierda de la fila del medio casi no se aprecia nada, y es casi un Test de Rorschach donde cada uno puede ver lo que quiera. Por cierto, hablando de Rorschach, si te gustó Watchmen y no te has leído Rorschach dibujado por Jorge Fornés, te estás perdiendo una obra de arte del cómic.
Inciso a parte, resolver el Captcha Cognitivo de las motocicletas, a mí, que tengo que usar gafas para trabajar con el ordenador, me obligó a mirar y remirar, y aumentar la imagen. Así que pensé que esto me lo voy a tener que apañar con un Agente de IA para resolver mis captchas en local, y se lo pasé a Gemini a ver.

Figura 5: Pasado a Gemini para que lo resuelva él

Evidentemente, el resultado era el que esperaba. Es decir, que sin despeinarse lo resolvió mucho antes de lo que yo soy capaz de resolverlo, así que supongo que mejor que la media de los seres humanos que se vena confrontados contra este reto.

Figura 6: Gemini lo resuelve mejor que yo.

La reflexión es, si Google me pone el ReCaptcha, y Google me lo resuelve con Gemini, ¿¿por qué seguimos con esto?? Que al lado del botón del ReCaptcha haya un botón de "Resolver con Gemini" y listo, ¿no? Así todos muchos más contentos. Un CoPilot útil de verdad.

Figura 7: Resolver con Gemini y listo

Bueno, está claro que vamos a tener que repensar este tipo de tecnologías, que la necesidad inicial por la que fueron creados los Captchas Cognitivos está dejando de ser cubierta. Diferenciar a un humano de un bot con un Captcha Cognitivo ya NO es posible.

Si te interesa la IA y la Ciberseguridad, tienes en este enlace todos los postspapers y charlas que se han  escrito, citado o publicado en este blog sobre este tema: +300 referencias a papers, posts y talks de Hacking & Security con Inteligencia Artificial.



¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


viernes, diciembre 20, 2024

Investigando fotografías y personas con Multi-Modal Large Language Models

Ayer os hablé de cómo "Cómo "Weaponizar" la generación de información que las apps y los servicios digitales ven en tus fotos", o lo que es lo mismo, cómo crear bases de datos con información extraída desde fotografías de forma automática. Esto puede ser muy útil para investigar fotografías concretas, o identidades a partir de grandes bases de datos de fotografías (o del carrete de fotos del smartphone de una persona).

Figura 1: Investigando fotografías y personas
con Multi-Modal Large Language Models

Hoy he querido probar la parte de investigar personas que aparecen en fotografías, para etiquetarlas y sacar metadatos, además de información descriptiva, a partir de fotografías. Es decir, para poder etiquetar información como si fuéramos personas procesando manualmente las fotografías.

Describiendo y etiquetando fotografías con MM-LLMs

Primero he probado con la fotografía que nos hicimos Luis Enriquez, Luis Herrero, José Luis Garci y yo en el último programa de la tertulia, pidiéndole que describa la fotografía e intente descubrir a las personas que salen en ellas.


La gracia no es que sean fotografías públicas, sino privadas, lo que haría la información más "jugosa", ya sea porque se han conseguido mediante accesos concedidos a un servicio, o porque son fotografías que tenemos que analizar masivamente en un análisis forense, por ejemplo.

Figura 3: Descripción de José Luis Garci

En este caso - al igual que sucedía con Grok -, José Luis Garci no es reconocible por ChatGPT. Supongo que su ausencia del mundo de la tecnología ha permitido que esté lejos de los dataset de entrenamiento de ChatGPT. Lo mismo sucede con Luis Enriquez y Luis Herrero que no son reconocidos por ChatGPT.

Figura 4: Descripción de Chema Alonso

Sin embargo, en o que corresponde conmigo, ChatGPT sí que me reconoce. Además, dice: "Su estilo (gorro, pelo largo, ropa informal) es inconfundible con su imagen pública". Vamos, que me tiene fichado y bien fichado.

Figura 5: Conclusión sobre la fotografía

Al final, sí que reconoce y cataloga la foto perfectamente, lo que permitiría crear meta-información sobre la misma para alimentar una base de datos que pueda ser utilizada en entornos OSINT, así que si tenemos muchas fotografías, se tienen muchos datos como estos. 

Como no me habían reconocido a mis compañeros de tertulia, decidí subir la foto que nos hicimos Kevin Mitnick, Steve Wozniak hace ya unos años, para ver cómo la procesaba ChatGPT, y si nos generaría información jugosa para alimentar la base de datos.

Figura 7:  La foto que nos hicimos Steve Wozniak y Kevin Mitnick

Como ya imaginaba, a mí me reconoce el primero de la izquierda - que procesa de izquierda a derecha - y llama la atención cómo reconoce la camiseta de Fear the FOCA y la historia de la herramienta FOCA

Figura 8: Descripción de Chema Alonso

Lo mismo sucede con Steve Wozniak, que es el siguiente en la fotografía. Como podéis ver, analiza su aspecto, su expresión, y que es él. Haciendo en todo momento, como le pedía en el prompt, una inferencia sobre quién podría ser.

Figura 9: Descripción de Steve Wozniak

Y por último, el análisis de nuestro querido, y siempre recordado, Kevin Mitnick, que también lo reconoce perfectamente.

Figura 10: Descripción de Kevin Mitnick

También describe la ilustración que yo hice, y que tengo firmada en mi despacho, y lo utiliza como parte de su análisis del tipo de evento en el que se pudo tomar esa fotografía.

Figura 11: Ilustración que aparece en la fotografía

En la parte de Conclusión, he llamado mucho la atención cómo ha analizado la fotografía, ya que como podéis ver analiza las personas, con motivo de qué podríamos estar juntas, y el carácter amigable de la reunión al existir la ilustración. 

Figura 12: Inferencias finales

Además dice que si estas suposiciones son ciertas, "esta foto reúne a tres leyendas vivas del mundo tecnológico y de la ciberseguridad en un mismo lugar." Por desgracia, los datos no están actualizados y seguimos echando de menos a Kevin.

Figura 13: Pidiéndole que catalogue esta fotografía con etiquetas

Por supuesto, una vez analizada la fotografía podemos etiquetar la información, así que le he pedido a ChatGPT que haga una selección de las 10 mejores etiquetas para catalogar esta fotografía, y como podéis ver ha elegido muy buenas etiquetas, lo que ayudaría a generar una base de datos valiosa si se hace con muchas fotografías.

Figura 14: Metadatos generados en forma de etiquetas

Esto no es nuevo, sino algo que todos los sistemas que permiten que subas tus fotografías ya utilizan para generar datos valiosos, inteligencia de datos accionable o saber más cosas de todas y cada una de las personas que tienen en sus plataformas.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, febrero 06, 2024

Inteligencia Artificial para ayudar en la Discapacidad Visual

Es innegable el protagonismo que ha alcanzado la inteligencia artificial, no sólo en los medios, sino también en nuestro día a día. Desde el lado del mal ya se ha hablado muchas veces del potencial que tiene la Inteligencia Artificial para la creación e incluso Detección de DeepFakes, así como de la investigación en el mundo de la Inteligencia Artificial que cambió el mundo.


Hace pocos años que surgieron las primeras versiones de DALL-E basados en modelos de difusión y GPT, que ya en aquel momento dejaron ojipláticos a los expertos en la materia. En ese momento, la sociedad todavía no era consciente del mundo de posibilidades que se abría ante sus ojos. Y hasta día de hoy, todos estos avances parecen imparables. Sin embargo, por muchas facilidades que nos ofrezca la Inteligencia Artificial en nuestro día a día, siempre existen minorías olvidadas en dicho avance. 

Por ello, desde el Grupo de Robótica y Visión Tridimensional (RoViT) de la Universidad de Alicante, bajo la dirección de Miguel Cazorla, nos estamos enfocando en la creación de una aplicación móvil que aúna todos estos avances en el campo de la visión por computador y del procesamiento de lenguaje natural. El objetivo es dar respuesta a una necesidad básica desde el punto de vista humano: "¿qué están viendo nuestros ojos?"


Tengo la suerte de llevar unos meses bastante metido en el proyecto y en todo el funcionamiento de la aplicación, para poder decir que la aplicación está destinada a las personas con discapacidad visual parcial o total. Esto cobra mucho más sentido cuando pensamos en aquellos usuarios que adquirieron la discapacidad visual crecidos y debieron aprender a interactuar nuevamente con el entorno. Así nace AIDEN, utilizando los últimos avances tecnológicos en visión por computadora para permitirles explorar el mundo que les rodea.

A menudo, las personas con discapacidad visual se enfrentan a obstáculos cotidianos por la forma en la que el mundo ha sido diseñado. ¿Cómo pueden saber si se les ha olvidado la vitrocerámica encendida, o qué modo del horno está asociado a cada posición? Por supuesto, las empresas mil-millonarias, con el soporte de las grandes tecnológicas, tienen el potencial para llegar a crear modelos más competentes. Salvo por tres particulares:
  • Necesidad de monetizar cualquier producto.
  • Falta de enfoque en este colectivo.
  • Incapacidad de ofrecer transparencia con los datos de los usuarios.
El motivo por el cual aún no existen soluciones competentes para este colectivo por parte de las grandes empresas tecnológicas es sencillo: dinero, dinero, dinero. Hasta que esas mega corporaciones vean la posibilidad de lucro en estas minorías, no habrá una solución real en el mercado, la cual, indiscutiblemente, tendrá que afrontar dos preguntas fundamentales:
  • ¿Queremos que empresas tecnologícas tenga fotografías privadas de nuestro día a día?
  • ¿Superarán los filtros legales de los países europeos?
De ahí, la importancia de que sea una Universidad Pública bajo el sistema europeo quien desarrolle el proyecto, junto con el apoyo de INDRA, una de las mayores empresas del mercado español.

¿Alguna vez os habéis preguntado cómo hacen las personas invidentes para usar un smartphone? ¿O manejarse por una página web? ¿Pensáis que generalmente están adaptas a estos usuarios? AIDEN incorpora los últimos modelos de Visión Artificial para cada tarea especifica, combinados ofrecen al usuario la mejor experiencia de usuario. Permitiendo cuatro opciones fundamentales:
  1. Describir los elementos del entorno.
  2. Preguntar al entorno.
  3. Lectura de texto.
  4. Lector de código de barras y QR instantáneos.
Para ello, la aplicación toma una fotografía y se procesa en nuestros servidores hasta obtener una respuesta. Es esta respuesta la que recibe el móvil y es dictada al usuario gracias al sistema operativo del smartphone.

Figura 3: Diagrama de funcionalidades de AIDEN

El enfoque más novedoso que trae la aplicación es preguntar a la escena y obtener su respuesta con un costo computacional relativamente bajo, especialmente si se compara con LLAMA, BARD o ChatGPT. Sobre esa imagen tomada, la persona invidente puede saber cuantas sillas hay, qué pone en un cartel o de qué color es la chaqueta, para seguir preguntando si la silla tiene respaldo o si la chaqueta tiene capucha.

Para el desarrollo de la app, se ha jugado con muchas tecnologías hasta encontrar el mejor resultado, uno de los modelos más novedosos que se ha incorporado es el V* que aplica LLMs a la Visión Artificial y así brinda excelentes resultados. Grosso modo, con V estrella logramos localizar los píxeles de la imagen en los que la Inteligencia Artificial debe centrar su atención, con el objetivo de obtener la mejor respuesta en el menor tiempo posible.

Figura 4: Prototipo en pre-producción de AIDEN

Incluso los colores que se pueden apreciar en los botones de la aplicación, o el margen entre los mismos, han sido seleccionados con cuidado para mejorar la accesibilidad y facilitar el uso del asistente del móvil. La utilización de colores lejanos en la escala cromática facilita a ciertos usuarios con ceguera parcial diferenciar los botones.

El proyecto se encuentra en las últimas etapas de desarrollo, y aunque ya dispongamos de un producto mínimo viable, nos enfrentamos a cuestiones muy complejas que requieren tiempo y que estemos por detrás un equipo excelente de doctores e ingenieros del que tengo la suerte de formar parte.

Conclusión   

AIDEN es el primer paso en la dirección correcta, la de un mundo más accesible gracias a la tecnología. Imaginemos en pocos meses el potencial que puede tener una aplicación como AIDEN junto con las Ray-Ban Smart Glasses, en las que el usuario ya no requiera ni interactuar con el smartphone.


La aplicación tiene previsto abrir sus puertas el segundo trimestre del año, tanto para Android como para iOS, y aunque todavía estamos discutiendo si estaremos ante una versión beta abierta o privada, todo parece marchar sobre ruedas. Además, estamos súper ilusionados por que se haya interesado RTVE para contar esta historia y compartir el trasfondo social de la aplicación.

¡Saludos!

lunes, septiembre 11, 2023

Detectar Voces Clonadas en DeepFakes usando Machine Learning

En verano os hice un artículo con la recopilación de los Codetalks For Debelopers desde el principio hasta mitad del año 2023 que vamos publicando en  CodeTalks4Devs by  Ideas Locas. Ya llevamos varios años con estos pequeños vídeos de unos 20 a 25 minutos de duración donde contamos tanto nuevas tendencias en tecnología y ciberseguridad como nuestros proyectos que desarrollamos en el equipo de Ideas Locas, y esta vez os traigo el que hemos hecho este verano sobre el trabajo de Detectar Voces Clonadas en DeepFakes usando Machine Learning.
Este año ya hemos publicado cinco capítulos que teníamos programados, cada uno hablando de un tema de actualidad distinto y mostrando, como siempre, su punto de vista más técnico para animarte a hacer tus propios proyectos. En este caso, una explicación más detallada de lo que vimos en el artículo: "Are You Talkin' ta me?" DeepFake Voice en Español & Detección de Voces Clonadas


Tienes todos los CodeTalks en esta web, desde los últimos publicados hasta el acceso a las cinco temporadas anteriores, pero vamos a comentar uno a uno los que tenemos publicados para que sepas un poco mejor el contenido de estos:

Temas y Proyectos de Ideas Locas

Pues estos son los CodeTalks que tenemos publicados hechos en 2023. Cada mes seguiremos publicando un episodio de estos CodeTalks para mantenerte al día en estos temas tan importantes dentro de la tecnología, y encantados de que nos propongáis ideas locas, proyectos o temas que tocar.


Así que no te los pierdas, y nos veremos en el próximo episodio, y recuerda que tienes todas las Codetalks4devs en una sola lista de Youtube, para que las puedas ver seguidas una tras otra... 

Figura 4: Sección Apps, Educación y Cultura

Y si quieres verlas en la tele, recuerda que en la Sección APPS -> Educación y Cultura, tienes la Living App de las CodeTalks by Ideas Locas de tu Movistar+

Figura 5: Living App Codetalks by Ideas Locas

Solo debes entrar en ella y tendrás acceso a todos los Webinars que vamos realizando para disfrutarlos sentado en tu sofá preferido en el salón de casa.
 
Happy Hacking Hackers!!! 

Autor: Fran Ramírez, es investigador de seguridad y miembro del equipo de Ideas Locas en CDO en Telefónica, co-autor del libro "Microhistorias: Anécdotas y Curiosidades de la historia de la informática (y los hackers)", del libro "Docker: SecDevOps", también de "Machine Learning aplicado a la Ciberseguridad” además del blog CyberHades. Puedes contactar con Fran Ramirez en MyPublicInbox.

 Contactar con Fran Ramírez en MyPublicInbox

sábado, mayo 06, 2023

Ángel o Demonio: El debate sobre la I.A. en Horizonte T3x116 @navedelmisterio

El pasado jueves - ya casi en la madrugada del viernes - Iker Jiménez y Carmen Porter quisieron llevar el debate sobre la I.A. al programa de Horizonte, para hablar un poco de todo lo que está pasando alrededor de este mundo. Para ello, Ángel Niño, Cristina Aranda y yo fuimos invitados para tener una charla abierta a colación de la portada de The Economist sobre A.I. reflejando la dualidad. Sobre este tema yo he hablado mucho, y hablo mucho en este blog. Y tengo una opinión muy tibia al respecto.


No soy de los que voy a demonizar la I.A. por los futuros distópicos con los que nos hemos creado y los capítulos de BlackMirror que uno a uno se puedan ir haciendo realidad, pero sí que creo que igual que hemos visto que nos han hecho - y por eso hemos puesto algunas regulaciones al respecto - con Internet, con los datos, con la privacidad, o con lo que se considera delito o no, con el tema de la I.A. nos hace falta alguna reflexión más para saber qué es lo que queremos tener o no en nuestra vida.

Figura 2: Portada de The Economist sobre A.I.

El programa ya lo tienes disponible a la carta, por si quieres verlo, y esta sección en concreto comenzó en el minuto 34 del programa, ya que antes se trataron otros temas. Lo puedes ver en el siguiente enlace.    


Ya vimos que en la industria militar hay preocupación como vimos con REAIM, al igual que lo hay con los modelos de Generative-AI usando Stable Diffusion que son entrenados con datos con derechos de autor y generan tantos problemas a la hora de valorar si las obras derivadas generadas con modelos de difusión son ( o no ) como cuando una canción copia unos acordes de otros o no - recordad el famoso caso del rapero y el uso de parte de la melodía de "Every breath you take" que tiene que pagar 5.000 USD al día por copiar esos acordes.
Y por supuesto, temas como que las empresas pongan en producción modelos de I.A. que puedan tener sesgos de género, de raza, de edad o de lo que sea a la hora de usarlos en tomas de decisiones que pueden afectar a la vida de las personas. Como en el caso de los sesgos de género en los traductores de Google y Bing para los que yo abrí la petición de cambio.


Tomaos este pequeño debate como un anticipo para OpenExpo Europe 2023, que tendrá lugar el 18 de Mayo de este año, y donde estaremos hablando Iker Jiménez, Ángel NiñoCristina Aranda y yo mismo de estos temas. Por si te interesa tanto, para la edición de este programa sacamos un código descuento que es "HORIZONTE1" y que deja el coste de la entrada a OpenExpo Europe 2023 a solo 1 €.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


lunes, marzo 20, 2023

"Are You Talkin' ta me?" DeepFake Voice en Español & Detección de Voces Clonadas

En esta parte llegamos al final de este artículo que hemos dividido en cinco entradas. La primera en saber quién utiliza tus Alexa o tu Google Home sin tu permiso. La segunda parte en analizar un audio con modelos de Machine Learning. En la tercera parte vimos cómo buscar a una persona en Data Lakes de Audios y cómo comparar voces con Inteligencia Artificial. En la parte anterior nos centramos en ver cómo se pueden clonar voces a partir de audios capturados de personas y usarlos para hackear un sistema de biometría de voz. En esta última vamos a verlo en Español y cómo detectar el uso de técnicas de DeepFake de Voz.
Antes de comenzar con el clona de voz en Español, quería hacer referencia a que el trabajo de hackear un sistema de banca con 2FA que utilice biometría de voz se nos ocurrió meses atrás, debido a que en Inglaterra hay varios bancos que utilizan este sistema de seguridad, y lo conocíamos bien. 

De hecho, días antes de nuestra presentación en RootedCON 2023, un periodista hizo exactamente la misma prueba con su banco, tal y cómo contó en el artículo "How I broke into a Bank Account with AI-Generated Voice".

Clonando Voces en Español: Microsoft Azure Speech Studio

Ahora vamos con el clonado de voces en Español, y usamos para esta tarea el servicio de Microsoft Azure Speech Studio, que permite hacer un clonado de altísima calidad utilizando tanto ficheros de audio como grabación desde el micrófono. 

Figura 46: Clonando mi voz con Microsoft Azure Speech Studio

Eso sí, es necesario aceptar los términos y condiciones del clonado de la voz desde el micrófono. En este caso hemos hecho la prueba con 50 frases, para intentar hacerlo bien, lo que lleva aproximadamente una hora de trabajo y clonación de la voz.

Figura 47: Clonando mi voz con Microsoft Azure Speech Studio

Así de sencillo es hoy en día. Después, ya se puede utilizar de forma indiscriminada en cualquier entorno, ya sea en directo, o en vídeos grabados, como vamos a ver a continuación.

Stable Diffusión + Talking head + Voice Clonned + Lips Sync 

En este primer ejemplo hemos utilizado una imagen creada con el servicio de Stable Diffusion en MyPublicInbox que te permite entrenar un modelo con solo 20 imágenes tuyas. Una vez entrenado puedes generar cualquier imagen de ti que quieras con solo darle el prompt adecuado. 
Después, hemos animado la imagen generada por el modelo de Stable Diffusion en MyPublicInbox con un algoritmo de Talking Heads, que permite con una sola fotografía generar un movimiento. Después, con la voz clonada hicimos el audio. Y para terminar, un algoritmo de Lips Sync, para conseguir que el audio y los labios de la Talking Head encajaran.

Figura 49: Stable Diffusion + Talking Heads +
+ Voz Clonada + Lips Sync

El resultado es curioso, pero lo hicimos más que nada para la presentación, ya que el objetivo era ver cómo la voz tiene mi tono y mi forma de hablar habitual. Eso sí, no la hemos tuneado con una herramienta de generación de velocidad, tono, volumen, etcétera en tiempo real, por eso queda un poco "loquendo".

Figura 50: DeepFake + Voz Clonada + Lips Sync

En este ejemplo, es lo mismo, pero con un vídeo de Youtube, y se puede hacer perfectamente con los vídeos de TikTok o de cualquier otra red social donde alguien haya publicado su imagen, su voz o un vídeo. Adios a que tu biometría sea tuya.

DeepFake Voz Detector con Machine Learning

De nuevo, volvemos al mismo problema de saber cuándo alguien está utilizando una voz clonada o no, para proteger nuestros servicios. Para este ejercicio usamos dos algoritmos de Machine Learning que nos permitieran añadir capas de protección a un sistema, tanto de seguridad basada en biometría de voz, como a nuestras herramientas anti-DeepFakes.

Figura 51: Libro de Machine Learning aplicado a Ciberseguridad de
Carmen TorranoFran Ramírez, Paloma Recuero, José Torres y Santiago Hernández.

Las protecciones en las que hemos trabajado son, detectar cuando no es una persona sino un speaker reproduciendo un audio al aire, y entrenar un algoritmo para detectar voces clonadas con un gran dataset.

Machine Learning para detectar voces clonadas

Volviendo a la aproximación de la segunda parte de este artículo donde usamos algoritmos de Machine Learning para clasificar imágenes basadas en sus espectogramas, vamos a hacer lo mismo. Tenemos un fichero de audio con una voz (.wav), lo transformamos en espectograma (imagen) y utilizamos el framework fastai para entrenamiento de modelo, con la librería librosa para tratamiento de archivos de audio y conversión en espectrogramas.

Figura 52: Algoritmo de ML para detección de voces clonadas

Para entrenar el modelo usamos el dataset ASVSpoof 2019, que es un challenge para lograr detección de voces clonadas con los mejores algoritmos. El entrenamiento se hace con la recogida de voces clonadas y voces reales de este dataset y transformación en espectogramas para entrenar la red sobre imágenes. Una vez se tiene el modelo entrenado, se puede hacer predicción sobre un archivo de voz transformándolo previamente en espectrograma (mismo pre-proceso que para el entrenamiento). 

Figura 53: Detección de voz clonada y voz real con ML

Es verdad que los resultados son muy sensibles al pre-procesado de los ficheros, al ruido en los audios que es necesario eliminarlos, hay que tener una normalización de audios para el entrenamiento, debe ser de  similar duración entre audios, etcétera. Pero en todo caso, te da un indicio más sobre el audio de entrada en tus sistema.

Machine Learning para detectar voces sintéticas

En este caso la idea es distinguir entre si un audio está sonando desde la voz de una persona o si ha sido grabado. Es decir, si por ejemplo un atacante ha generado una voz sintética de alguien en un ordenador y lo está reproduciendo o se está escuchando mientras está realizando una llamada telefónica para engañar a alguien.  Para este algoritmo de Machine Learning se necesita un conjunto de datos de entrenamiento  que incluya audios originales y audios que simulen el escenario comentado, como es el dataset FoR (fake-or-real dataset) que incluye en sus datos un dataset diseñado específicamente para esta tarea. 
Para simular el escenario comentado, reprodujeron audios provenientes del altavoz de un ordenador y los re-grabaron utilizando otro dispositivo con micrófono no profesional, simulando escenario de un atacante.También tienen otro dataset con audios sin ser re-grabados, es decir, audios originales. A partir de estos datos, se utiliza Deep Learning para un problema de clasificación, con el objetivo de distinguir entre audios originales y los re-grabados que simulan escenario de atacante. 

Los audios primero se pre-procesan utilizando comandos de la librería de manipulación de audios SoX (eliminar silencios en principio y fin, convertimos en un único canal mono, convertimos a tasa de muestreo 16KHz, normalizamos volumen) y se convierten en espectrogramas, por lo que la tarea se convierte en un problema de clasificación de imágenes. Se entrena una red convolucional utilizando el framework Fastai

Figura 55: Detección de voces re-gragadas vs originales

No es perfecto y tiene sus limitaciones, y los propios autores comentan en las conclusiones del paper que el dataset que han creado para simular escenarios de atacante no es muy general, ya que solo utilizan un único hablante y un único tipo de dispositivo para la re-grabación, por lo que el modelo entrenado puede que no sea del todo robusto frente a audios provenientes de otras fuentes. Pero evidentemente, es una buena linea de investigación y aproximación a este problema.

Conclusiones

Visto lo recorrido en este artículo, podemos decir que la clonación de voces en cualquier idioma se puede dar por algo muy común, por lo pensar en la biometría de voz como una protección de seguridad es una mala idea. Si la estas utilizando, hay que mejorar los mecanismos de seguridad para la detección de posibles voces clonadas. Además, hay que tener en cuenta que escuchar a personas cercanas ha sido siempre motivo de confianza, y esto los estafadores lo saben, así que ya hemos tenido este mismo mes los primeros estafadores utilizando voces clonadas de familiares para estafar a personas.
Además, las técnicas de DeepFake, tanto de imagen, vídeo como voces, están cerca de ser perfectas, con lo que discriminar cuándo estamos hablando con una persona sintética o de verdad, va a ser cada vez más complicado. Con imágenes ya vimos que es casi imposible, pero con los avances en IA, con vídeo conferencias o conversaciones de voz en tiempo real, va a ser totalmente imposible en breve. Es, por tanto, necesario seguir desarrollando las técnicas para mejorar el Test de Voight-Kampff y detectar DeepFakes de vídeo y audio. Todo lo visto aquí, y más, lo veremos incorporado a nuestra herramienta.

¡Saludos Malignos!


Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares