Mostrando entradas con la etiqueta DeepFakes. Mostrar todas las entradas
Mostrando entradas con la etiqueta DeepFakes. Mostrar todas las entradas

viernes, marzo 13, 2026

Fear of the Dark: Un pequeño estudio de medios y miedos

Con esta entrada, termino el resumen de lo que fue la charla de RootedCON Madrid 2026, aunque tal vez os dejaré en alguna entrada aparte más información de cómo construimos la herramienta de Retórica IA, pero eso se lo dejaré a mi compañero Daniel Romero, que estuvo pegándose con los detalles para dejarla fina a gusto de las necesidades que nos iban surgiendo.

Figura 1: Fear of the Dark: Un pequeño estudio de medios y miedos

En este artículo os dejo el estudio de medios que hemos hecho, analizando los vídeos publicados en las redes sociales de cuatro periódicos, dos de ideología de izquierdas, y dos de ideologías de derechas. Aunque en la presentación os dejé los datos con los nombres de los medios, para no generar polémica sobre ellos, he preferido dejarlos ocultos, porque es suficiente significativo el estudio sin necesidad de citar los medios ni quién es quién.

Figura 2: Medios y vídeos del estudio

Para hacer el estudio, tomamos cuatro medios de comunicación y elegimos sólo los vídeos sobre asuntos políticos publicados durante tres días, en concreto entre el 23 y el 26 Febrero, y los analizamos con Retórica IA para ver qué miedos tenían incluidos estos vídeos. El resultado lo tenéis en la tabla anterior, y en las siguientes gráficas.

Figura 3: Todos los vídeos llevan explotación de miedos

Como podéis ver en la gráfica anterior, los vídeos que publican todos los canales de los medios digitales que tienen que ver con crónica política llevan mensajes de explotación de miedos. Por supuesto, con el objetivo de poder movilizar a los seguidores de la ideología política del medio hacia el objetivo ideológico de cada uno de ellos. Como podéis ver, en media casi se explotan 2 miedos por vídeo que ves.

Figura 4: Frecuencia de miedos explotados

Si miramos la gráfica anterior, la Pérdida de Autonomía es el miedo más explotado. Hay que tener en cuenta que este miedo hace referencia a "te están manipulando los otros" o "Vas a vivir en un estado opresor", o "te van a cortar las libertades o derechos". 

Figura 5: Distribución de miedos más exploados

Si miramos la gráfica anterior, y alguien viera todos los vídeos y los miedos se metieran dentro de él, sentiría mayoritariamente el miedo de "Perdida de Autonomía", pero en segundo lugar el de "Muerte del Ego" del que os hablé en los Primal Fears y que tiene que ver con la vergüenza y la humillación.


Figura 6: Peso de los miedos por medios

Si vemos la distribución de miedos por medios, vemos que en todos pesa más el miedo a la "Perdida de Autonomía", con luego pequeñas diferencias en los miedos explotados, pero en la siguiente gráfica se entiende mejor.


Figura 7: Tipos de miedos por medios

Si miramos los miedos explotados por los diferentes medios, se puede ver que algunos medios tienen predilección por explotar más unos miedos que otros, y los medios "azules" explotan algunos medios que los medios "rojos" no explotan, como el "Miedo a la Mutilación", mientras que los medios "rojos" tienen tendencia a explotar más el miedo a la "Perdida de Autonomía" o "te están engañando los otros".

Figura 8: Perfil de miedos por medio

Como resultado, lo que sale del estudio es que los medios "azules" explotan más miedos asociados a miedos más primitivos y físicos, como la "Separación", "Extinción" o "Mutilación", aunque también el de "Perdido de Autonomía" mientas que los medios "rojos" explotan mucho el miedo a la "Pérdida de Autonomía" o la "Muerte del Ego", miedos más sociales. En cualquier caso, los vídeos explotan de media casi dos miedos fundamentales para movilizar a la audiencia, así que no te extrañe que si sigues la política en medios estés siempre preocupado o enfadado. Subliminalmente estás recibiendo muchos mensajes de miedo. 

De subliminal a visual

Visto todo este análisis, estábamos pensando en cómo poder neutralizar este tipo de mensajes - no para censurar los vídeos, sino para entender que estamos siendo bombardeados con estos miedos -, y pensábamos en los famosos "Rombos rojos" de la televisión en los años 70 y 80, pero asociados a los miedos.

Figura 9: Rombos de miedo

Además, poder meter en las redes sociales avisos de "hecho con IA" o "Vídeo Fake" sería también algo deseable. Por supuesto, muchas herramientas de GenAI están metiendo Watermarking, así como vimos con ElevenLabs, y nosotros proponíamos el año pasado Cloned Voice Detector y Hash Voice, como forma de hacerlo con la voz, pero esto se podría hacer también con los vídeos.


Conclusión final

Todo este experimento solo trata de ser una llamada de atención a algo que puede ser peligroso para las sociedades, y es la facilidad con la que se puede polarizar una sociedad por medio de contenido hecho íntegramente con Inteligencia Artificial Generativa que explote los miedos más básicos de la sociedad. Pueden existir máquinas de GenAI generando este tipo de contenido y viralizándolo haciendo que las sociedades nazcan pensando en Ellos y Nosotros en lugar de en construir lazos de concordia, colaboración y comprensión.

Figura 10: Framework DISARM

Para luchar contra una injerencia a nivel nacional, para lograr la desastibilización social, hay que utilizar estrategias de lucha contra al propaganda. El framework de DISARM justo está diseñado para que una organización, o un país, pueda defenderse contra este tipo de ataques.

Si tienes interés en conocer más sobre esta herramienta, o sobre este estudio, contacta con nosotros en nuestros buzones públicos, el mío o el de Daniel Romero, y veremos cómo colaborar contigo, que nuestro objetivo es únicamente educativo y divulgativo.


Te dejo aquí, para terminar, todos los artículos que forman parte de la charla que di en RootedCON Madrid 2026, que como podéis ver, era una historia bastante larga.
¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


jueves, marzo 12, 2026

Fear of the Dark: Deep Fakes, Fake News & Primal Fears

Una vez que vimos cómo funciona el Analizador de Retórica IA del que os hablé en el apartado anterior, la siguiente cosa que quisimos analizar fueron Fake Videos hechos con GenAI viralizados por las redes, para ver cómo estas piezas de propaganda están diseñadas para explotar miedo, polarizar, y generar sentimientos de confrontación.

Figura 1: Fear of the Dark: Deep Fakes, Fake News & Primal Fears

El primero de los vídeos que analizamos es este donde una supuesta periodista está en una cola en la administración pública con extranjeros esperando para hacer gestiones. Este es el vídeo en cuestión, que vamos a analizar primero.

El vídeo está hecho con Inteligencia Artificial Generativa, y la historia la tenéis en Maldita.es, que os dejo por aquí por si queréis ver el análisis completo del mismo.
Si miramos el análisis desde el punto de vista de los Primal Fears explotados, lo que tenemos es una narrativa que aunque pretende dar una noticia de colas en el sistema administrativo español, está cocinando otro mensaje por detrás.

Figura 4: Radiografía de miedos

Son sólo 10 segundos pero de alta intensidad, apelando a los miedos de Pérdida de Autonomía y a la Separación, con la teoría del Gran Remplazo. El nivel de intensidad del vídeo en cuanto a convencimiento y miedos, es máximo.

Figura 5: Grado de intensidad de miedos

Y si miramos el veredicto final que nos da Retórica IA, es que el vídeo plantea una narrativa de Invasión Silenciosa, donde el objetivo aparente - problema burocrático -, queda subyugado al mensaje auténtico.

Figura 6: Veredicto final.

Recordemos que el vídeo anterior era una Fake News hecha con Inteligencia Artificial diseñada con el objetivo de viralizar un generador de miedos que movilice a la audiencia. Recordad que los miedos que se utilizan en este estudio son los 5 Primal Fears de Albrecht.
Ahora vamos a analizar otro vídeo que también está hecho con Inteligencia Artificial, y que es para una Fake News que también está estudiado. Este es el vídeo en cuestión.

Figura 8: Fake Vídeo

Por supuesto, hemos usado este vídeo porque también está analizado por Maldita.es y podéis leer el informe completo en la web del portal donde tenéis los detalles del análisis pormenorizado realizado sobre este contenido.
Si miramos el análisis de miedos con Retórica IA se puede ver que, de nuevo, esta pieza tiene un nivel de intensidad alta, para explotar el miedo a la Perdida de Autonomía y la Muerte del Ego, explotados por miedos de Nivel 2 "Miedo a vivir bajo un régimen político opresivo" y Nivel 3 "Miedo al fracaso y a la vergüenza".

Figura 10: Explotación de miedos en este vídeo

Como se puede ver, el nivel de intensidad en el vídeo es muy alto, y durante los segundos que dura este artefacto se puede ver cómo se mantiene la presión sobre la audiencia.

Figura 11: Gráfica de Gravedad x Intensidad

En este caso, si miramos el vídeo, vemos que es una pieza muy efectiva en polarización, por tener representados en dos actitudes muy diversas el Endogrupo y el Exogrupo.

Figura 12: Polarización efectiva

El vídeo puede, sin embargo, ser una pieza en la que la audiencia elija grupo, por lo que el ganador es el que busque la polarización, que es lo que consigue este vídeo. En la siguiente parte de esta serie, hemos analizado vídeos publicados por medios digitales, para ver qué  miedos se emplean en la comunicación política.
¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


miércoles, marzo 11, 2026

Fear of the Dark: Primal Fears & Retórica IA

Continuando con la presentación de Fear of the Dark en la RootedCON Madrid 2026, el siguiente paso era analizar qué miedos, y de qué forma, se podían estar explotando para "Movilizar" a las personas. Es decir, qué tipos de miedos se están explotando para hacer que una persona se polarice hacia un lado o hacia otro. Recordad, que como vimos en la primera parte de esta historia, estos miedos no tienen que ser reales, ya que los seres humanos podemos tener miedo a cosas que no están pasando o son inventadas.

Figura 1: Fear of the Dark. Primal Fears & Retórica IA

Además, el mismo miedo, explotado correctamente, puede servir para polarizar a las personas a dos extremos distintos. Basta con identificar correctamente a la víctima del miedo en el Endogrupo (grupo al que incluimos a la persona objetivo) correcto e identificarle el Exogrupo (grupo culpable del miedo en el que él no esta). Es el clásico juego de Ellos y Nosotros.

Primal Fears

El objetivo del análisis era poder saber si los contenidos virales estaban explotando estos miedos, y de qué forma. Al final, estos miedos siempre han sido parte del Ser Humano, pero percibidos por el mundo de los sensores físicos. Sin embargo, pronto, los contadores de historias, los libros, la radio, y la propaganda pudo crear miedos imaginarios para movilizar a los seres humanos. 
En un mundo puramente Digital, la Inteligencia Artificial, las Redes Sociales, los Algoritmos, no iban a dejar pasar la oportunidad de tener un rol importante en esta explotación de miedos. Para poder hacer el análisis, utilizamos la clasificación hecha por Karl Albrecht en su libro "Practical Intelligence: The Art and Science of Common Sense" donde explica que todos los miedos del ser humano pueden ser estudiados hasta llegar a 5 Miedos Primarios (Five Primal Fears) que además están priorizados.
Estos son los miedos que hemos utilizado para buscarlos en los vídeos virales, y saber si, asociados a una narrativa polarizadora o movilizadora están siendo explotados. A saber, miedo a la Extinción, Mutilación, Pérdida de Autonomía, al Abandono y a la Humillación.

1. La Extinción (Miedo a dejar de existir)
Este es el miedo primario, la base de nuestro instinto de supervivencia.
Nivel 2: Miedo a la muerte por causas externas.
Nivel 3: Miedo a morir en una guerra o conflicto armado.
Nivel 3: Miedo a catástrofes naturales (terremotos, inundaciones).
Nivel 2: Miedo al cese de las funciones vitales (Salud).
Nivel 3: Miedo a contraer una enfermedad terminal (cáncer, enfermedades degenerativas).
Nivel 3: Miedo a la asfixia o al ahogamiento.

Los niveles dos y niveles tres son solo ejemplos de cómo al final los miedos de cosas pequeñas, como miedo a los extranjeros, o a un determinado partido político, o a que te despidan del trabajo, son solo sub-niveles de miedo de los Primal Fears.

2. La Mutilación (Miedo a perder la integridad física)
El miedo a que nuestro "envase" sea dañado o invadido, aunque no suponga la muerte inmediata.
Nivel 2: Miedo a la pérdida de facultades.
Nivel 3: Miedo a quedarse ciego o perder la movilidad (discapacidad).
Nivel 2: Miedo a criaturas que invaden el espacio corporal.
Nivel3: Aracnofobia o miedo a los insectos y serpientes (miedo evolutivo a las picaduras venenosas).
Nivel 3: Miedo a las agujas o intervenciones quirúrgicas.

3. Pérdida de Autonomía (Miedo a la restricción o control)
Es el miedo a ser inmovilizado, paralizado o controlado por fuerzas externas.
Nivel 2: Miedo a la restricción física.
Nivel 3: Claustrofobia (miedo a estar atrapado en espacios pequeños o ascensores).
Nivel 2: Miedo a la pérdida de control sobre el destino personal.
Nivel 3: Miedo a quedarse sin trabajo (pérdida de independencia financiera).
Nivel 3: Miedo a vivir bajo un régimen político opresivo.

Seguramente, si analizas estos miedos, verás que alguno de estos está dentro de ti. Por supuesto los 5 Primal Fears, pero seguro que el resto en sub-niveles también los acabas sintiendo como tuyos.

4. La Separación (Miedo al abandono)
Como seres sociales, el rechazo del grupo solía significar la muerte en la naturaleza.
Nivel 2: Miedo al ostracismo o soledad.
Nivel 3: Miedo al divorcio o a la ruptura de una relación larga.
Nivel 3: Miedo a ser el "raro" o ser ignorado por el círculo de amigos.
Nivel 2: Miedo al juicio social.
Nivel 3: Miedo a hablar en público (el miedo a ser evaluado y rechazado por la "tribu").

5. Muerte del Ego (Miedo a la humillación)
El miedo a que nuestra integridad psicológica o nuestra valía personal sea destruida.
Nivel 2: Miedo al fracaso y la vergüenza.
Nivel 3: Miedo a cometer un error grave en una presentación profesional.
Nivel 3: Miedo a que la gente descubra que "no eres tan bueno" (Síndrome del impostor).
Nivel 2: Miedo a la pérdida de identidad.
Nivel 3: Miedo a envejecer y perder el rol social que nos define.

Una vez que tenemos estos miedos, el objetivo era construir una herramienta, basada en las capacidades de análisis de vídeos que tiene la Inteligencia Artificial hoy en día para analizar los contenidos publicados en TikTok, Reels o cualquier otra red social, y ver qué Primal Fears se están utilizando para conseguir movilizar, manipular, o asustar a las personas que están consumiendo este contenido. Y creamos Retórica.

Figura 4: Analizador de Retórica IA

La plataforma lo que busca es utilizar toda la potencia de la Inteligencia Artificial para desmenuzar los vídeos y poder sacar los detalles ocultos de los vídeos que una análisis crítico con tiempo sacaría. Por supuesto, lo último que trata este trabajo es de adoctrinar hacia una idea política u otra, o hacia una postura ideológica u otra, sino justo lo contrario, que es analizar cómo un vídeo está pensado para explotar los miedos con un objetivo de manipular o inyectar una idea de pensamiento.

Un ejemplo de Retórica IA

El siguiente vídeo es de un influencer - hemos analizado más de un centenar de vídeos - pero este habla del presidente de los Estados Unidos y del presidente de Canadá, al respecto de sus discursos en el foro de Davos. Como es un vídeo creado para las redes sociales, está cortado, narrado y dirigido, y lo que hace el Analizador de Retórica IA es desmenuzarlo para ver cómo está "cocinado" por detrás.

Figura 5: Análisis del vídeo. Descripción general

Para poder extraer todos los detalles, con la Inteligencia Artificial se hace un análisis de las partes que conforman la narración completa, para poder ver en cada una de ellas qué es lo que se está poniendo en pantalla y de qué forma se está presentando.

Figura 6: Secciones del vídeo analizado

He ocultado el nombre del influencer que ha hecho este vídeo no porque esté ni a favor ni en contra de él, sino porque se trata de un análisis que pretende ser lo más aséptico posible. En ningún momento se trata de marcar al creador del vídeo como "manipulador" o algo similar, sino desmenuzar los vídeos virales en su explotación de vídeos de forma subliminales, como el de este ejemplo.

Figura 7: Secciones del vídeo hasta el final

Una vez analizadas las secciones del vídeo, tanto en imagen como en narración, con Inteligencia Artificial analizamos los miedos siguiente el Modelo del Dr. Karl Albrecht, clasificándolos en Nivel 1, Nivel 2 o Nivel 3, identificando la intensidad del miedo explotado y la mecánica cognitiva utilizada para explotar ese miedo.

Figura 8: Análisis de miedos explotados en el vídeo

Además, como se puede ver, se hace una visión en conjunto del nivel de densidad de miedos, cruzado con sus intensidad, lo que al final desmenuzamos en una gráfica de intensidad de convencimiento en la línea temporal del vídeo, como podéis ver en esta gráfica asociada a este vídeo.

Figura 9: Timeline de Gravedad por Intensidad 

Como parte del análisis del vídeo, también analiza el Endogrupo y el Exogrupo, para saber cómo se diferencia entre Nosotros y Ellos, para lograr la movilización ideológica utilizando el miedo como herramienta de activación.

Figura 10 : Vector Ideológico del vídeo

Por último, usando el modelo de Inteligencia Artificial, le pedimos un Veredicto Forense del vídeo utilizando la base estudiada hasta el momento. En este caso, el resultado de este vídeo es el siguiente.

Figura 11: Veredicto Forense

Al final, este análisis da un punto de vista técnico centrado en la construcción del mensaje y los miedos para poder evitar cualquier artefacto subliminal que un vídeo pudiera estar utilizando al consumirlo por una red social ya que, como vemos en este ejemplo, está cocinado con una idea clara en el objetivo que luego se oculta bajo una construcción narrativa muy concreta. 
Como os podéis imaginar, este tipo de análisis nos abrió la puerta a muchos análisis de vídeos, con resultados muy interesantes. Analizando los vídeos creados con Inteligencia Artificial para generar bulos y Fake News, que vamos a ver en la siguiente parte de esta serie dedicada a los miedos:
¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, marzo 10, 2026

Fear of the Dark: Detección de Suplantación de Identidad y DeepFakes usando Verificación de Identidad en MyPubicInbox

Continuando la serie de Fear of the Dark, como parte de la presentación de RootedCON, sincronizamos la publicación de un servicio para Perfiles Públicos que llevaba tiempo con ganas de tener. Como os he contado muchas veces, me he topado con la experiencia de la suplantación de mi identidad muchas veces, y por eso quería tener una forma de solucionar esto, mediante una Verificación de Identidad explícita, en este caso, usando MyPublicInbox.
La idea es muy sencilla. Supongamos que tú estás por ahí en las redes, y supuestamente te has topado conmigo, con Chema Alonso en un foro, en un canal de chat, o alguien que has encontrado te ha dicho que yo es mi amigo y que yo hago trabajos de hacking, que invierto en nosequé, o que yo estoy detrás de algo, y entonces un día tienes un chat o una vídeo conferencia "conmigo"... 

Ya te digo yo que seguramente sea un Suplantación de Identidad y puede que estén usando una DeepFake, así que, sencillo. te vas a mi perfil en MyPublicInbox, y solicitas una Verificación de Identidad, que de momento es un servicio gratuito para todos los usuarios de MyPublicInbox.
Desde ahí puedes enviar una evidencia, mediante una captura de pantalla, junto con una descripción de dónde supuestamente estás teniendo una reunión virtual conmigo, un chat, o una conversación. Si estás teniendo esa supuesta reunión conmigo, puedes "decirme" que quieres Verificar Mi Identidad sin ningún problema, que yo pasaré este proceso contigo.
Esto generará una Petición de Verificación de Identidad que me entrará en Mi buzón de MyPublicInbox para que pueda revisarla, con toda la información que me has enviado. Solo tengo que ir a la sección de Verificación de Identidad y tendré en la zona de Verificar Identidad la petición.
Y ahora, pues con pulsar en Revisar tendré acceso a los detalles que me hayas proporcionado, con la captura de la imagen por delante, así que puedo ver si es una conversación mía de verdad o no. En este caso, para la demostración he subido una fotografía mía, pero lo suyo es subir la captura de una vídeo conferencia o del chat, o de lo que sea que se supone que soy yo.
Y como yo soy yo, y sé si yo estoy haciendo ese chat, esa vídeo conferencia, esa reunión virtual o tengo esa cuenta en ese supuesto foro, pues daré a Rechazar o Verificar, con lo que generará un PDF con los datos del proceso de la Verificación o la No Verificación.
El documento son unas páginas donde se detallan los datos de la petición, los datos de las fechas, y que ha pasado por los servidores de MyPublicInbox, que el usuario concreto que recibió la petición la revisó y dijo que sí, que era él, o que no, que no era él.
La única Verificación de Identidad que utilizamos ahora mismo es la del dueño de la cuenta, que sabe si él está o no está teniendo esa reunión o no. Es como si me llamara un amigo y me dijera: 

"Oye Chema, ¿eres tú el que está ahora en el foto de XXXX diciendo esas cosas?" 

Y yo le confirmará que sí o que no. Lo que me ayudará a mí a saber dónde me están suplantando la identidad y a él a protegerse contra una estafa.
Para configurar esto este servicio en MyPublicInbox, si eres un Perfil Público, puedes activarlo en el menú de tu cuenta de MyPublicInbox en la sección de Verificación de Identidad - Configurar Verificación. En el siguiente vídeo tienes una demostración de proceso completo.
Al final, a pesar de que sea un servicio dependiente de una identidad en Internet - la de MyPublicInbox - ya obliga a los ciberestafadores a primero tener que robar la cuenta de MyPublicInbox, y luego a hacer la DeepFake o la suplantación, por lo que es una protección más antes de enviar dinero, o hacer cualquier tontería. 
Y por supuesto, desde MyPublicInbox monitorizamos el uso de este servicio para detectar situaciones de fraude, que además de mucha víctima, también hay mucha ciberestafa, por lo que la monitorización constante es clave siempre.
¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


martes, febrero 17, 2026

Autómatas victorianos, gargantas de cuero y redes neuronales: Anatomía secreta de las máquinas parlantes

¿Has pensado alguna vez que todo lo que decimos, todo lo que hemos escrito como especie, emerge de un conjunto ridículamente pequeño de sonidos? En Español por ejemplo tenemos 24 fonemas: veinticuatro piezas diminutas con las que construimos poemas, amenazas, declaraciones de amor, contratos, memes y tragedias. Pocos ingredientes, un puñado de leyes fundamentales y… ¡Bang! Ahí lo tienes. Como el universo, pues igual.

Figura 1: Autómatas victorianos, gargantas de cuero y redes neuronales.
Anatomía secreta de las máquinas parlantes 

Por eso los modelos de lenguaje actuales no son solo el sueño del informático, también lo son del lingüista, del físico y de cualquiera con dos dedos de curiosidad. Los LLMs demuestran que el lenguaje humano, con toda su aparente infinitud, en realidad responde a combinatoria pura. ¿A que mola? Tremendo. Pero tranqui, que no me enrollo. Hoy no nos metemos en neuras "neurales". Sólo vamos a hablar de un rinconcito pequeñito de todo este universo paralelo: el arte oscuro de fabricar voces sin cuerpos. Me refiero a la síntesis de voz.

Voz humana, ¿es tan difícil de imitar?

Para hablar de esto, te voy a hacer una pregunta a ver qué tal la contestas. ¿Cuándo se inventó el text-to-speech?  Te doy tres opciones, a ver si aciertas:

A. En la década de 2010, con deep learning.
B. A principios de los 2000, con modelos estadísticos.
C. En pleno siglo XIX, entre gas, carbón y sombreros de copa.

Y la respuesta correcta es… Sí. Las tres. Hola, soy María.

La primera vez que escuché el aria de Olympia, de 1879 —“Les oiseaux dans la charmille”, de la ópera Les contes d'Hoffmann de Jacques Offenbach— pensé: “ay, si fuera soprano para poder cantarla”… ¡Pero no! No cambio mi atípico registro heredado por nada del mundo. Aunque en este caso molaría, porque el personaje de Olympia es un robot.

Y es que desde que voy a clases de canto con Eduardo Laher (como parte de mi reto humano vs. SUNO aquí en El lado del mal), estoy siendo mucho más consciente de cómo funciona mi voz a nivel fisiológico. Pulmones que se inflan como fuelles, diafragma que regula la presión como una válvula de vapor, cuerdas vocales vibrando como una lengüeta metálica, cavidades óseas actuando como cajas de resonancia… A veces me siento como un ingenio analógico-biológico de novela gótica. Es una gran sensación.

Figura 2: Así imagino a la autómata Olympia, de la ópera Les contes d'Hoffmann
de Jacques Offenbach (imagen generada en perchance.org)

Pero sobre todo, gracias a las clases de canto me doy cuenta de que a diferencia de otras destrezas humanas —como caminar por ejemplo (complejísimo)—, a simple vista la emisión de voz y articulación del habla no parece algo tan complicado a nivel físico.  ¿Y si esta cierta simplicidad fisiológica permitiera imitar los mecanismos de la voz humana por medios analógicos? ¿Y si no hiciera falta ni electricidad? ¿Crees que sería posible? 

Pues atiende, porque esto mismo ya se le ocurrió a alguien hace casi 250 años. Lo sé porque yo estaba allí. Con Cristopher Lambert como Connor MacLeod. Es broma. Mucho antes de la electricidad, ya hubo inventores empeñados en reproducir la voz humana construyendo literalmente gargantas artificiales. Pero no solo lo intentaron: lo consiguieron.

La máquina parlante de Kempelen: un precursor de finales del XVIII

En 1779, el ingeniero austrohúngaro Wolfgang von Kempelen presentó su máquina parlante. Funcionaba con un fuelle que hacía de pulmones, una lengüeta vibrante como cuerdas vocales y un sistema de tubos manipulables que simulaban la boca y la garganta. No leía texto ni entendía nada, pero articulaba sonidos, tanto vocálicos como consonánticos. O algo lo suficientemente parecido como para resultar profundamente inquietante.


En 1791 Kempelen publicó su tratado sobre el mecanismo del habla humana, Mechanismus der menschlichen Sprache nebst Beschreibung seiner sprechenden Maschine. En esencia, afirmaba que la voz no era alma ni espíritu, sino ingeniería… Yo coincido, ¿y tú?

Euphonia, el primer autómata text-to-speech (con careto y uncanny valley incluidos), siglo XIX

Décadas después, en 1846, el inventor austriaco Joseph Faber presentó Euphonia, una criatura mecánica digna de un laboratorio de experimentos galvánicos. Tenía lengua artificial móvil, labios de cuero, paladar mecánico y un teclado desde el que “promptear” las frases en tiempo real (de hecho esta es la definición exacta de text-to-speech).


Las crónicas cuentan que el público quedaba dividido entre la fascinación y el terror. Tú imagínate una careta semirrígida clavada en una especie de potro de tortura, pronunciando palabras con labios de cuero muy despaaacio, en mitad de una sala inundada por sombras a contraluz de las lámparas de gas… Qué repelús, ¿no? 

Pues ya ves: las máquinas parlantes nacieron en el mismo caldo cultural que los autómatas, el mesmerismo y las primeras historias de ciencia ficción. Era una época obsesionada con la idea de que la vida podía fabricarse… ¡Está vivo! Está... ¡¡¡Vivooo!!! ¡Mua-ha-ha!

Siglo XX: de la mecánica a la electrónica

El siguiente salto consistió en abandonar la ilusión anatómica. No hacía falta construir una boca si se podía generar directamente el sonido. Te lo cuento a toda pastilla “quick and dirty”, ¿ok? En 1939, en la Feria Mundial de Nueva York, Bell Labs presentó el VODER, desarrollado por Homer Dudley. Una operadora entrenada lo manejaba con teclas y pedales, modulando filtros electrónicos que producían voz en tiempo real. El habla dejaba de ser carne o cuero y se convertía en señal.


Si nos leíste aquí en El lado del mal, esto ya te lo sabes ;) En 1961 sucedió otro momento histórico: un ordenador IBM 704 interpretó “Daisy Bell” en un experimento vinculado al pionero de la música por ordenador Max Mathews. Aquella voz temblorosa acabaría inspirando la escena en la que HAL 9000 canta mientras lo desconectan en “2001: A Space Odyssey”. Una máquina cantando su propia muerte. Muy victoriano también, muy romántico ¿a que sí?

Figura 7: HAL 9000 cantando Daisy Bell 

Durante las décadas siguientes, los ingenieros se convirtieron en una especie de anatomistas del sonido. En los años 70 dominó la síntesis por formantes, que modelaba matemáticamente las resonancias del tracto vocal. No sonaba natural, pero era flexible. El sintetizador DECtalk utilizaba este enfoque, y fue el que dio voz al físico Stephen Hawking durante gran parte de su vida.

Figura 8: El dr. Stephen Hawking con sus amigos de The Big Bang Theory.

En los 80 y 90 apareció la síntesis concatenativa, que consiste en grabar miles de fragmentos reales y coserlos como un doctor Frankenstein acústico. El resultado era mucho más humano… Aunque también más rígido. A finales de los 90 y principios de los 2000 entraron los modelos estadísticos, especialmente los basados en HMM (Hidden Markov Models). La voz empezaba a generarse no solo a partir de piezas grabadas, sino de probabilidades. Matemáticas sustituyendo anatomía.

Figura 9: Libro de "Microhistorias: anécdotas y curiosiades de la historia
de la informática (y los hackers)" de Fran Ramírez y Rafel Troncoso 0xWord.


Y entonces llegó el equivalente tecnológico a encender una máquina de vapor con combustible nuclear: el deep learning. Por cierto, si te interesa un buen “Deep Learning para humanos” sobre síntesis de voz y otras mil maravillas de la técnica, hay un libro que no puede faltar bajo tu brazo de hacker, ahí cerquita de tu corazón. Me refiero a "Microhistorias: anécdotas y curiosiades de la historia de la informática (y los hackers)" de Fran Ramírez y Rafel Troncoso. Ya lo tienes, ¿a que sí? ¿No? ¡Pues autorregálatelo, es un must-have!

Siglo XXI... Y sin embargo, aquí estamos

Lo que te decía: la llegada del Deep Learning dejó todo lo anterior a nivel parvulitos, de cero a cien en un “¡ahí va diez!” En 2016, Google DeepMind presentó WaveNet, capaz de generar audio directamente a nivel de muestra. La naturalidad dio un salto casi sobrenatural. En 2017, Google introdujo Tacotron, un sistema end-to-end que aprendía pronunciación, ritmo y entonación automáticamente. Las máquinas ya no imitaban la voz humana: la recreaban. De repente, dejaron de “hablar como robots” y empezaron a sonar como personas.


Hoy, plataformas como ElevenLabs permiten clonar voces con una fidelidad inquietante, en múltiples idiomas y estilos. Y proyectos experimentales como Linly Dubbing prometen doblaje automático con sincronización labial, echando mano de Demucs, WhisperX, Edge TTS, CosyVoice… Si sobrevives al proceso de instalación entre entornos con mis amiguitas la Conda, la Anaconda y la Miniconda, estampándote de morros contra dependencias incompatibles y mensajes de error que parecen escritos no desde este lado del mal, sino desde un lado del mal literal total XD

Figura 11: Tiana gestionando dependencias como una demente. Tonterías como esta son el tipo de cosas que compartimos en el chat público de El lado del mal en MyPublicInbox. Date una vuelta por allí, nos lo pasamos piruleta.

Quizá lo más importante en este momento no es que las máquinas hablen, sino lo que ocurre cuando esta habilidad se combina con otras: reconocimiento de voz, traducción automática, generación de vídeo, lipsync, capacidades combinadas de los modelos de lenguaje… La tecnología actual permite algo que ningún ser humano en la historia había tenido: la capacidad de comunicarse en cualquier idioma con cualquier voz, en cualquier medio, casi instantáneamente. ¿Te acuerdas de lo que te contaba al principio sobre las lenguas naturales? Dos docenas de sonidos + un puñado de leyes fundamentales = ¡Bang! El universo. Pues ahí lo tienes, multiplica =^_^=



Si los inventores de autómatas del Siglo XVIII pudieran ver lo que hemos construido, probablemente no pensarían que es tecnología. Pensarían que es espiritismo. O alquimia. O que en algún punto del proceso abrimos una puerta que quizá no sabríamos cerrar. Y sin embargo aquí estamos. Escuchando hablar a las máquinas a punto de que nos “vuele la cabeza”… Y sin recordar que, en el fondo, nuestra forma de hablar también responde a una mecánica simple, contante y sonante, emulable incluso sin electricidad.

¡Saludos buenignos!

Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares