martes, agosto 11, 2026

Los Six-Seven Large Slang-Bro Models

Llevo dos décadas practicando la afición - u oficio - de publicar artículos en mi blog. Al final son páginas web que los LLM están viniendo a consumir para entrenar sus modelos. Necesitan textos para generar Modelos de Lenguaje inteligentes, así que llevo 20 años escribiendo para vosotros y gracias a eso, ahora las Inteligencias Artificiales Generativas de textos, puedan entrenarse. De nada. 

Figura 1: Los Six-Seven Large Slang-Bro Models

No es una cosa que diga por decir, es algo que podéis ver en los datos de AI Insights en Radar de Cloudflare, donde si miramos qué porcentaje de crawlers vienen a por datos para entrenamiento, y cuantos vienen para inferencia y entrenamiento, y los sumamos, vemos que son más del 75 %. No está mal la de de IAs que entreno todos los días.
Los datos de las webs, los foros, los blogs, y demás textos publicados en HTTP tienen una estructura concreta. Es verdad que en las redes sociales hay mucho lenguaje informal, pero esos no están siendo entregados a los crawlers de LLMs para que entrenen sus modelos. Nop. Esos los usará cada empresa para entrenar a sus propios modelos. 

Pero todo dato es bueno. 

De hecho, hemos visto cómo los grandes LLMs han comprado libros y los has destrozado para escanearlos a la velocidad más rápida posible y entrenar los modelos con todos ellos. Los libros, suelen tener lenguaje más formal, pasar revisiones de formato, gramaticales, de estilo, etcétera, así que son los textos más valiosos para hacer un modelo culto y refinado, además de para los modelos científicos, de ingeniería, o de habilidades tecnológicas.
Sin embargo, hay otra gran cantidad de datos para los LLMs en otros formatos que no son los blogs, y que son las redes sociales, los vídeos de Youtube, los podcasts en Spotify, o las redes sociales - como ya he dicho - como son Instagram o Tiktok. Especialmente este último, donde los más jóvenes aún proliferan.

Figura 4: Extrayendo un Markdown de un vídeo de Tiktok

Aquí los textos para entrenar a los LLMs son de lenguaje más de la calle, es decir, más Six-Seven, donde hay interacciones genuinas de seres humanos sin filtro alguno. 

Figura 5: Extracción de textos en formato Markdown

Con estos datos, que son oro para los creadores de modelos de IA, se pueden crear LLMs que hablen perfectamente el Slang de hoy en día, con los "Bro", los "Catas", los "En Plan" y todas esas cosas que se dicen tanto hoy en los más jóvenes. Y es muy sencillo a día de hoy procesarlos. Yo me he bajado uno al azar de TikTok cortito y en nada Gemini te saca el Markdown del fichero.

Enriqueciendo los datos

Pero no solo eso, como ya os conté en la prueba que hice para usar los LLMs en modelos de Análisis Forense de fotografías, también son perfectos para sacar Metadatos para estas conversaciones de vídeos, así el fichero Markdown queda más enriquecido.

Figura 6: Metadatos generados sobre el vídeo

Así que, es normal que con este apetito voraz por datos nuevos, por nuevos datos que actualicen el conocimiento constante de los LLMs y su adaptación al día de hoy, cada día quieren más y más datos de entrenamiento, de donde sean. Y los de estas redes son muy buenos para crear modelos adaptados a los más jovenes. Los Six-Seve Large Slang-Bro Models.... o algo así.
En la última imagen, os he dejado los bots que no diferencian para qué vienen a coger datos de una web. Llaman la atención Apple, Microsoft y Google, que no quieren perder la posibilidad de utilizar los datos que meten en sus índices para usarlos también en entrenamiento, algo que creo que lo deberían saber los dueños de los datos.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


lunes, agosto 10, 2026

El avión de la A-4 que se cruza en mi camino en Google Maps

Si ya conoces esta historia, entonces el post de hoy te lo puedes saltar. Pero yo no lo conocía, o si lo conocía ya me había olvidado. Así que cuando revisando la ruta que me marcaba Google Maps, de repente veo que voy a pasar por medio de una catástrofe aérea, me quedé un poco sorprendido, y por eso os lo dejo aquí explicado.

Figura 1: El avión de la A-4 que se cruza en mi camino en Google Maps

En uno de mis viajes recientes, cuando paré para hacer un descanso, repasé la ruta buscando la siguiente parada. Para eso, activo la opción de que me muestre las imágenes satelitales, para ver en qué próxima estación de servicio salir. Ya sabes, que sea cómoda para salir y entrar, que tenga cafetería, y si es posible, me gusta elegir la empresa de la estación de servicio.

Figura 2: Por lo menos iba por su derecha...

Y ahí, fue cuando me topé con un avión en la ruta. "WTF?" pensé. No me lo esperaba, la verdad. Según tenía entendido, Google Maps utiliza Inteligencia Artificial para detectar matrículas, vehículos, u objetos que debe borrar, así que me sorprendía ver un avión aparcado en el carril contrario. Además, como se puede ver, hay un trailer detrás, que para mí era ya el equipo de emergencias. Pero buscando en Gemini, la explicación es la que imaginaba... error de los algoritmos de borrado. 

Figura 3: Explicación de Gemini.

Os he hecho un vídeo del momento en el que lo encontré, para que veáis las nubes dejadas, que para mí, en un primer momento, era el rastro del polvo en un aterrizaje forzoso. No hay como montarse películas en la cabeza con estas cosas.

Figura 4: El vídeo del "accidente" de avión

Vista la imagen, y antes de haber comprobado que era un error de borrado del algoritmo de una foto tomada desde el satélite, proyectada la imagen del avión sobre la carretera, yo por si acaso agrandé una imagen para localizar de qué compañía es ese avión.

Figura 5: La imagen del avión ampliado

La imagen del avión ampliada - donde parece que se ven las llamas en color rojo - permite ver los colores del fuselaje, así que se puede adivinar la compañía. Pero en el mundo de la Inteligencia Artificial en el que nos encontramos, que trabaje nuestra amiga la IA.

Figura 6: El avión "en llamas" "accidentado" es de Vueling

El avión es de Vueling, así que, sabiendo que les tiran fotos desde el cielo, es momento de que comiencen a pensar en pintar mensajes en el techo del fuselaje del avión, como cuando los "hackers" de Facebook (Meta) dejaban un QRCode en el techo del HeadQuarter en Menlo Park.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares