martes, agosto 11, 2026

Los Six-Seven Large Slang-Bro Models

Llevo dos décadas practicando la afición - u oficio - de publicar artículos en mi blog. Al final son páginas web que los LLM están viniendo a consumir para entrenar sus modelos. Necesitan textos para generar Modelos de Lenguaje inteligentes, así que llevo 20 años escribiendo para vosotros y gracias a eso, ahora las Inteligencias Artificiales Generativas de textos, puedan entrenarse. De nada. 

Figura 1: Los Six-Seven Large Slang-Bro Models

No es una cosa que diga por decir, es algo que podéis ver en los datos de AI Insights en Radar de Cloudflare, donde si miramos qué porcentaje de crawlers vienen a por datos para entrenamiento, y cuantos vienen para inferencia y entrenamiento, y los sumamos, vemos que son más del 75 %. No está mal la de de IAs que entreno todos los días.
Los datos de las webs, los foros, los blogs, y demás textos publicados en HTTP tienen una estructura concreta. Es verdad que en las redes sociales hay mucho lenguaje informal, pero esos no están siendo entregados a los crawlers de LLMs para que entrenen sus modelos. Nop. Esos los usará cada empresa para entrenar a sus propios modelos. 

Pero todo dato es bueno. 

De hecho, hemos visto cómo los grandes LLMs han comprado libros y los has destrozado para escanearlos a la velocidad más rápida posible y entrenar los modelos con todos ellos. Los libros, suelen tener lenguaje más formal, pasar revisiones de formato, gramaticales, de estilo, etcétera, así que son los textos más valiosos para hacer un modelo culto y refinado, además de para los modelos científicos, de ingeniería, o de habilidades tecnológicas.
Sin embargo, hay otra gran cantidad de datos para los LLMs en otros formatos que no son los blogs, y que son las redes sociales, los vídeos de Youtube, los podcasts en Spotify, o las redes sociales - como ya he dicho - como son Instagram o Tiktok. Especialmente este último, donde los más jóvenes aún proliferan.

Figura 4: Extrayendo un Markdown de un vídeo de Tiktok

Aquí los textos para entrenar a los LLMs son de lenguaje más de la calle, es decir, más Six-Seven, donde hay interacciones genuinas de seres humanos sin filtro alguno. 

Figura 5: Extracción de textos en formato Markdown

Con estos datos, que son oro para los creadores de modelos de IA, se pueden crear LLMs que hablen perfectamente el Slang de hoy en día, con los "Bro", los "Catas", los "En Plan" y todas esas cosas que se dicen tanto hoy en los más jóvenes. Y es muy sencillo a día de hoy procesarlos. Yo me he bajado uno al azar de TikTok cortito y en nada Gemini te saca el Markdown del fichero.

Enriqueciendo los datos

Pero no solo eso, como ya os conté en la prueba que hice para usar los LLMs en modelos de Análisis Forense de fotografías, también son perfectos para sacar Metadatos para estas conversaciones de vídeos, así el fichero Markdown queda más enriquecido.

Figura 6: Metadatos generados sobre el vídeo

Así que, es normal que con este apetito voraz por datos nuevos, por nuevos datos que actualicen el conocimiento constante de los LLMs y su adaptación al día de hoy, cada día quieren más y más datos de entrenamiento, de donde sean. Y los de estas redes son muy buenos para crear modelos adaptados a los más jovenes. Los Six-Seve Large Slang-Bro Models.... o algo así.
En la última imagen, os he dejado los bots que no diferencian para qué vienen a coger datos de una web. Llaman la atención Apple, Microsoft y Google, que no quieren perder la posibilidad de utilizar los datos que meten en sus índices para usarlos también en entrenamiento, algo que creo que lo deberían saber los dueños de los datos.

¡Saludos Malignos!

Autor: Chema Alonso (Contactar con Chema Alonso)  


No hay comentarios:

Entrada destacada

Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment. Nuestro nuevo libro en 0xWord

Pocas veces me ha hecho tanta ilusión que saliera un nuevo libro en 0xWord como con este libro de " Hacking IA: Jailbreak, Prompt Inje...

Entradas populares