Los Six-Seven Large Slang-Bro Models
Llevo dos décadas practicando la afición - u oficio - de publicar artículos en mi blog. Al final son páginas web que los LLM están viniendo a consumir para entrenar sus modelos. Necesitan textos para generar Modelos de Lenguaje inteligentes, así que llevo 20 años escribiendo para vosotros y gracias a eso, ahora las Inteligencias Artificiales Generativas de textos, puedan entrenarse. De nada.
No es una cosa que diga por decir, es algo que podéis ver en los datos de AI Insights en Radar de Cloudflare, donde si miramos qué porcentaje de crawlers vienen a por datos para entrenamiento, y cuantos vienen para inferencia y entrenamiento, y los sumamos, vemos que son más del 75 %. No está mal la de de IAs que entreno todos los días.
Los datos de las webs, los foros, los blogs, y demás textos publicados en HTTP tienen una estructura concreta. Es verdad que en las redes sociales hay mucho lenguaje informal, pero esos no están siendo entregados a los crawlers de LLMs para que entrenen sus modelos. Nop. Esos los usará cada empresa para entrenar a sus propios modelos.
Pero todo dato es bueno.
De hecho, hemos visto cómo los grandes LLMs han comprado libros y los has destrozado para escanearlos a la velocidad más rápida posible y entrenar los modelos con todos ellos. Los libros, suelen tener lenguaje más formal, pasar revisiones de formato, gramaticales, de estilo, etcétera, así que son los textos más valiosos para hacer un modelo culto y refinado, además de para los modelos científicos, de ingeniería, o de habilidades tecnológicas.
Sin embargo, hay otra gran cantidad de datos para los LLMs en otros formatos que no son los blogs, y que son las redes sociales, los vídeos de Youtube, los podcasts en Spotify, o las redes sociales - como ya he dicho - como son Instagram o Tiktok. Especialmente este último, donde los más jóvenes aún proliferan.
Aquí los textos para entrenar a los LLMs son de lenguaje más de la calle, es decir, más Six-Seven, donde hay interacciones genuinas de seres humanos sin filtro alguno.
Con estos datos, que son oro para los creadores de modelos de IA, se pueden crear LLMs que hablen perfectamente el Slang de hoy en día, con los "Bro", los "Catas", los "En Plan" y todas esas cosas que se dicen tanto hoy en los más jóvenes. Y es muy sencillo a día de hoy procesarlos. Yo me he bajado uno al azar de TikTok cortito y en nada Gemini te saca el Markdown del fichero.
Enriqueciendo los datos
Pero no solo eso, como ya os conté en la prueba que hice para usar los LLMs en modelos de Análisis Forense de fotografías, también son perfectos para sacar Metadatos para estas conversaciones de vídeos, así el fichero Markdown queda más enriquecido.
Así que, es normal que con este apetito voraz por datos nuevos, por nuevos datos que actualicen el conocimiento constante de los LLMs y su adaptación al día de hoy, cada día quieren más y más datos de entrenamiento, de donde sean. Y los de estas redes son muy buenos para crear modelos adaptados a los más jovenes. Los Six-Seve Large Slang-Bro Models.... o algo así.
En la última imagen, os he dejado los bots que no diferencian para qué vienen a coger datos de una web. Llaman la atención Apple, Microsoft y Google, que no quieren perder la posibilidad de utilizar los datos que meten en sus índices para usarlos también en entrenamiento, algo que creo que lo deberían saber los dueños de los datos.
¡Saludos Malignos!
Autor: Chema Alonso (Contactar con Chema Alonso)





DragonJAR
8.8 Chile
Ekoparty
e-Hack MX
AREA 51
Comunidad Dojo Panamá
ARPAHE SOLUTIONS 

















