LA IA ESTÁ DEVORANDO LIBROS PARA HACERSE MÁS INTELIGENTE

Introducción

Recientemente han aparecido en medios tecnológicos y generalistas noticias que informan de que algunas empresas tecnológicas han empezado a comprar y destruir millones de libros antiguos y descatalogados. Conscientes de la mala imagen que esta práctica podría proporcionales, utilizan intermediarios como ISBNdb.

¿Por qué actúan así? El objetivo es conseguir textos anteriores a 2022, fecha del boom de la IA generativa, y por lo tanto con la garantía de que fueron escritos por humanos al 100%, sin la contaminación del contenido generado total o parcialmente por la IA que actualmente inunda internet. Por ejemplo, en esta noticia de Esquire de 2023, ya se hablaba de libros disponibles en AMAZON escritos por Chat GPT.

En este post voy a explicarte por qué ocurre esto y al mismo tiempo aprenderás qué datos entrenan la IA, de dónde salen, cómo el exceso de contenido generado está cambiando las reglas del juego y por qué, de repente, las estanterías de libros viejos se han convertido en oro para los laboratorios de inteligencia artificial.

¿Cómo funcionan las IAs generativas especializadas en la producción de texto?

Los grandes modelos de lenguaje (LLM, del inglés Large Language Model) que están detrás de muchos chatbots y asistentes parecen que lo saben todo, pero necesitan datos de calidad para aprender. Cada vez más investigaciones alertan de que ese “alimento” se está agotando o se está contaminando, lo que podría frenar el avance de la IA Generativa de textos tal y como la conocemos.

En enero de 2025 Elon Musk declaraba en una entrevista «Ahora hemos agotado básicamente la suma acumulada del conocimiento humano… en el entrenamiento de IA». La IA ya no tenía material del que seguir aprendiendo. En la misma entrevista el propio Musk indicaba uno de los métodos de las empresas de IA para salvar este inconveniente «La única forma de complementar [los datos del mundo real] es con datos sintéticos, donde la IA crea [datos de entrenamiento]»

Los datos sintéticos se generan de manera que mantengan propiedades similares a la de los datos del mundo real, y pueden suponer importantes ahorros de costos para las empresas, por eso la consultora Gartner estima que, de aquí a 2030, sustituirán en gran medida a los datos ‘reales’ en el entrenamiento de este tipo de software.

El problema es que múltiples estudios publicados muestran que entrenar modelos con demasiados textos repetitivos, virales o generados por otras IAs puede degradar sus capacidades, desde el razonamiento hasta la comprensión de contexto. Por ejemplo en un estudio realizado por investigadores de las universidades de Rice y Stanford, en EE. UU., reveló que entrenar modelos de IA a través de datos sintéticos parece provocar su degradación, al menos a largo plazo. El término acuñado por los académicos para indicar esta aparente ‘efecto autoinmune’ del software es MAD, un acrónimo de Model Autophagy Disorder (trastorno de autofagia del modelo). El fenómeno recibe también los nombres de “colapso del modelo” o “podredumbre cerebral” de los LLM.

Dan Houser, confundador de Rockstar Games lo explicaba con una analogía con la enfermedad de las vacas locas. La enfermedad de las vacas locas se propagó cuando para alimentar el ganado se usaron restos procesados de otro ganado (en ocasiones portador de la enfermedad), en un ciclo cerrado que provocó el salto de la enfermedad entre especies de ganado y posteriormente a las personas. Del mismo modo, un LLM que aprende de datos sintéticos y/o contenido generado por otras IAs terminará degenerando: los modelos se vuelven menos precisos, menos diversos y más alejados de la realidad, desapareciendo matices y sutilezas y reforzando los errores originales.

¿Con qué tipo de fuentes se entrena a los LLMs?

Para entender el problema, primero necesitamos ver de dónde salen los datos con los que se entrena a los LLM. No hablamos de unos pocos textos: hablamos de enormes corpus recogidos de toda la red y de muchos otros recursos.

Empresas especializadas en datos, como Bright Data, describen este “menú” de entrenamiento formado por diferentes tipos de fuentes, cada una de ellas con unas características deseadas por parte de las empresas de IA:

Dictámenes y estudios académicos y técnicos

Aquí entran artículos científicos, informes técnicos, dictámenes legales, tesis y papers. Son textos largos, revisados por pares o expertos, con lenguaje preciso y relativamente poco ruido. Permiten al LLM aprender razonamiento complejo, terminología y estructuras formales.

Manuales, libros y textos largos

Libros de no ficción, manuales de usuario, documentación técnica, enciclopedias, ensayo… Estos textos aportan contexto, ejemplos y explicaciones desarrolladas. Son clave para que los modelos no solo sepan palabras sueltas, sino que aprendan conceptos, relaciones y expresiones. De hecho, hay empresas que se centran en recopilar y estructurar grandes cantidades de libros precisamente porque son un material muy valioso para entrenar LLM.

A veces, el contenido empleado para entrenar los LLM no es legal. Por ejemplo, los novelistas Richard Kadrey y Christopher Golden demandaron a Meta en el año 2023 por, supuestamente, entrenar a su LLM Llama con contenido pirateado extraído mediante una red de torrents, la investigación desveló comunicaciones internas de la compañía donde se daba a entender el uso de contenido pirata.

Estudios y reportes de empresas de datos

Plataformas de scraping y proveedores de datasets crean conjuntos de datos con contenido web estructurado: páginas informativas, foros, reseñas, catálogos, noticias, debates científicos, etc. Estas fuentes se combinan y depuran para que la IA aprenda a responder sobre temas cotidianos, productos, servicios y debates públicos.

Blogs y medios de divulgación tecnológica

Sitios especializados en tecnología, innovación y ciencia generan artículos accesibles, con ejemplos y analogías. Son útiles para que la IA aprenda a explicar conceptos de forma más humana, aterrizada y cercana al lenguaje que usamos día a día. También funcionan como termómetro de lo que preocupa al sector en cada momento.

Referentes de cada sector

En el ecosistema de fuentes, algunos blogs y medios tecnológicos funcionan como referentes y modelos de estilo, permitiendo difundir y transmitir hallazgos académicos con un lenguaje fácil para público no especializado. Por ejemplo, dentro de la web en español, nombres como Xataka o Genbeta se han consolidado por su capacidad para explicar temas complejos de forma clara y pegada a la actualidad.

Conclusiones

La imagen de una IA que lo sabe todo choca con una realidad muy humana: para saber tanto, antes debe aprender, pero sin datos de calidad, los modelos no mejoran (el famoso Garbage InGarbage Out , si el modelo debe aprender con basura, sus resultados serán basura).

El gran problema es usar como origen de datos de entrenamiento una internet ya inundada de textos generados por IA para entrenar los LLM. La idea es sencilla: si sucesivas generaciones de modelos se entrenan con datos generados por modelos anteriores, los textos generados cada vez tendrán más ruido, repeticiones y errores, y sesgos más reforzados.

La “crisis de datos” nos recuerda que detrás de cada respuesta hay textos escritos por personas, investigaciones, manuales, libros y artículos que han servido de base, de ahí las quejas de los autores sobre el uso de obras protegidas por derechos de autor para entrenar modelos, sin que los creadores originales reciban ninguna prestación.

Como amante de los libros que soy, me duele la destrucción de ejemplares antiguos, raros, escasos, tal vez únicos tras su escaneo para entrenar LLM y me surgen dudas en cuanto a la preservación del patrimonio cultural y la sostenibilidad del enfoque actual para entrenar IA (además de las necesidades de agua y de electricidad de los centros de datosdonde “vive” la IA). Me vino a la mente una frase, y tengo que reconocer que usé la IA para que me ayudara a identificar su autor y la redacción original: «Allí donde se queman los libros, se acaba por quemar a los hombres.» Heinrich Heine

Para saber más

¿Se están acabando los datos para entrenar IA?, artículo en el substack de Colegio Bourbaki.

Millones de libros antiguos son destruidos por empresas de IA: “Los mejores datos de entrenamiento están en una estantería” 28/07/2026 en La Vanguardia.

¿Por qué destruyen millones de libros? Van a reescribir el pasado y un juez ya lo ha autorizado, en el canal de YouTube de Marc Vidal. Aquí el divulgador habla también del riesgo de «reescribir la historia», al estilo del Ministerio de La Verdad en la novela 1984, cuya función principal era manipular o destruir documentos históricos de todo tipo (incluyendo fotografías, libros y periódicos), para conseguir que las evidencias del pasado coincidan con la versión oficial de la historia, mantenida por el Estado.

IA y Copyright: ¿Es legal entrenar inteligencia artificial con obras protegidas?, artículo en Starving Artist, abogados de la industria de entretenimiento, música y empresas creativas.

En inglés

AI models collapse when trained on recursively generated data, artículo en Nature.

AI Companies Are Buying Tons of Old Books Because They’re Free of AI Slop, articulo en 404media.

Artículos relacionados, aquí en MyTips