Meta llegó a un acuerdo en la demanda de los libros. El permiso ahora tiene un precio.

Meta ha aceptado resolver la demanda colectiva que la acusaba de entrenar sus modelos Llama con libros pirateados. El acuerdo propuesto se presentó ante un tribunal federal a finales de septiembre, y la notificación se envió a los titulares de derechos días después. Los términos financieros están sellados hasta que un juez los apruebe, y Meta sigue diciendo en público que sus prácticas de entrenamiento están amparadas por el uso justo. Lo que el acuerdo no dice es tan revelador como lo que sí dice.
El caso se centró en el lado de la adquisición, no en el del entrenamiento. Los autores alegaron que los modelos Llama se entrenaron con obras extraídas de bibliotecas clandestinas como LibGen entre 2018 y 2024. Ese detalle importa porque un fallo aparte ya trazó una línea justo por el medio de este problema. En el caso de Anthropic, el juez William Alsup determinó que entrenar un modelo con libros protegidos por derechos de autor es lícito, pero que conservar una biblioteca de copias pirateadas no lo es. La sanción en ese caso, un acuerdo de 1.500 millones de dólares, se vinculó a cómo se obtuvieron los libros, no al aprendizaje en sí.
Leídos en conjunto, los dos resultados describen una regla fácil de enunciar y difícil de sobrellevar. Aprender de un libro que adquiriste legalmente está bien. Construir un corpus a partir de copias pirateadas, no. La cifra de 1.500 millones de dólares equivale a unos 3.000 dólares por obra, lo que le da a cada laboratorio una forma de poner precio a su propia exposición. Si extrajiste un corpus de un sitio pirata, ahora tienes un número aproximado de lo que cuesta esa decisión.
La exclusión voluntaria está siendo reemplazada por un precio
El cambio más trascendente es lo que viene después. Un acuerdo aparte reportado este mes sustituyó el modelo de registro voluntario de exclusión por una estructura obligatoria de tarifas de licencia vinculada a cuántos datos se usan. El argumento que lo sustenta es directo: las vías de exclusión parecían justas sobre el papel y fallaron en la práctica, porque los desarrolladores rara vez consultaban o respetaban las listas de exclusión. Pagar por volumen es más difícil de ignorar.
Eso reencuadra toda la negociación. Con la exclusión voluntaria, la única palanca de un titular de derechos era decir no y esperar. Con una licencia con precio, el permiso se convierte en una partida con un número adjunto, y la discusión pasa de si las empresas de IA pueden usar la obra a cuánto deben pagar por ella. Para editoriales y autores, esa es una posición mucho mejor que una barrera técnica que nadie hacía cumplir.
El efecto práctico en los laboratorios es un nuevo presupuesto de cumplimiento normativo. La procedencia de los datos deja de ser una preferencia de ingeniería y se convierte en un requisito legal. Si un corpus de un conjunto de datos de varios petabytes proviene de una fuente que no se puede documentar, introduce una responsabilidad específica en toda la cadena de entrenamiento, y el fallo suele ocurrir en la capa de agregación, donde se combinan conjuntos de datos de terceros sin una atribución clara.
La cuestión de los resultados sigue abierta
Los datos de entrenamiento son solo uno de los dos frentes. El otro es lo que produce el modelo, y ahí el panorama está menos definido. The New York Times sobrevivió a la moción de desestimación de OpenAI al alegar de forma verosímil que los resultados de ChatGPT compiten con su periodismo. Esa es una teoría de sustitución de mercado, y opera de forma distinta a la teoría de la adquisición. Si el modelo aprende de una obra y no la reproduce, el argumento de transformación se sostiene. Si su resultado sustituye al original en el mercado, el argumento se debilita.
Denegar una moción de desestimación no es una declaración de responsabilidad, y el caso del Times sigue avanzando. Pero las dos teorías juntas son la razón por la que las empresas de IA ahora tratan la procedencia y la monitorización de resultados como un solo problema. Un modelo entrenado con datos licenciados aún puede generar algo que compita con la fuente, y los términos de la licencia dicen cada vez más lo que no puede hacer.
El audio no sigue el mismo camino
Si los editores de libros se dirigen hacia un mercado de licencias, la música se dirige hacia algo más desordenado. Suno perdió un fallo en Alemania presentado por GEMA, la sociedad de derechos de ejecución, por el uso de grabaciones y composiciones protegidas por derechos de autor. Los casos estadounidenses sobre texto se están resolviendo en gran medida con pagos y licencias retrospectivas. Los casos de audio están produciendo medidas cautelares y disputas de jurisdicción, lo que para una empresa de productos es el peor resultado, porque una medida cautelar detiene el servicio en lugar de gravarlo.
La diferencia parece reducirse a qué tan cerca está el resultado de la entrada. Un modelo de lenguaje que resume un libro está a un paso del texto. Un modelo musical que genera una canción al estilo de un artista está lo suficientemente cerca como para que la comparación sea inmediata, y los tribunales han estado menos dispuestos a extender el argumento de la transformación para cubrirlo.
Donde el precio aún no existe
El punto de referencia por obra es, hasta ahora, un fenómeno del texto, y la razón es la infraestructura. Los editores de libros tienen organismos de licencias colectivas, décadas de precedentes sobre derechos de reproducción y una unidad de intercambio razonablemente clara, que es la obra. Eso hace que un precio por título sea fácil de definir y fácil de discutir en los tribunales.

Las imágenes, el vídeo y el código no tienen la misma configuración. Una biblioteca de fotos de archivo puede poner precio a una licencia por imagen, pero una captura de pantalla de una página web contiene docenas de elementos protegidos por derechos de autor a la vez, y un repositorio de código mezcla archivos licenciados, con licencias permisivas y no atribuibles en el mismo árbol. Una vez que la cuestión pasa del texto a cualquiera de esos, la fórmula por obra deja de aplicarse y el debate vuelve al uso justo, que es el terreno en el que las empresas de IA prefieren luchar.
La otra cuestión abierta es quién recauda. Una tarifa de licencia que nadie administra termina convirtiéndose en una demanda colectiva de todos modos, y las estructuras de acuerdo reportadas este mes todavía describen pagos negociados caso por caso en lugar de un mercado permanente con tarifas publicadas. Hasta que las tarifas sean públicas, cada negociación ocurre en privado, y los mayores compradores obtienen las mejores condiciones. Esa es la forma de un mercado que se ha formado pero aún no ha madurado.
Qué significa esto si construyes sobre estos modelos
La mayoría de los desarrolladores que leen esto no entrenan modelos fundacionales, así que la exposición directa es baja. La exposición indirecta no lo es. Los laboratorios que absorben acuerdos de ocho y nueve cifras trasladan el costo, y el mecanismo es el precio de la API. Prevé que el acceso a los modelos suba durante el próximo año o dos, especialmente para modelos entrenados con material licenciado, donde la propia licencia ahora forma parte del costo de los bienes.
Hay una segunda implicación, más silenciosa, para cualquiera que aloje o ejecute cargas de trabajo de IA. Si almacenas conjuntos de datos de entrenamiento para un cliente, el riesgo legal ahora depende de dónde vinieron esos archivos, no de lo que el cliente haga con ellos. Una documentación clara de la procedencia deja de ser un gasto general y pasa a ser lo que evita que una sentencia de ocho cifras recaiga sobre un sistema que tú operas.
La parte no resuelta es hasta dónde se extiende el modelo de precios. Los editores de texto tienen una infraestructura de licencias colectivas y un conjunto de casos resueltos que pueden señalar. La música tiene sociedades, pero una relación distinta con los resultados. Las imágenes, el vídeo y el código tienen cada uno sus propias dinámicas, y ninguno de ellos tiene todavía un punto de referencia por obra. El acuerdo de Meta elimina un punto de referencia del mapa. No dibuja el resto, y los próximos acuerdos decidirán si el permiso se convierte en un mercado o sigue siendo una serie de excepciones.
Artículos relacionados
El chip de memoria es ahora el cuello de botella del cómputo de IA
La hoja de ruta de la lógica es pública y predecible. La de la memoria está condicionada por los rendimientos de empaquetado, una base de talento que se tarda años en formar y los planes de inversión de tres empresas.
La música con IA obtuvo una licencia. Lee qué cubre en realidad.
Las pistas baratas siguen existiendo. Lo que está desapareciendo es la suposición de que una pista generada a partir de un prompt está libre de reclamaciones, algo que nunca fue cierto y que ahora es demostrablemente falso.
Los estudios de Hengdian están vacíos mientras avanza la cadena de producción de cine con IA de Asia
Los platós vacíos de Hengdian son la prueba de que la industria ya ha hecho su apuesta, coincida o no el público.
Google compró 890 megavatios de energía nuclear para alimentar sus centros de datos
La capacidad de cómputo está disponible. La electricidad es lo que hay que organizar, con años de antelación, como se organiza una cadena de suministro.