Seis periódicos demandan a Microsoft y OpenAI por artículos bajo muro de pago en el conjunto de entrenamiento

El 2 de octubre, seis empresas editoriales presentaron una demanda contra Microsoft y diez entidades de OpenAI en el Tribunal de Distrito de los Estados Unidos para el Distrito Sur de Misisipi. La demanda alega infracción de derechos de autor y la eliminación de información de gestión de derechos de autor en el desarrollo de los modelos GPT.
Los demandantes incluyen a Emmerich Newspapers, Ojai Media y varias empresas Coopwood, que publican periódicos y revistas en todo el Sur. Los demandados son Microsoft y un conjunto de entidades interrelacionadas de OpenAI. El caso está asignado al juez Henry Travillion Wingate, y el expediente se actualizó por última vez el 5 de octubre.
Qué alega realmente la demanda
Tres alegaciones son las que tienen peso.
En primer lugar, la demanda afirma que los demandados rastrearon sistemáticamente los sitios web de los demandantes, incluido el contenido detrás de muros de pago, y copiaron artículos en sus servidores repetidamente a medida que se actualizaban los modelos. La copia repetida es la parte que importa jurídicamente. Un solo rastreo es un acto. Volver a copiar el corpus en cada ejecución de entrenamiento multiplica el número de copias presuntamente infractoras, lo que multiplica la exposición.
En segundo lugar, los demandantes sostienen que los modelos exhiben memorización, codificando copias recuperables de las obras de entrenamiento. Esa afirmación se conecta con un conjunto de litigios en los que la cuestión no es si se produjo el entrenamiento, sino si el modelo resultante puede reproducir expresión protegida cuando se le solicita.
En tercer lugar, la demanda alega que productos como ChatGPT Search y Deep Research recuperan contenido de los sitios web de los demandantes en tiempo real y lo incorporan a las respuestas. Esta es la capa de recuperación, separada del entrenamiento. Incluso un modelo entrenado con datos autorizados puede, en el momento de responder, extraer texto de un sitio que no tenía licencia para leer.
Los demandantes también sostienen que los demandados eliminaron los créditos de autor, los nombres de las publicaciones, los avisos de derechos de autor y la información sobre términos de uso de los artículos. Eso se corresponde con la teoría de la información de gestión de derechos de autor, que no requiere probar que la copia subyacente fuera ilícita. Eliminar un aviso de derechos de autor de una obra referenciada es una infracción en sí misma según la ley estadounidense.
Los tres cargos son infracción directa de derechos de autor, eliminación de información de gestión de derechos de autor y robo intencional de los artículos.
Por qué importa el detalle del muro de pago
La alegación sobre el muro de pago es la parte más contundente de la demanda, y es un detalle que vale la pena separar de la cuestión general de si el entrenamiento con texto protegido por derechos de autor constituye uso justo.
El contenido detrás de un muro de pago queda fuera de la web abierta. Se publica bajo términos que condicionan el acceso, a menudo al pago, y esos términos normalmente prohíben la recolección automatizada. Un rastreo que atraviesa un muro de pago elude la propia condición de acceso en lugar de cometer un error sobre qué páginas eran públicas.
Ese encuadre se alinea con un cambio más amplio en la forma en que los propietarios de datos litigan. La disputa se está desplazando de si la copia está protegida a si el método de recolección respetó las condiciones de acceso que fijó la editorial. Los términos contractuales y de acceso están haciendo un trabajo que los derechos de autor por sí solos no podían hacer.

Dónde encaja esto en el patrón más amplio
Este caso se suma a una densa serie de litigios sobre derechos de autor y acceso. Las reclamaciones contractuales de Reddit contra Anthropic están avanzando, lo que da a las plataformas una vía para impugnar la recolección de datos al margen de la ley de derechos de autor. Anthropic, en su presentación ante el parlamento de Australia, propuso una "forma limitada de aprobación condicional" para el entrenamiento que permitiría a los titulares de derechos excluirse mediante robots.txt, un mecanismo que las emisoras públicas de Australia rechazaron por considerarlo habitualmente eludido.
En todos estos casos, los mismos hechos técnicos siguen apareciendo. Las señales de robots.txt fueron ignoradas por los principales rastreadores en pruebas documentadas. El contenido con muro de pago parece haber sido recopilado. Las funciones de recuperación muestran texto de editoriales en las respuestas incluso cuando la editorial nunca lo autorizó.
Las editoriales aquí son medios regionales y locales cuyos archivos tienen un valor real y cuyos presupuestos legales son modestos. Precisamente por eso vale la pena seguir el caso. Una victoria de grandes editoriales con grandes equipos jurídicos pone a prueba la ley. Un caso presentado por periódicos regionales pone a prueba si los remedios son utilizables por los titulares de derechos que no pueden permitirse años de descubrimiento de pruebas.
Qué podría cambiar un fallo
El resultado dependerá de preguntas que los tribunales llevan dos años rondando sin resolver. ¿El entrenamiento con texto protegido por derechos de autor es uso justo, y cambia la respuesta cuando el texto estaba detrás de un muro de pago? ¿La memorización convierte un uso de entrenamiento en una reproducción infractora? ¿La recuperación en tiempo real genera responsabilidad separada del entrenamiento? ¿Y eliminar avisos de derechos de autor de obras que aparecen en un conjunto de datos cuenta como infracción incluso si la copia en sí está permitida?
Ninguna de estas cuestiones está resuelta. Lo que hace la demanda es vincular las cuatro preguntas a un único conjunto de hechos y ponerlas ante un tribunal de distrito. Para cualquiera que cree productos sobre contenido web público, esa combinación es lo que hay que seguir. Las respuestas no llegarán rápido, y la práctica actual de la industria de rastrear primero y negociar después es exactamente lo que este litigio está poniendo a prueba.
Por qué las editoriales regionales presentan un caso diferente
La identidad de los demandantes da forma al litigio de maneras que los casos de grandes editoriales de los últimos años no lo hicieron.
El caso del New York Times, y las demandas de la industria musical anteriores, se apoyaban en archivos corporativos con décadas de ingresos por licencias comerciales a los que señalar. Podían argumentar que existía un mercado y que fue desplazado. Un grupo de periódicos regionales aporta una postura probatoria diferente. Sus archivos son más pequeños, su historial de licencias es más limitado y su reclamación se basa más directamente en la copia en sí y en la eliminación de la información de derechos de autor.
Eso importa para el remedio. Si los demandantes prevalecen en el cargo de información de gestión de derechos de autor, el remedio está disponible incluso cuando la copia subyacente está en disputa, porque eliminar un aviso es una infracción autónoma. Para un demandante sin un largo historial de licencias, ese cargo es la vía más viable.
La capa de recuperación como exposición separada
La alegación sobre ChatGPT Search y Deep Research vale la pena separarla de la cuestión del entrenamiento, porque apunta a un tipo diferente de responsabilidad.
El entrenamiento es un acto único, sin importar cuántas veces se reconstruya el corpus. La recuperación ocurre en cada consulta, en el momento en que un usuario pregunta. Si un producto recupera texto del sitio de una editorial en tiempo real y lo incorpora a una respuesta, el acto presuntamente infractor es continuo y activado por el usuario.
Esa distinción da a los demandantes una reclamación que no depende de ganar el argumento de uso justo sobre el entrenamiento. Incluso un modelo entrenado por completo con datos autorizados puede, mediante una función de recuperación, mostrar texto de una fuente que nunca autorizó. El encuadre de la demanda trata la recuperación y el entrenamiento como dos ilícitos separados, lo que es una estructura más sólida que vincular todo al corpus de entrenamiento.
Qué están observando las editoriales
Dos señales indicarán a la industria si vale la pena presentar este tipo de caso a gran escala.
La primera es si el tribunal permite que la reclamación sobre información de gestión de derechos de autor sobreviva a una moción de desestimación. Ese cargo no requiere resolver el uso justo, por lo que un fallo a favor de los demandantes al respecto daría a las editoriales una vía más rápida hacia una reparación que un juicio completo por infracción.
La segunda es si la fase de descubrimiento de pruebas llega al proceso de entrenamiento. Si los demandantes pueden obligar a entregar registros de qué se rastreó y cuándo, el caso cambia de un argumento jurídico sobre uso justo a un argumento fáctico sobre lo que realmente hizo el rastreador, incluido si fue más allá de los muros de pago. Los profesionales del sector editorial están siguiendo el expediente precisamente por ese tipo de orden, porque les diría qué pruebas se pueden obtener antes de comprometerse con sus propias demandas.
Artículos relacionados
India está escribiendo sus propias normas de seguridad de la IA y se niega a copiar las de Washington
Probar solo en inglés produciría un marco que no certifica nada sobre la mayoría de los despliegues que cubre.
Griffin, de Tavus, pasó por humano el 48 % de las veces, y la empresa no lo lanzará
Un falso pregrabado solo responde a preguntas preparadas. Un sistema en tiempo real responde a cualquier cosa que se le pregunte.
Anthropic encontró 129.000 vulnerabilidades y luego endureció el acceso
La empresa, en el punto álgido de una demostración de seguridad, eligió ese momento para restringir aún más el acceso, y el motivo no es contradictorio.
No hay personas reales en las páginas de detalle de ropa de mujer: los modelos de IA llevan la confianza del comercio electrónico al borde del abismo
Las imágenes no son fiables, así que sube la tasa de devoluciones; sube la tasa de devoluciones, así que los vendedores recortan aún más el coste de producción fotográfica; y recortar costes hace que las imágenes sean todavía menos fiables. Este círculo no es un problema técnico: es una estructura de incentivos rota.