Thomson Reuters v. Ross: el primer fallo de apelación sobre el entrenamiento de IA y el uso justo

Durante tres años, la batalla legal sobre si se pueden entrenar modelos de IA con material protegido por derechos de autor se ha resuelto en su mayoría mediante acuerdos o se ha estancado en el nivel de distrito. En septiembre, el Tribunal de Apelaciones del Tercer Circuito de EE. UU. cambió eso. Su decisión en Thomson Reuters v. Ross Intelligence es el primer fallo de apelación federal que sostiene que usar material protegido por derechos de autor para entrenar una herramienta comercial de IA competidora no califica como uso justo.
La jueza Tamika Montgomery-Reeves confirmó la conclusión del tribunal inferior de febrero de 2025 de que Ross Intelligence infringió 2.243 headnotes de Thomson Reuters —resúmenes breves de puntos jurídicos escritos por editores— al entrenar con ellos un producto competidor de búsqueda legal. El aval de la apelación importa porque eleva el razonamiento de la opinión de un solo juez a precedente vinculante para un circuito federal, el tipo de cosa con la que otros tribunales ahora tienen que lidiar.
Qué decidió realmente el caso
La conclusión limitada se refiere a un tipo específico de sistema. Ross creó una herramienta de investigación jurídica destinada a competir directamente con el producto cuyo contenido usó para entrenar. El tribunal determinó que este uso no superó el test de uso justo, en gran medida porque el resultado competía en el mismo mercado que el original.
El razonamiento se apoya en la sustitución de mercado. Cuando el propósito del entrenamiento es producir algo que reemplace la fuente, el cuarto factor del uso justo —el efecto sobre el mercado potencial del original— pesa mucho en contra del usuario. El tribunal no se convenció de que la copia intermedia involucrada en el entrenamiento fuera lo suficientemente transformadora como para superar eso.
Vale la pena ser precisos sobre lo que esto cubre y lo que no. Ross no era, en el sentido pertinente, un modelo generativo que producía expresión original. Era un producto de búsqueda y recuperación que reproducía y reutilizaba resúmenes protegidos por derechos de autor. El tribunal trazó esa distinción de manera explícita, dejando espacio para que la IA generativa argumente una protección más amplia de uso justo sobre la base de que genera contenido nuevo en lugar de reproducir contenido existente.
Esa excepción es generosa en apariencia y menos reconfortante en la práctica. Significa que el fallo de apelación no resuelve la pregunta que la industria de la imagen y el video más quiere que se responda: si entrenar un modelo de difusión con miles de millones de imágenes y videos protegidos por derechos de autor constituye uso justo. Deja esa pregunta para casos futuros, y significa que la respuesta puede variar según el tipo de modelo.
La cuestión de la IA generativa sigue abierta
La batalla paralela del lado generativo ha ido pasando por distintos tribunales, y no se ha resuelto a favor de la industria. El dato más comentado es el acuerdo en Bartz v. Anthropic, en junio de 2025, que resolvió una demanda colectiva sobre datos de entrenamiento por una cifra reportada de 1500 millones de dólares. Un acuerdo no es un fallo, pero el tamaño de la cifra indica cómo evaluaron sus probabilidades los abogados de la defensa.
Junto con el fallo de apelación, un caso separado sobre el entrenamiento de imágenes con IA llegó a juicio con jurado en San Francisco, lo que lo convierte en el primer asunto de este tipo que llega a un jurado en lugar de resolverse mediante un acuerdo. Un veredicto allí daría a la industria algo que ninguna de las partes ha tenido aún: una determinación de hecho sobre si entrenar modelos de imágenes con la obra de artistas infringe, decidida por personas y no por un juez.
Leídos en conjunto, el fallo de Ross y los casos en curso apuntan en una sola dirección. Los tribunales son cada vez menos propensos a tratar «entrenamos un modelo con eso» como una defensa automática, y están separando el análisis según cuán directamente compita el producto resultante con la fuente. Cuanto más directamente sustituya un sistema el contenido del que aprendió, más débil se vuelve el argumento de uso justo.
Por qué esto trasciende la tecnología jurídica
Es tentador archivar Ross en una categoría estrecha, la investigación jurídica, y seguir adelante. Sería un error para cualquiera que use IA para producir contenido comercial, y la razón es la lógica de sustitución de mercado.
Consideremos el caso ordinario de una herramienta de IA que escribe descripciones de productos. Si se entrenó con los textos de catálogo de un minorista y luego se usó para generar textos de catálogo competidores, el razonamiento de Ross se aplica con una franqueza incómoda. Lo mismo cabe decir de un modelo de imágenes entrenado con las fotos de producto de una marca, cuando ese modelo ayuda a un competidor a vender más barato que ella, o de una herramienta de redacción publicitaria alimentada con los artículos de una publicación y usada para generar contenido que atrae a los mismos lectores.
La exposición práctica no se limita a los desarrolladores de modelos. Las empresas que despliegan herramientas de IA heredan el riesgo de cómo se construyeron esas herramientas, y a menudo falta el rastro de auditoría. Los vendedores que trabajan con modelos gratuitos entrenados con datos sin licencia son los más expuestos, porque no pueden demostrar la procedencia aunque quisieran. Los equipos que obtienen modelos entrenados con datos con licencia o propios pueden documentar esa elección, lo que es una posición defendible en una disputa y, cada vez más, un requisito impuesto por socios y plataformas.
El costo de cumplimiento de este cambio es real y desigual. Los actores más grandes pueden negociar licencias y construir conjuntos de datos con licencia; los más pequeños no pueden, y enfrentan una elección entre pagar por herramientas con licencia, generar contenido original a mano o asumir un riesgo que quizá no puedan cuantificar. Es probable que las plataformas cubran parte de esa brecha por sí mismas, escaneando el contenido subido en busca de señales de material generado por IA sin licencia, tal como ya escanean en busca de falsificaciones.
La ambigüedad práctica merece decirse con claridad. El fallo de Ross cubre un producto de recuperación, no un modelo de difusión, así que nadie debería leerlo como un veredicto sobre el entrenamiento de imágenes o video. Lo que sí establece es un método de análisis que se aplicará de forma más amplia: tribunales que preguntan cuán directamente compite el resultado del sistema entrenado con el material del que aprendió. Esa pregunta tiene una respuesta incómoda para muchos productos comerciales de IA, y no depende de si el modelo es generativo.
La consecuencia a corto plazo es que la procedencia se está convirtiendo en una característica del producto. Las herramientas que pueden mostrar de dónde provienen sus datos de entrenamiento, o que se construyeron solo con contenido que el cliente ya posee, conllevan menos riesgo y pueden cobrar por eso. Las herramientas que no pueden harán deriva hacia clientes que o no saben preguntar o no pueden darse el lujo de que les importe.
El estado de la cuestión
Lo que existe ahora es un conjunto de indicios más que una regla asentada. Entrenar con material protegido por derechos de autor para construir un producto comercial directamente competidor no es uso justo, al menos en el Tercer Circuito. Los modelos generativos tienen más margen para argumentar, y ese margen no se ha puesto a prueba hasta un veredicto de jurado. Los acuerdos han puesto precio al riesgo en cifras que llaman la atención en las salas de juntas.
Para cualquiera que construya productos sobre IA, la respuesta sensata es dejar de esperar a que la ley se cristalice. Sepa de dónde provienen los datos de entrenamiento, conserve ese registro, prefiera modelos que puedan documentar su procedencia y trate la fuente de los pesos de un modelo como una cuestión de cadena de suministro, no como una nota al pie legal. La dirección de viaje es clara aunque el destino no lo sea, y las organizaciones que puedan responder hoy a la pregunta sobre la procedencia gastarán mucha menos energía en responderla bajo una fecha límite más adelante.
Artículos relacionados
La marca de agua no sigue el ritmo de lo falso
Los sistemas funcionan. La cobertura, no. La brecha la está llenando lo que la audiencia asume.
Tu agente de IA ahora llama al servicio de atención al cliente, y las empresas tienen que responder
Una voz perfecta en una solicitud no autorizada es peor que una voz torpe en una verificada.
Reddit cierra su última puerta abierta y culpa a los scrapers
Un scraper que Reddit no ha licenciado es abuso. Un scraper que Reddit ha licenciado es ingresos.
El Banco de Inglaterra acaba de incorporar la deuda de la IA a la estabilidad financiera
Un auge financiado con beneficios retenidos puede deshacerse en privado. Este funciona con 450.000 millones de dólares de deuda nueva.