Thomson Reuters v. Ross: A Primeira Decisão de Apelação sobre Treinamento de IA e Uso Justo

Durante três anos, a disputa jurídica sobre se modelos de IA podem ser treinados com material protegido por direitos autorais, na maior parte das vezes, ou terminou em acordos ou ficou estagnada na esfera dos tribunais de primeira instância. Em setembro, o Tribunal de Apelações do Terceiro Circuito dos Estados Unidos mudou isso. Sua decisão em Thomson Reuters v. Ross Intelligence é a primeira decisão de um tribunal federal de apelação a determinar que o uso de material protegido por direitos autorais para treinar uma ferramenta comercial de IA concorrente não se qualifica como uso justo.
A juíza Tamika Montgomery-Reeves confirmou a conclusão do tribunal inferior, de fevereiro de 2025, de que a Ross Intelligence violou 2.243 notas de cabeçalho da Thomson Reuters, resumos curtos de teses jurídicas escritos por editores, ao treinar com elas um produto concorrente de busca jurídica. O selo da apelação importa porque eleva o raciocínio da opinião de um único juiz à condição de precedente vinculante para um circuito federal, o tipo de coisa com que outros tribunais agora precisam lidar.
O que o caso realmente decidiu
A conclusão restrita diz respeito a um tipo específico de sistema. A Ross criou uma ferramenta de pesquisa jurídica destinada a competir diretamente com o produto cujo conteúdo serviu de base para seu treinamento. O tribunal considerou que esse uso não passou no teste de uso justo, em grande parte porque o resultado competia no mesmo mercado que o original.
O raciocínio se apoia na substituição de mercado. Quando a finalidade do treinamento é produzir algo que substitui a fonte, o quarto fator do uso justo, o efeito sobre o mercado potencial do original, pesa fortemente contra o usuário. O tribunal não se convenceu de que a cópia intermediária envolvida no treinamento fosse suficientemente transformativa para superar isso.
Vale ser preciso quanto ao que isso abrange e ao que não abrange. A Ross não era, no sentido relevante, um modelo generativo que produz expressão original. Era um produto de busca e recuperação que reproduzia e reaproveitava resumos protegidos por direitos autorais. O tribunal traçou essa distinção explicitamente, deixando espaço para que a IA generativa defenda uma proteção mais ampla de uso justo, com o argumento de que gera conteúdo novo em vez de reproduzir conteúdo existente.
Essa ressalva é generosa na aparência e menos reconfortante na prática. Significa que a decisão de apelação não resolve a questão que o setor de imagens e vídeos mais quer ver respondida: se treinar um modelo de difusão com bilhões de imagens e vídeos protegidos por direitos autorais é uso justo. Ela deixa essa questão para casos futuros e indica que a resposta pode variar conforme o tipo de modelo.
A questão da IA generativa continua em aberto
A disputa paralela no campo generativo vem tramitando em outros tribunais e não foi resolvida em favor do setor. O dado mais comentado é o acordo em Bartz v. Anthropic, em junho de 2025, que resolveu uma ação coletiva sobre dados de treinamento por um valor reportado de US$ 1,5 bilhão. Um acordo não é uma decisão judicial, mas o tamanho do número revela como os advogados da defesa avaliaram suas chances.
Paralelamente à decisão de apelação, um caso separado sobre treinamento de modelos de imagem foi a julgamento por júri em São Francisco, tornando-se o primeiro assunto do tipo a chegar a um júri em vez de ser resolvido por acordo. Um veredito ali daria ao setor algo que nenhuma parte teve até agora: uma determinação factual, decidida por pessoas e não por um juiz, sobre se treinar modelos de imagem com a obra de artistas infringe direitos autorais.
Lidos em conjunto, a decisão da Ross e os casos em andamento apontam numa única direção. Os tribunais estão cada vez menos dispostos a tratar "treinamos um modelo com isso" como defesa automática, e estão separando a análise conforme o grau de concorrência do produto resultante com a fonte. Quanto mais diretamente um sistema substitui o conteúdo do qual aprendeu, mais fraca se torna a argumentação de uso justo.
Por que isso vai além da tecnologia jurídica
É tentador arquivar o caso Ross numa categoria estreita, a pesquisa jurídica, e seguir adiante. Isso seria um erro para quem usa IA para produzir conteúdo comercial, e o motivo é a lógica de substituição de mercado.
Considere o caso comum de uma ferramenta de IA que escreve descrições de produtos. Se ela foi treinada com os textos de catálogo de um varejista e depois usada para gerar textos de catálogo concorrentes, o raciocínio de Ross se aplica com desconfortável diretidade. O mesmo vale para um modelo de imagem treinado com as fotos de produtos da marca que ele ajuda um concorrente a vender mais barato, ou para uma ferramenta de redação alimentada com os artigos de uma publicação e usada para gerar conteúdo que atrai os mesmos leitores.
A exposição prática não se limita aos desenvolvedores de modelos. Empresas que implantam ferramentas de IA herdam o risco de como essas ferramentas foram construídas, e a trilha de auditoria muitas vezes está ausente. Vendedores que trabalham com modelos gratuitos treinados com dados não licenciados são os mais expostos, porque não conseguem demonstrar a procedência mesmo que quisessem. Equipes que obtêm modelos treinados com dados licenciados ou próprios podem documentar essa escolha, o que é uma posição defensável numa disputa e, cada vez mais, uma exigência imposta por parceiros e plataformas.
O custo de conformidade dessa mudança é real e é desigual. Os agentes maiores podem negociar licenças e construir conjuntos de dados licenciados; os menores não podem, e enfrentam a escolha entre pagar por ferramentas licenciadas, gerar conteúdo original manualmente ou assumir um risco que talvez não consigam quantificar. É provável que as plataformas preencham parte dessa lacuna por conta própria, escaneando o conteúdo enviado em busca de sinais de material gerado por IA sem licença, da mesma forma que já fazem com falsificações.
A ambiguidade prática merece ser dita com clareza. A decisão da Ross abrange um produto de recuperação, não um modelo de difusão, então ninguém deve lê-la como um veredito sobre treinamento de imagens ou vídeos. O que ela estabelece é um método de análise que será aplicado de forma mais ampla: tribunais perguntando quão diretamente o resultado do sistema treinado compete com o material do qual ele aprendeu. Essa pergunta tem uma resposta desconfortável para muitos produtos comerciais de IA, e ela não depende de o modelo ser generativo.
A consequência de curto prazo é que a procedência está se tornando uma característica do produto. Ferramentas que conseguem mostrar de onde vieram seus dados de treinamento, ou que foram construídas apenas com conteúdo que o cliente já possui, carregam menos risco e podem cobrar por isso. Ferramentas que não conseguem vão migrar para clientes que ou não sabem perguntar ou não podem se dar ao luxo de se importar.
O estado atual das coisas
O que existe agora é um conjunto de marcos, e não uma regra consolidada. Treinar com material protegido por direitos autorais para construir um produto comercial diretamente concorrente não é uso justo, ao menos no Terceiro Circuito. Modelos generativos têm mais espaço para argumentar, e esse espaço ainda não foi testado por um veredito de júri. Acordos precificaram o risco em valores que chamam atenção nas salas de conselho.
Para quem constrói produtos sobre IA, a resposta sensata é parar de esperar que a lei se cristalize. Saiba de onde vieram os dados de treinamento, mantenha esse registro, prefira modelos que consigam documentar sua procedência e trate a origem dos pesos de um modelo como uma questão de cadeia de suprimentos, não como uma nota de rodapé jurídica. A direção é clara mesmo que o destino não seja, e as organizações capazes de responder à pergunta da procedência hoje gastarão muito menos energia respondendo a ela sob um prazo depois.
Artigos relacionados
Claude Sonnet 5.5 é 30% mais barato. Isso é uma história de compras, não uma história de modelo.
Alegações de desconto de fornecedores costumam ser medidas em relação a uma carga de trabalho representativa, e a sua não é representativa.
A HPE acabou de vender US$ 1,2 bilhão em hardware porque a rede virou o ponto central
Um pedido de US$ 1,2 bilhão com divisão não divulgada entre cinco categorias não é o mesmo que US$ 1,2 bilhão de margem.
O malware que submete seu próximo passo a uma votação de quatro modelos
A infraestrutura de comando e controle é um punhado de APIs públicas e um webhook do Discord.
A Shopify deixou agentes de IA clicar em Comprar. O lojista ainda arca com a disputa.
A plataforma do agente intermedeia a intenção. O lojista carrega o risco.