Seis jornais processam Microsoft e OpenAI por artigos com paywall no conjunto de treinamento

Em 2 de outubro, seis empresas de publicação entraram com ação contra a Microsoft e dez entidades da OpenAI no Tribunal Distrital dos Estados Unidos para o Distrito Sul do Mississippi. A petição inicial alega violação de direitos autorais e remoção de informações de gestão de direitos autorais no desenvolvimento dos modelos GPT.
Os autores incluem Emmerich Newspapers, Ojai Media e várias empresas Coopwood, que publicam jornais e revistas em todo o Sul. Os réus são a Microsoft e um conjunto de entidades interligadas da OpenAI. O caso foi atribuído ao juiz Henry Travillion Wingate, com o andamento processual atualizado pela última vez em 5 de outubro.
O que a petição inicial realmente alega
Três alegações carregam o peso.
Primeiro, a petição afirma que os réus rastrearam sistematicamente os sites dos autores, incluindo conteúdo atrás de paywalls, e copiaram artigos para seus servidores repetidamente à medida que os modelos eram atualizados. A cópia repetida é a parte juridicamente relevante. Um único rastreamento é um ato. Recopiar o corpus a cada execução de treinamento multiplica o número de cópias supostamente infratoras, o que multiplica a exposição.
Segundo, os autores argumentam que os modelos exibem memorização, codificando cópias recuperáveis das obras de treinamento. Essa alegação se conecta a um conjunto de litígios em que a questão não é se o treinamento aconteceu, mas se o modelo resultante consegue reproduzir expressão protegida sob demanda.
Terceiro, a petição alega que produtos como ChatGPT Search e Deep Research recuperam conteúdo dos sites dos autores em tempo real, incorporando-o às respostas. Essa é a camada de recuperação, separada do treinamento. Mesmo um modelo treinado com dados licenciados pode, no momento da resposta, extrair texto de um site que não tinha licença para ler.
Os autores também argumentam que os réus removeram créditos de autoria, nomes de publicações, avisos de direitos autorais e informações de termos de uso dos artigos. Isso se enquadra na teoria das informações de gestão de direitos autorais, que não exige provar que a cópia subjacente era ilegal. Remover um aviso de direitos autorais de uma obra referenciada é uma violação por si só pela lei dos EUA.
As três causas de pedir são violação direta de direitos autorais, remoção de informações de gestão de direitos autorais e furto doloso dos artigos.
Por que o detalhe do paywall importa
A alegação sobre paywall é a parte mais incisiva da petição, e é um detalhe que vale separar da questão geral de saber se o treinamento com texto protegido por direitos autorais constitui uso justo.
Conteúdo atrás de um paywall fica fora da web aberta. Ele é publicado sob termos que condicionam o acesso, muitas vezes ao pagamento, e os termos normalmente proíbem coleta automatizada. Um rastreamento que ultrapassa um paywall contorna a própria condição de acesso, em vez de cometer um erro sobre quais páginas eram públicas.
Esse enquadramento está alinhado com uma mudança mais ampla na forma como os detentores de dados litigam. A disputa está se deslocando de se a cópia é protegida para se o método de coleta respeitou as condições de acesso estabelecidas pelo editor. Termos contratuais e de acesso estão fazendo um trabalho que os direitos autorais sozinhos não conseguiram fazer.

Onde isso se encaixa no padrão mais amplo
Este caso se junta a um denso conjunto de litígios sobre direitos autorais e acesso. As reivindicações contratuais do Reddit contra a Anthropic estão em andamento, dando às plataformas uma via para contestar a coleta de dados fora da lei de direitos autorais. A Anthropic, em sua manifestação ao parlamento da Austrália, propôs uma “forma restrita de aprovação condicional” para treinamento que permitiria aos detentores de direitos optar por não participar por meio do robots.txt, mecanismo que as emissoras públicas australianas rejeitaram por ser rotineiramente burlado.
Nesses casos, os mesmos fatos técnicos continuam aparecendo. Sinais de robots.txt foram ignorados por grandes rastreadores em testes documentados. Conteúdo com paywall parece ter sido coletado. Recursos de recuperação exibem texto de editoras nas respostas mesmo quando a editora nunca o licenciou.
Os veículos aqui são empresas regionais e locais cujos arquivos têm valor real e cujos orçamentos jurídicos são modestos. É exatamente por isso que vale a pena acompanhar o caso. Uma vitória de grandes editoras com grandes equipes jurídicas testa a lei. Um caso movido por jornais regionais testa se as medidas reparatórias são utilizáveis pelos detentores de direitos que não podem arcar com anos de produção de provas.
O que uma decisão pode mudar
O resultado dependerá de questões em torno das quais os tribunais vêm circulando há dois anos sem resolvê-las. O treinamento com texto protegido por direitos autorais constitui uso justo, e a resposta muda quando o texto estava atrás de um paywall? A memorização transforma um uso de treinamento em reprodução infratora? A recuperação em tempo real cria responsabilidade separada do treinamento? E remover avisos de direitos autorais de obras que aparecem em um conjunto de dados conta como violação mesmo se a cópia em si for permitida?
Nenhuma delas está resolvida. O que a petição faz é vincular todas as quatro questões a um único conjunto de fatos e colocá-las diante de um tribunal distrital. Para qualquer pessoa que construa produtos sobre conteúdo público da web, essa combinação é o que deve ser acompanhado. As respostas não chegarão rapidamente, e a prática atual do setor de rastrear primeiro e negociar depois é exatamente o que esta ação judicial está testando.
Por que editoras regionais trazem um caso diferente
A identidade dos autores molda o litígio de maneiras que os casos de grandes editoras dos últimos anos não moldaram.
O caso do New York Times, e os processos da indústria musical anteriores a ele, baseavam-se em arquivos corporativos com décadas de receita de licenciamento comercial a indicar. Eles podiam argumentar que existia um mercado e que ele foi deslocado. Um grupo de jornais regionais traz uma postura probatória diferente. Seus arquivos são menores, seu histórico de licenciamento é mais frágil, e sua alegação se baseia mais diretamente na própria cópia e na remoção de informações de direitos autorais.
Isso importa para a reparação. Se os autores vencerem na causa de pedir sobre informações de gestão de direitos autorais, a reparação está disponível mesmo quando a cópia subjacente é contestada, porque remover um aviso é uma violação autônoma. Para um autor sem longo histórico de licenciamento, essa causa de pedir é o caminho mais viável.
A camada de recuperação como exposição separada
A alegação sobre o ChatGPT Search e o Deep Research vale ser separada da questão do treinamento, porque aponta para um tipo diferente de responsabilidade.
O treinamento é um ato único, por mais vezes que o corpus seja reconstruído. A recuperação acontece a cada consulta, no momento em que o usuário pergunta. Se um produto recupera texto do site de uma editora em tempo real e o incorpora a uma resposta, o ato supostamente infrator é contínuo e acionado pelo usuário.
Essa distinção dá aos autores uma reivindicação que não depende de vencer o argumento de uso justo sobre treinamento. Mesmo um modelo treinado inteiramente com dados licenciados pode, por meio de um recurso de recuperação, exibir texto de uma fonte que nunca licenciou. O enquadramento da petição trata a recuperação e o treinamento como dois ilícitos separados, o que é uma estrutura mais forte do que vincular tudo ao corpus de treinamento.
O que as editoras estão observando
Dois sinais dirão ao setor se vale a pena mover esse tipo de caso em escala.
O primeiro é se o tribunal permite que a alegação sobre informações de gestão de direitos autorais sobreviva a um pedido de extinção. Essa causa de pedir não exige resolver a questão do uso justo, então uma decisão favorável aos autores sobre ela daria às editoras uma via mais rápida para obter reparação do que um julgamento completo por violação.
O segundo é se a produção de provas alcança o pipeline de treinamento. Se os autores conseguirem obrigar a apresentação de registros sobre o que foi rastreado e quando, o caso muda de um argumento jurídico sobre uso justo para um argumento factual sobre o que o rastreador realmente fez, incluindo se ultrapassou paywalls. Profissionais do lado editorial estão acompanhando o andamento processual exatamente em busca desse tipo de ordem, porque ela lhes diria quais provas são obteníveis antes de se comprometerem com suas próprias ações.
Artigos relacionados
Índia está escrevendo suas próprias regras de segurança de IA e se recusa a copiar as de Washington
Testar apenas em inglês produziria um arcabouço que não certifica nada sobre a maioria das implantações que alega cobrir.
Tavus Griffin passou por humano em 48% das vezes, e a empresa não vai lançá-lo
Uma falsificação pré-gravada responde apenas a perguntas preparadas. Um sistema em tempo real responde a qualquer coisa que lhe perguntem.
Anthropic encontrou 129.000 vulnerabilidades e depois apertou o cerco
A empresa, no auge de uma demonstração de segurança, escolheu esse momento para restringir ainda mais o acesso, e o motivo não é contraditório.
Não há pessoas reais nas páginas de produto de moda feminina: os modelos de IA empurraram a confiança no e-commerce para a beira do abismo
As imagens não são fiáveis, por isso a taxa de devolução sobe; a taxa de devolução sobe, por isso os lojistas comprimem ainda mais os custos de produção fotográfica; e a compressão de custos torna as imagens ainda menos fiáveis. Este círculo não é um problema técnico: é uma estrutura de incentivos corrompida.