A Meta fechou o acordo do processo dos livros. A permissão agora tem um preço.

A Meta concordou em encerrar a ação coletiva que a acusava de treinar seus modelos Llama com livros pirateados. O acordo proposto foi protocolado em tribunal federal no final de setembro, e a notificação foi enviada aos detentores de direitos dias depois. Os termos financeiros estão sob sigilo até que um juiz os aprove, e a Meta continua dizendo publicamente que suas práticas de treinamento se enquadram no fair use. O que o acordo não diz é tão revelador quanto o que ele diz.
O caso girava em torno do lado da aquisição, e não do treinamento. Os autores alegavam que os modelos Llama foram treinados com obras retiradas de bibliotecas-sombra como a LibGen entre 2018 e 2024. Esse detalhe importa porque uma decisão separada já havia traçado uma linha no meio desse problema. No caso Anthropic, o juiz William Alsup concluiu que treinar um modelo com livros protegidos por direitos autorais é legal, mas manter uma biblioteca de cópias pirateadas não é. A penalidade naquele caso, um acordo de US$ 1,5 bilhão, estava ligada à forma como os livros foram obtidos, não ao aprendizado em si.
Lidos em conjunto, os dois resultados descrevem uma regra fácil de enunciar e difícil de seguir na prática. Aprender com um livro que você adquiriu legalmente é permitido. Montar um corpus com cópias pirateadas não é. O valor de US$ 1,5 bilhão equivale a cerca de US$ 3.000 por obra, o que dá a cada laboratório uma forma de precificar sua própria exposição. Se você raspou um corpus de um site pirata, agora tem um número aproximado do que essa decisão custa.
O opt-out está sendo substituído por um preço
A mudança mais consequente é o que vem a seguir. Um acordo separado noticiado este mês substituiu o modelo de registro voluntário de opt-out por uma estrutura de taxa de licenciamento obrigatória atrelada à quantidade de dados utilizada. O argumento por trás disso é direto: as portas de saída do opt-out pareciam justas no papel e falharam na prática, porque os desenvolvedores raramente conferiam ou respeitavam as listas de exclusão. Pagar por volume é mais difícil de ignorar.
Isso reformula toda a negociação. No regime de opt-out, a única alavanca do detentor de direitos era dizer não e torcer. Com uma licença precificada, a permissão se torna um item de linha com um número atrelado, e a discussão passa de se as empresas de IA podem usar a obra para quanto devem por ela. Para editoras e autores, essa é uma posição muito melhor do que uma barreira técnica que ninguém fazia cumprir.
O efeito prático para os laboratórios é um novo orçamento de conformidade. A proveniência dos dados deixa de ser uma preferência de engenharia e passa a ser uma exigência legal. Se um único corpus, dentro de um conjunto de dados de vários petabytes, veio de uma fonte que não pode ser documentada, isso introduz uma responsabilidade específica em todo o pipeline de treinamento, e a falha geralmente ocorre na camada de agregação, onde conjuntos de dados de terceiros são combinados sem atribuição clara.
A questão do output continua em aberto
Os dados de treinamento são apenas uma das duas frentes. A outra é o que o modelo produz, e aí o cenário é menos definido. O New York Times sobreviveu ao pedido de arquivamento da OpenAI ao alegar de forma plausível que os outputs do ChatGPT competem com seu jornalismo. Trata-se de uma teoria de substituição de mercado, que opera de forma diferente da teoria de aquisição. Se o modelo aprende com uma obra e não a reproduz, o argumento da transformação se sustenta. Se seu output substitui o original no mercado, o argumento se enfraquece.
Negar um pedido de arquivamento não é uma conclusão de responsabilidade, e o caso do Times ainda está em andamento. Mas as duas teorias juntas explicam por que as empresas de IA agora tratam proveniência e monitoramento de outputs como um único problema. Um modelo treinado com dados licenciados ainda pode gerar algo que compete com a fonte, e os termos de licença dizem cada vez mais o que ele não pode fazer.
O áudio não segue o mesmo caminho
Se as editoras de livros caminham para um mercado de licenciamento, a música caminha para algo mais confuso. A Suno perdeu uma decisão na Alemanha movida pela GEMA, a sociedade de arrecadação de direitos autorais, pelo uso de gravações e composições protegidas. Os casos textuais norte-americanos estão em grande parte se resolvendo em pagamentos e licenças retroativas. Os casos de áudio estão produzindo liminares e disputas de jurisdição, o que, para uma empresa de produtos, é o pior desfecho, porque uma liminar paralisa o serviço em vez de taxá-lo.
A diferença parece estar na proximidade entre o output e o input. Um modelo de linguagem que resume um livro está a um passo do texto. Um modelo de música que gera uma canção no estilo de um artista está perto o suficiente para que a comparação seja imediata, e os tribunais têm sido menos dispostos a estender o argumento da transformação para cobrir isso.
Onde o preço ainda não existe
O parâmetro por obra é, até agora, um fenômeno do texto, e a razão é a infraestrutura. As editoras de livros têm órgãos de licenciamento coletivo, décadas de precedentes sobre direitos de reprodução e uma unidade de troca razoavelmente clara, que é a obra. Isso torna um preço por título fácil de definir e fácil de debater em tribunal.

Imagens, vídeo e código não têm a mesma configuração. Um banco de imagens de stock pode precificar uma licença por imagem, mas uma captura de tela de uma página web contém dezenas de elementos protegidos por direitos autorais ao mesmo tempo, e um repositório de código mistura arquivos licenciados, de licença permissiva e não atribuíveis na mesma árvore. Quando a questão passa do texto para qualquer um desses, a fórmula por obra deixa de se aplicar e o debate volta ao fair use, que é o terreno em que as empresas de IA preferem lutar.
A outra questão em aberto é quem faz a arrecadação. Uma taxa de licenciamento que ninguém administra acaba virando ação coletiva de qualquer forma, e as estruturas de acordo noticiadas este mês ainda descrevem pagamentos negociados caso a caso, e não um mercado permanente com tarifas publicadas. Enquanto as tarifas não forem públicas, toda negociação acontece em privado, com os maiores compradores obtendo as melhores condições. Essa é a forma de um mercado que se formou, mas ainda não amadureceu.
O que isso significa se você constrói sobre esses modelos
A maioria dos desenvolvedores que lê isto não treina modelos de fundação, então a exposição direta é baixa. A exposição indireta não é. Laboratórios que absorvem acordos de oito e nove dígitos repassam o custo, e o mecanismo é o preço da API. Considere que o orçamento para acesso a modelos vai aumentar no próximo ano ou dois, especialmente para modelos treinados com material licenciado, onde a licença em si agora faz parte do custo dos produtos.
Há uma segunda implicação, mais silenciosa, para quem hospeda ou opera cargas de trabalho de IA. Se você armazena conjuntos de dados de treinamento para um cliente, o risco legal agora depende de onde esses arquivos vieram, e não do que o cliente faz com eles. A documentação clara de proveniência deixa de ser custo indireto e passa a ser o que impede uma condenação de oito dígitos de recair sobre um sistema que você opera.
A parte indefinida é até onde o modelo de precificação se espalha. As editoras de texto têm infraestrutura de licenciamento coletivo e um conjunto de casos decididos a que podem se referir. A música tem sociedades, mas uma relação de output diferente. Imagens, vídeo e código têm cada um suas próprias dinâmicas, e nenhum deles tem ainda um parâmetro por obra. O acordo da Meta remove um marco do mapa. Não desenha o resto dele, e os próximos acordos decidirão se a permissão se torna um mercado ou continua sendo uma série de exceções.
Artigos relacionados
O chip de memória agora é o gargalo na computação de IA
O roteiro da lógica é público e previsível. O roteiro da memória é limitado pelos rendimentos de empacotamento, por uma base de talentos que leva anos para se formar e pelos planos de capital de três empresas.
A música de IA obteve uma licença. Veja o que ela realmente cobre.
Faixas baratas ainda existem. O que está desaparecendo é a suposição de que uma faixa gerada a partir de um prompt é livre de reivindicações, o que nunca foi verdade e agora é comprovadamente falso.
Estúdios de Hengdian estão vazios enquanto a cadeia de produção de filmes com IA da Ásia avança
Os palcos vazios de Hengdian são a evidência de que a indústria já fez sua aposta, quer o público concorde ou não.
Google comprou 890 megawatts de energia nuclear para alimentar seus data centers
A capacidade de computação está disponível. A eletricidade é o que precisa ser organizado, com anos de antecedência, como se organiza uma cadeia de suprimentos.