ByteDance não conseguiu se livrar de processo sobre como obteve os vídeos

Um grupo de YouTubers processou a ByteDance, alegando que a empresa raspara milhões de vídeos para treinar seu modelo de texto para vídeo. A ByteDance pediu a um tribunal federal da Califórnia que arquivasse o caso. Em 2 de outubro, a juíza Jacqueline Scott Corley negou o pedido.
A decisão gira em torno de um dispositivo da lei de direitos autorais que vinha ficando à margem do debate sobre treinamento de IA. Todos vêm discutindo o fair use, que é a seção 107. Os YouTubers discutem a seção 1201, que proíbe contornar medidas técnicas que controlam o acesso a uma obra protegida por direitos autorais.
Esse é um caso diferente, e a defesa da ByteDance depende dessa diferença.
O argumento apresentado pela ByteDance
A posição da empresa era que as medidas de proteção do YouTube regulam o download, não o acesso. Os vídeos em questão são públicos. Qualquer pessoa pode assisti-los. Se o conteúdo já está disponível para todos, argumentou a ByteDance, uma medida que retarda o download em massa não é um controle de acesso no sentido que a lei atribui ao termo, e a seção 1201 não se aplica.
A juíza Corley rejeitou o argumento. Ela entendeu que as salvaguardas do YouTube que a ByteDance teria contornado são o tipo de controle de acesso cuja burla o DMCA proíbe. O que a plataforma restringia, em sua leitura, era a forma e o volume do acesso, e isso conta.
A distinção que ela traçou é a que importa daqui em diante. Um paywall é um controle de acesso. Um login também. E, ao que parece, também é um limitador de taxa (rate limiter) ou uma medida anti-bot que protege conteúdo que, de outra forma, é livre para visualização. A lei não exige que a obra seja secreta.
Por que isso é um problema para o pipeline de treinamento
O efeito prático é que um método de coleta de dados pode ser ilícito mesmo quando os próprios dados foram publicados publicamente.
Se um tribunal concordar com essa leitura, a questão de conformidade para quem treina modelos muda. Já não se trata apenas de "eu tinha o direito de aprender com esta obra?". Passa a ser também "eu obtive a obra de uma forma que a plataforma permitia?". São perguntas separadas, com respostas separadas, e uma empresa pode estar certa na primeira e errada na segunda.
A segunda pergunta também é mais fácil de litigar para um autor. O fair use exige uma análise de quatro fatores — finalidade, natureza, quantidade e efeito de mercado — e as respostas são contestáveis. Se um scraper burlou uma medida técnica está mais próximo de uma determinação factual. Ou a ferramenta contornou o controle, ou não.

A seção 1201 ronda casos de IA há algum tempo
Não é a primeira vez que esse dispositivo aparece em uma disputa sobre treinamento, e os casos anteriores seguiram o caminho oposto.
Em Doe v. GitHub, desenvolvedores argumentaram que o Copilot reproduziu seu código sem licença, e o tratamento dado pelo tribunal à alegação baseada na seção 1202, que abrange a remoção de informações de gestão de direitos autorais, foi mais restrito do que os autores esperavam. No caso Roblox, um artista chamado Austin Beaulier processou por causa da remoção de tags NoAI de modelos 3D usados em um conjunto de dados de treinamento. A juíza Beth Labson Freeman também arquivou o caso em 2 de outubro, entendendo que a tag NoAI de fato conta como informação de gestão de conteúdo, mas que o autor não demonstrou que a Roblox a removeu intencionalmente.
Ambos tratam da seção 1202, que diz respeito a informações anexadas a uma obra. O caso da ByteDance trata da seção 1201, que diz respeito ao portão à sua frente. O arquivamento do caso Roblox e a sobrevivência do caso ByteDance no mesmo dia tornam a divisão visível: uma alegação sobre metadados que foram descartados é difícil de provar, e uma alegação sobre um portão que foi contornado é mais fácil.
O panorama do fair use também não está definido
Na mesma semana, veio a decisão não censurada em Thomson Reuters v. ROSS Intelligence, na qual o Terceiro Circuito decidiu que treinar uma ferramenta de pesquisa jurídica com as headnotes da Westlaw não era fair use. Esse caso trata da seção 107 e não envolve nenhuma medida técnica. A ROSS copiou resumos editoriais e os usou para construir um produto concorrente.
As três decisões, em conjunto, descrevem um cenário em que a exposição jurídica de um pipeline de treinamento de IA depende da mecânica, e não de princípios. Como os dados foram obtidos, se os metadados sobreviveram ao pipeline e se o resultado competiu com a fonte — cada um desses pontos tem sua própria regra.
Para uma empresa que coleta dados de treinamento em escala, a consequência operacional é que a camada de coleta agora é uma superfície de conformidade por si só. Registrar como um crawler se comportou, respeitar limites de taxa e diretivas robots e recusar-se a construir contornos às defesas das plataformas deixaram de ser gentilezas. Agora elas decidem se um caso pode ser arquivado na fase de alegações (pleading stage).
Por que o interesse da plataforma importa tanto quanto o do criador
Uma alegação baseada na seção 1201 pertence tanto a quem construiu o portão quanto a quem tem sua obra atrás dele.
As medidas de proteção do YouTube existem porque a plataforma tem interesse próprio em controlar como seu catálogo é acessado. O download em massa é caro para um serviço que entrega vídeo em escala, e o scraping tem consequências para a largura de banda, para a medição publicitária e para os acordos de licenciamento que a plataforma negocia com detentores de direitos. Uma decisão que trata essas medidas como controles de acesso entrega às plataformas uma ferramenta jurídica contra a coleta automatizada de qualquer tipo — e elas não tinham uma antes.
Isso vai além do treinamento de IA. Abrange monitoramento de preços, conjuntos de dados de pesquisa acadêmica, análise competitiva e qualquer outra coisa que leia um site em volume. O dispositivo contra a burla de medidas técnicas é décadas anterior a tudo isso, e agora se pede que ele governe uma categoria de atividade que seus redatores não imaginaram.
Para os detentores de direitos, a consequência é um segundo caminho para o tribunal. Um criador que não consegue vencer uma discussão de fair use contra quem treina modelos ainda pode ter uma alegação sobre como a obra foi obtida, e essa alegação não exige provar dano econômico da mesma forma. Ela exige provar que uma medida técnica foi burlada.
Para onde a produção de provas (discovery) deve caminhar
Se o caso sobreviver até a fase de produção de provas, o material interessante será operacional, não jurídico. Quais ferramentas de rastreamento foram usadas, se estavam configuradas para respeitar as diretivas da plataforma, quantas solicitações foram feitas e em que período, e o que os próprios engenheiros da empresa escreveram sobre os riscos na época.
Documentos internos têm determinado o resultado de vários casos recentes de IA, e um pipeline de treinamento na escala da ByteDance deixa um rastro substancial. A questão de saber se alguém sinalizou a exposição jurídica antes de o scraping começar é a que costuma definir o valor de um acordo.
O que vem a seguir
A decisão não determina se a ByteDance infringiu direitos. Ela mantém o caso vivo na fase de alegações, o que significa que os YouTubers terão acesso à produção de provas. É aí que os detalhes se tornam públicos: quais vídeos, quais ferramentas, quais medidas foram burladas e quantas vezes.
O caminho mais provável é um acordo antes do julgamento. Processos com esse formato costumam terminar assim, e a ByteDance não tem interesse em um registro público de como um pipeline de treinamento operava. Mas a questão jurídica agora está no sistema, e a resposta moldará como todo scraper futuro enfrenta as defesas de uma plataforma.
Há um ponto mais amplo. O problema de dados da indústria de IA tem sido tratado como um problema de licenciamento: pague ao detentor dos direitos e tudo se resolve. Essa linha de casos sugere que pagar não é suficiente, porque a plataforma que hospeda a obra tem interesses próprios, codificados em medidas técnicas e amparados por uma lei que não se importa se a obra era de leitura gratuita. Obter o conteúdo legalmente e obtê-lo de forma limpa são duas obrigações distintas agora.
Artigos relacionados
Fundadores de uma empresa de energia renovável acabaram de encomendar 20.000 GPUs Nvidia Rubin
A encomenda de chips é a parte fácil. As estruturas de financiamento por baixo dela são onde está o risco.
A Casa Branca entregou a política de IA ao seu chefe de inteligência, e a fiscalização está vindo de outro lugar
A agenda de IA do governo federal está sendo definida em pelo menos dois lugares ao mesmo tempo, e os dois não estão obviamente alinhados.
Austrália ordenou que todas as agências federais auditassem seus sistemas legados após a violação do Medicare
A auditoria vai revelar a exposição. Financiar a correção é um exercício separado, com um orçamento separado.
Um tribunal de Wuhan incluiu custos de computação de IA em uma decisão de direitos autorais e estabeleceu um novo tipo de precedente
O valor é pequeno. O método trata uma fatura de API como evidência do que custou fazer a obra.