← Voltar ao blog
Newscerca de 8 min de leitura

robots.txt é uma parede de papel: Reddit vs. Anthropic e a audiência de conformidade da Austrália

Publicado 7 de out. de 2026
robots.txt é uma parede de papel: Reddit vs. Anthropic e a audiência de conformidade da Austrália

Todo site tem um pequeno arquivo de texto chamado robots.txt. Ele diz a programas automatizados quais páginas podem ler e quais devem deixar em paz. É uma placa educada colada em uma porta destrancada. A placa não tem fechadura atrás dela.

Essa lacuna entre uma solicitação e um mecanismo de fiscalização agora está no centro de duas disputas separadas, uma em um tribunal dos EUA e outra em uma audiência parlamentar australiana. Ambas fazem a mesma pergunta sob ângulos diferentes: o que um sinal de "não rastrear" realmente significa quando é ignorado?

Austrália: a opção de exclusão que não consegue excluir

A Anthropic compareceu diante da Comissão Parlamentar Mista sobre Inteligência Artificial da Austrália no início de outubro. Ela havia proposto o que chamou de "forma restrita de aprovação condicional" para treinamento de IA em conteúdo local, com titulares de direitos optando por não participar ao bloquear crawlers no robots.txt. A manifestação aceitava implicitamente a rejeição da Austrália a uma ampla isenção de mineração de texto e dados, e oferecia o opt-out como o compromisso.

As emissoras públicas não aceitaram. A diretora de conteúdo e operações jurídicas da ABC, Kate Gilchrist, disse ao comitê que o sistema de direitos autorais é adequado e que as empresas de IA podem negociar as licenças de que precisam. Sua objeção ao opt-out era estrutural. Ela disse que a emissora não pode vasculhar a internet para garantir que tenha feito opt-out em todos os sites relevantes: "Simplesmente não funciona."

A SBS fez o mesmo argumento em sua própria manifestação, escrevendo que sinais de robots.txt são rotineiramente contornados e que o ônus deve recair sobre as empresas de IA para evitar irregularidades.

A assimetria descrita por Gilchrist é o ponto crucial. Titulares de direitos precisam identificar, monitorar e manter sinais de opt-out em todos os canais possíveis de scraping, indefinidamente. As empresas de IA enfrentam custo técnico quase nulo para contornar um sinal e, até que exista um remédio específico, custo jurídico quase nulo também. Um crawler pode ignorar o robots.txt usando um identificador de user-agent diferente, passando por um intermediário ou tendo coletado o conteúdo antes de o bloqueio ser colocado.

Há uma base documentada para a suspeita. A TollBit, uma startup que intermedeia acordos de licenciamento entre editoras e empresas de IA, descobriu que agentes de IA de várias fontes estavam contornando o protocolo robots.txt para recuperar conteúdo. O Business Insider posteriormente relatou que OpenAI e Anthropic contornaram sinais de robots.txt apesar de alegações públicas de que os respeitavam.

A própria posição da ABC carrega uma ironia digna de nota. Em julho de 2026, a emissora selecionou o Claude, da Anthropic, como sua plataforma de IA corporativa, iniciando um piloto com 100 funcionários para converter transmissões de rádio em artigos digitais, enquanto simultaneamente argumentava que os produtos da Anthropic provavelmente foram treinados com seu conteúdo sem permissão. Ambas as coisas podem ser verdadeiras ao mesmo tempo, e é exatamente esse o ponto: cooperação em uma frente não resolve a questão em outra.

Estados Unidos: a via contratual

O caso do Reddit contra a Anthropic segue um caminho jurídico diferente. Um tribunal federal permitiu que as alegações contratuais do Reddit prosseguissem, o que dá às plataformas uma via para contestar a coleta de dados fora da lei de direitos autorais.

Essa distinção importa. O direito autoral pergunta se material protegido foi copiado e se uma defesa se aplica. O contrato pergunta se o coletor aceitou condições relacionadas a acesso, coleta automatizada ou uso comercial. Para plataformas cujo valor está em parte em material que hospedam, mas não possuem integralmente, a teoria contratual é a mais utilizável.

A decisão de reenvio não decidiu que a Anthropic violou o acordo do Reddit. Sua importância mais ampla é mais restrita: o tribunal tratou os direitos contratuais do Reddit como qualitativamente diferentes dos direitos autorais, mantendo viva a teoria de violação de contrato na disputa ativa.

Quando os termos de serviço ganham peso prático, eles se transformam em infraestrutura de governança de dados. Uma empresa precisa provar aviso, concordância, condições de acesso e a versão relevante dos termos no momento da coleta, para além do que uma política declara em sua literalidade. O litígio pode depender de quais termos se aplicavam durante o período de acesso disputado e de como eram exibidos.

Por que o robots.txt nunca ia se sustentar

O arquivo tem uma história invertida. Nos anos 1990, o robots.txt existia principalmente para impedir que mecanismos de busca sobrecarregassem demais um servidor. Sites competiam para serem indexados, porque ser indexado significava visitantes. A relação desde então se inverteu. O mesmo arquivo agora é usado para fechar uma porta, porque as novas máquinas que leem a web não mandam ninguém de volta.

O bloqueio só funciona em crawlers que obedecem ao bloqueio. A proporção de sites de notícias respeitados que bloqueiam programas de IA saltou de cerca de 23% em setembro de 2023 para quase 60% em maio de 2025. Ainda assim, o próprio crawler da OpenAI foi observado ignorando essas notas em 42% das vezes no final de 2024, e testes mais amplos encontraram violações em 72% dos sites empresariais do Reino Unido.

Uma placa só é tão forte quanto o advogado que está atrás dela, e a maioria dos sites não tem o advogado do Reddit.

O que isso significa para quem constrói

Para empresas que constroem sistemas de IA, a lição prática é de diligência. Quando você compra ou coleta dados de treinamento, precisa saber se eles foram reunidos sob condições que conflitam com os termos da plataforma de origem. Isso conecta a proveniência contratual aos sinais de confiança legíveis por máquina que deveriam tornar possível a conformidade automática.

A conclusão desconfortável é que o protocolo voluntário está sendo testado exatamente onde era mais fraco. O Reddit construiu um paywall, enviou um aviso legal, viu as citações de seu conteúdo aumentarem quase 40 vezes nas respostas de um concorrente e então processou. A placa pediu. O portão bloqueou. Apenas o processo judicial ameaça.

Se o robots.txt vai ganhar dentes depende de como a teoria contratual do Reddit se sairá e de se a Austrália legislará uma medida de reparação em vez de confiar em um sinal que sua própria emissora nacional diz que não funciona. Até então, a placa educada na porta destrancada continua exatamente isso.

A questão de conformidade que ninguém consegue responder de fora

Há uma razão para o debate sempre voltar à fiscalização em vez do princípio. Todos concordam em abstrato que os termos de acesso de um site deveriam significar algo. A discordância é sobre quem arca com o custo de tornar isso verdade.

No modelo de opt-out proposto pela Anthropic, o custo recai sobre o titular dos direitos. Um publicador precisa descobrir quais crawlers estão lendo seu conteúdo, codificar os bloqueios corretos, mantê-los atualizados à medida que novos crawlers surgem e monitorar violações. Esse é um ônus operacional contínuo que cresce com o número de empresas de IA e não gera nenhuma reparação quando um crawler ignora o bloqueio.

No modelo de permissão prévia defendido pela ABC, o custo recai sobre a empresa de IA. Ela precisa identificar com o que quer treinar, negociar licenças e manter registros do que tem permissão para usar. Esse é um arranjo familiar, e é o que o direito autoral já sustenta.

Duas tábuas claras em pé sobre ardósia escura com um fio fino de luz passando entre elas

Os dois modelos colocam o custo de monitoramento em partes diferentes, uma diferença de política com consequência prática, e a parte que atualmente arca com ele diz que não tem como arcar com isso. É por isso que o debate sobre robots.txt continua ressurgindo em todas as jurisdições que tentam legislar sobre treinamento de IA: está se pedindo que o padrão técnico faça um trabalho jurídico para o qual nunca foi projetado.

Por que a solução técnica continua insuficiente

Mesmo um registro de opt-out perfeito não resolveria o problema de fundo, porque o sinal identifica um crawler, e não uma empresa. Uma empresa pode fazer scraping por meio de um intermediário, usar um user-agent diferente ou contar com conteúdo que coletou antes de qualquer bloqueio ser colocado.

O registro histórico torna isso concreto. O GPTBot começou a cumprir formalmente as instruções do robots.txt somente depois que os modelos que o tornaram comercialmente valioso já haviam sido treinados. Um bloqueio prospectivo não pode desfazer uma coleta retrospectiva, e um bloqueio a um identificador não vincula uma empresa que pode se apresentar sob outro.

Essa é a lacuna que a ABC apontou quando disse que não pode policiar a internet inteira do lado do titular dos direitos. O sinal é barato para o emissor e caro para o receptor, o inverso de como um mecanismo de conformidade eficaz normalmente funciona. Enquanto não houver uma medida de reparação associada a ignorar o sinal, o incentivo corre em uma única direção.

Artigos relacionados