← Voltar ao blog
Newscerca de 8 min de leitura

Nono Circuito diz que as saídas do Copilot não são cópias com atribuição removida

Publicado 4 de out. de 2026
Nono Circuito diz que as saídas do Copilot não são cópias com atribuição removida

Um tribunal federal de apelações concedeu ao GitHub e à OpenAI uma vitória estreita, mas significativa, e, ao fazê-lo, traçou uma linha que toda empresa que treina um modelo com o trabalho de outras pessoas deveria ler com atenção.

O caso é Doe v. GitHub. Os autores são programadores anônimos que publicaram código-fonte aberto sob licenças que exigem atribuição. Os réus são o GitHub, sua controladora Microsoft e as entidades OpenAI. Os produtos em questão são o GitHub, o Copilot e o OpenAI Codex, todos treinados em repositórios públicos.

Os autores apresentaram duas teorias com base no Digital Millennium Copyright Act (DMCA), ambas fundamentadas na seção 1202, que proíbe remover ou alterar informações de gestão de direitos autorais.

A primeira era uma teoria de entrada: a de que os réus removeram dados de atribuição do código dos autores antes de alimentar o Copilot com ele como dados de treinamento.

A segunda era uma teoria de saída: a de que o Copilot às vezes retorna dados de treinamento memorizados sem a atribuição do código-fonte, e que fazê-lo equivale a remover ou alterar essas informações.

Um corredor subterrâneo e mal iluminado de um arquivo, ladeado por prateleiras de metal com caixas de armazenamento cinzas

A teoria de entrada nunca chegou a ser argumentada

O Nono Circuito recusou-se a analisar a alegação relativa à fase de treinamento, e o motivo merece atenção.

No tribunal inferior, o advogado dos autores admitiu que copiar os dados de treinamento "talvez" não violasse as licenças, e o tribunal distrital declarou claramente que a ação "não é sobre treinamento". Os autores não se opuseram. Na apelação, a turma considerou a teoria precluída.

Essa preclusão importa mais do que parece.

A questão da fase de treinamento é a que teria afetado todos os modelos treinados com dados raspados ou licenciados.

Ao perdê-la por uma concessão processual, e não pelo mérito, os autores deixaram a maior questão em aberto e a deixaram para um caso diferente.

Por que a teoria de saída falhou

No mérito, o tribunal rejeitou a teoria de saída apoiando-se na própria descrição dos autores sobre como o Copilot funciona.

A petição inicial descrevia um "processo probabilístico complexo" que infere padrões estatísticos e prevê a conclusão mais provável.

Isso, concluiu a turma, descreve geração, e não recuperação, e uma obra gerada "não pode razoavelmente ser descrita como uma cópia" do código protegido.

O tribunal comparou o Copilot a um mecanismo de busca.

Um mecanismo de busca recupera cópias armazenadas, então tem uma cópia da qual a atribuição poderia ser removida.

Um modelo que prevê o próximo token não detém tal cópia, na leitura do tribunal.

A turma então abordou o chamado requisito de identidade, e aqui fez algo que será citado em memoriais por anos.

Ela se recusou a tratar a identidade como um elemento separado de uma reivindicação da seção 1202.

Em vez disso, descreveu a identidade como uma glosa sobre as palavras legais "remove", "alter" e "copies", e como evidência, não como um teste.

A reprodução quase idêntica sem atribuição sustenta uma inferência de que a atribuição foi removida.

Diferenças materiais apontam na direção oposta, para uma nova obra à qual nunca foi anexada qualquer atribuição.

O que a decisão realmente muda

O efeito prático é um estreitamento, não um alívio temporário.

Os titulares de direitos autorais que esperavam que o DMCA lhes desse um atalho em torno das questões mais difíceis de uso justo e semelhança substancial agora precisam percorrer o caminho longo.

A própria formulação do tribunal aponta para onde as próximas disputas estarão.

Os titulares se apoiarão com mais força em teorias da fase de treinamento, argumentando que a atribuição foi removida dos dados antes mesmo de chegarem ao modelo.

E continuarão insistindo em alegações comuns de violação sobre as saídas, nas quais o teste é a semelhança com uma obra protegida, e não a mecânica dos metadados de atribuição.

Há uma segunda leitura que vale a pena manter.

A turma foi cuidadosa ao dizer que a identidade é evidência, não um elemento.

Isso dá aos titulares um caminho: construir um registro de saídas que reproduzem código protegido quase literalmente, sem atribuição, e a inferência se torna disponível.

A linha entre um modelo que memorizou e um que generalizou agora é, em parte, uma questão de quão perto a saída chega e quão bem um autor consegue provar isso.

A forma maior do problema

Dê um passo atrás e o caso parece menos um veredito sobre a IA e mais um retrato de um sistema jurídico que está se atualizando de forma desigual.

A atribuição nunca foi concebida para sobreviver a um modelo probabilístico.

As informações de gestão de direitos autorais pressupõem uma cópia com metadados anexados.

Quando o sistema produz algo novo a partir de um processo estatístico, não há cópia da qual os metadados possam ter sido removidos.

Esse é um argumento sobre a forma da tecnologia, e é o mesmo argumento que aparece em toda disputa em que as categorias antigas não se encaixam.

O Nono Circuito optou por ler as palavras do estatuto literalmente, em vez de esticá-las, o que é defensável e também deixa a tensão subjacente intocada.

Para desenvolvedores, a conclusão é pouco glamourosa.

O DMCA é um escudo mais fraco do que alguns esperavam, mas não desapareceu.

Para os autores, a conclusão é que a teoria que você admite no tribunal distrital é a teoria que você perde na apelação.

E para todos que treinam modelos com código público, o alerta mais duradouro vem da própria lógica do tribunal: quanto mais perto sua saída chega de uma entrada específica, menos se sustenta o enquadramento como "nova obra".

O que significa rodar um modelo com o código de outra pessoa

Para quem mantém um projeto de código aberto, a leitura prática é mais estreita do que as manchetes sugerem.

A via da atribuição pelo DMCA está mais difícil agora, mas as obrigações subjacentes das licenças não mudaram.

Se seu código é licenciado sob MIT ou Apache, um modelo que o memorizou e o reproduz sem o aviso ainda é um problema de licença, e o próprio raciocínio do tribunal indica como prová-lo.

O desconforto também corre no sentido oposto.

A decisão se baseia em uma descrição do Copilot como um gerador probabilístico, e não como um sistema de recuperação.

Essa descrição é precisa para a maioria dos prompts e das saídas.

É menos precisa para a cauda, em que um modelo reproduz uma passagem longa e distintiva quase exatamente, e é precisamente a cauda em torno da qual um autor precisaria construir um registro.

O tribunal não fechou a porta para esse caso.

Ele fez do registro todo o argumento.

Há também uma consequência prática para as ferramentas.

A referência do tribunal distrital ao próprio filtro de detecção de duplicatas do GitHub, que sinaliza correspondências de 150 caracteres, agora faz parte do registro de apelação.

Sistemas que já medem quão perto uma saída chega dos dados de treinamento são os mais bem posicionados para responder à pergunta que o tribunal deixou em aberto, o que sugere que a infraestrutura de conformidade e a estratégia de litígio apontam na mesma direção.

Os casos ainda em andamento

Esta decisão chega a um campo congestionado.

A Thomson Reuters venceu seu recurso contra a Ross Intelligence no Terceiro Circuito em setembro, sobre uma questão de uso justo, e não de metadados de atribuição, e essa decisão dependeu fortemente do fato de que a Ross criou um produto concorrente com o próprio banco de dados com o qual treinou.

A decisão do Nono Circuito sobre o Copilot e a decisão do Terceiro Circuito sobre o Westlaw respondem a perguntas diferentes, e nenhuma controla a outra.

Essa divergência é o estado do direito autoral sobre IA em 2026.

Os tribunais estão resolvendo as peças que chegam até eles, em incrementos circuito a circuito, com fatos que não se generalizam bem.

Uma decisão sobre uma ferramenta de pesquisa jurídica diz pouco sobre um assistente de código, e uma decisão sobre metadados de atribuição diz pouco sobre uso justo.

Quem espera por uma única decisão para resolver a questão está esperando por algo que a estrutura do sistema não produz.

A decisão estreita um caminho e deixa vários outros abertos.

É assim que a maioria dessas questões de direitos autorais de IA está sendo resolvida agora, uma peça de cada vez, no caso que por acaso chegar lá primeiro.

Artigos relacionados