← Voltar ao blog
Newscerca de 7 min de leitura

PewDiePie foi banido duas vezes por fazer destilação, e as regras ficaram pessoais

Publicado 3 de out. de 2026
PewDiePie foi banido duas vezes por fazer destilação, e as regras ficaram pessoais

Felix Kjellberg, mais conhecido como PewDiePie, contou ao seu público que a OpenAI o baniu duas vezes. Sua infração não foi contrabandear pesos nem revender acesso à API em larga escala. Ele usou saídas de um dos modelos da OpenAI para treinar o Ajax, um modelo de 9B que ele roda em seu próprio hardware para tarefas do dia a dia, como busca e e-mail.

O Ajax é construído sobre o Qwen3.5-9B, um modelo aberto pequeno, e ajustado com dados gerados por um modelo maior e fechado. Esse processo se chama destilação. É a mesma técnica que produziu uma onda de modelos baratos e capazes nos últimos dois anos, e é a técnica que os grandes laboratórios agora se empenham em policiar.

O que a destilação realmente é

Destilar um modelo significa treinar um modelo menor para imitar um maior. Você envia prompts ao professor, coleta suas respostas e treina o aluno para reproduzi-las. O aluno não precisa dos pesos nem da arquitetura do professor. Ele só precisa de comportamento suficiente do professor para aprender o padrão.

É por isso que os laboratórios se importam. Treinar um modelo de fronteira custa dezenas ou centenas de milhões de dólares. Se um concorrente ou um indivíduo consegue coletar suas saídas via API e transferir essa capacidade para um modelo que possui, a parte cara do trabalho é parcialmente contornada. A saída parece texto, mas o sinal por trás dela é o que está sendo copiado.

Muitos pequenos frascos de vidro idênticos sendo enchidos a partir de um único funil de vidro suspenso sobre uma superfície escura

O caso de Kjellberg importa justamente porque é pequeno. Ele não é uma startup bem financiada lançando um produto rival. É uma pessoa com uma GPU de consumidor e um modelo local. A fiscalização chegou até lá.

Os laboratórios não estão chutando a escala

O banimento de Kjellberg pela OpenAI é apenas a ponta visível. As campanhas maiores são industriais. O CEO da Anthropic, Dario Amodei, descreveu uma única operação de destilação que usou cerca de 25.000 contas falsas e realizou aproximadamente 28,8 milhões de trocas com o Claude. Nesse volume, coletar saídas não é um projeto paralelo; é um pipeline de dados com equipe e infraestrutura.

A OpenAI também agiu contra empresas. Cortou o acesso da Cursor aos seus modelos, citando preocupações com destilação, depois que a xAI usou saídas da OpenAI para treinar o Grok. O padrão nessas ações é que a fiscalização não mira mais apenas revendedores óbvios. Ela mira qualquer um cujo produto dependa de capacidade extraída de um modelo fechado.

Está se formando toda uma indústria de detecção em torno disso. Os laboratórios observam padrões de contas, volumes de requisições e as impressões digitais estatísticas de dados coletados. Ser pego nem sempre significa um processo judicial; pode significar perder o acesso à API, o que, para uma startup, muitas vezes dá no mesmo.

Vinte e cinco empresas pediram regras mais claras

A fiscalização dos laboratórios acontece em um cenário de discordância aberta sobre quais deveriam ser as regras. Em julho de 2026, vinte e cinco organizações, incluindo Nvidia, Meta e Microsoft, assinaram uma carta argumentando que modelos de pesos abertos são centrais para a liderança dos EUA em IA. Elas pediram estruturas legais direcionadas que tratem a destilação diretamente, em vez de restrições amplas a modelos abertos.

OpenAI, Anthropic e Google não assinaram. As três têm modelos de fronteira cujo valor depende de limitar a facilidade com que suas saídas podem ser copiadas. A divisão se resume a quem pode fazer isso e sob quais condições.

Nessa lacuna, um tribunal de apelações dos EUA acrescentou um dado separado no fim de setembro. Em Thomson Reuters v. Ross Intelligence, o Terceiro Circuito confirmou a decisão de que copiar material editorial de um concorrente para treinar um produto de busca não configurava uso justo, porque o produto resultante concorria diretamente com a fonte. Esse caso trata de um mecanismo de busca, não de um modelo generativo, e a corte fez questão de dizer que não estava decidindo todo o treinamento de IA. Mas sinaliza que o terreno legal sob os dados de treinamento está mudando ao mesmo tempo em que a fiscalização técnica se aperta.

Por que o termo “destilação” está fazendo muito trabalho

Nem todo uso da saída de um modelo é igual, e as regras atuais embaralham essa diferença. Pedir a um modelo que ajude você a escrever código é uso normal. Pedir que ele gere milhões de exemplos para você treinar um rival não é. Em algum ponto entre esses dois está a pessoa que usa saídas para fazer um modelo de hobby se comportar um pouco melhor, que é mais ou menos onde Kjellberg se encontra.

Os laboratórios tratam os dados de saída como um ativo cujos direitos de uso e controle lhes pertencem. Seus termos de serviço dizem isso, e a fiscalização segue os termos, não um padrão legal. É por isso que o mesmo ato pode ser permitido em uma conta e banido em outra: depende do volume, da intenção conforme lida pelo provedor e de o modelo resultante parecer ou não um concorrente. Não existe uma linha clara, e a ausência dela é o verdadeiro problema para quem tenta ficar do lado certo.

A detecção torna a fronteira ainda mais difícil de enxergar. Os laboratórios procuram padrões que sugiram coleta: volumes incomuns de requisições, contas criadas em lote, prompts que lembram conjuntos de avaliação. Alguém rodando alguns milhares de prompts pode não acionar nenhum deles. Uma operação com 25.000 contas vai acionar. No meio, a resposta é genuinamente incerta, e incerteza é uma base ruim para um produto.

Uma decisão judicial saiu ao mesmo tempo

A fiscalização técnica se aperta enquanto o quadro legal ainda se move. No fim de setembro, o Terceiro Circuito confirmou a decisão de que copiar material editorial de um concorrente para treinar um produto de busca não era uso justo, porque o produto resultante concorria com a fonte. A corte fez questão de observar que sua decisão era sobre um mecanismo de busca, não um modelo generativo, e que não estava estabelecendo uma regra universal para o treinamento de IA.

Lido de forma restrita, o caso diz pouco sobre o modelo local de Kjellberg. Lido como sinal, diz que os tribunais estão dispostos a pesar fortemente o dano de mercado quando um modelo é treinado com material de um produto com o qual concorre. Os laboratórios já agem como se esse princípio se aplicasse às suas saídas. As cortes ainda não disseram se ele se aplica.

O que isso significa se você roda um modelo pequeno

Para desenvolvedores individuais e equipes pequenas, o quadro prático mudou mais rápido do que a lei.

Treinar um modelo local com saídas que você mesmo gerou fica numa zona cinzenta que depende dos termos de serviço do provedor, não da lei de direitos autorais. A maioria dos grandes provedores proíbe usar saídas para treinar modelos concorrentes. O que conta como “concorrente” é definido pelo provedor, e a fiscalização pode chegar sem aviso na forma de uma chave suspensa.

Vale a pena fazer algumas coisas. Leia os termos de serviço do modelo específico do qual você está destilando, não a política geral. Mantenha registros de como os dados de treinamento foram produzidos, porque, se um provedor perguntar, uma trilha auditável é a diferença entre um aviso e um banimento. Prefira saídas de modelos cujas licenças permitem explicitamente treinamento derivado, o que inclui muitos modelos de pesos abertos. E, se seu produto depende da API de um único provedor, trate essa dependência como risco, não como conveniência.

Kjellberg é um caso de teste incomum porque é público e os riscos para ele são baixos. A lição não é que ele foi tratado injustamente nem que mereceu isso. É que a tolerância à destilação se estreitou a ponto de um projeto pessoal em hardware de consumidor render dois banimentos. Equipes que aplicam a mesma técnica em escala devem supor menos margem, não mais.

Artigos relacionados