Primeiro caso de violação de voz por IA em Xangai é decidido em segunda instância: identificabilidade vira parâmetro, plataforma paga 50 mil

--- title: Primeiro caso de violação de voz por IA em Xangai é decidido em segunda instância: identificabilidade vira parâmetro, plataforma paga 50 mil meta_title: Como se julga a violação de voz por IA? Primeiro caso de Xangai em segunda instância dá o parâmetro meta_description: Tribunal Intermediário nº 1 de Xangai mantém sentença em segunda instância: voz de dubladora foi sintetizada por IA para promoção, plataforma paga 50 mil. Tribunal estabelece identificabilidade como critério central de violação de voz. ---
A dubladora Sra. Wang só descobriu o problema depois que uma amiga a alertou. Alguém lhe disse que, em uma campanha de aquisição de novos usuários de um aplicativo, a voz usada era muito parecida com a dela.
Ela foi verificar e concluiu que aquele áudio provavelmente havia sido sintetizado por IA. Em seguida, fez uma ata notarial para preservar as provas, processou a operadora e pediu 300 mil yuans de indenização. O caso chegou ao Tribunal Popular Intermediário nº 1 de Xangai, e a decisão final manteve a sentença original: a plataforma cometeu violação de direitos de voz e deveria pagar 50 mil yuans.
Este é o primeiro caso em Xangai de disputa sobre proteção de direitos de voz causado por voz sintetizada por IA. Ele merece ser destacado separadamente, e o motivo não tem a ver com o valor da indenização: o tribunal esclareceu uma questão — em que condições a IA que imita a voz de uma pessoa configura violação.
Três fatos-chave do caso
Primeiro, o réu admitiu que o áudio foi gerado por IA, mas não soube explicar de onde vieram os materiais.
A defesa da empresa A foi: o áudio em questão foi de fato gerado pela IA desenvolvida pela empresa, mas a origem específica e os materiais de alimentação não podem ser confirmados devido à saída de ex-funcionários. A empresa também não sabia anteriormente que a Sra. Wang era dubladora, e não houve coleta ou uso de sua voz.
Segundo, o laudo pericial apresentou resultados quantitativos.
A Sra. Wang solicitou perícia judicial, comparando o áudio notarizado com sua própria voz coletada no local. Entre 28 indicadores acústicos de formantes, 24 apresentaram desvio inferior a 10%, dos quais 16 ficaram abaixo de 5,36%. As partes consideradas relativamente semelhantes e altamente semelhantes chegaram a 90%.
Terceiro, o tribunal atribuiu o ônus da prova à plataforma que detinha os dados de treinamento.
O Tribunal Intermediário nº 1 de Xangai entendeu que a empresa A, como controladora dos dados originais de treinamento, não apresentou provas suficientes sobre a legalidade da origem dos materiais de alimentação, sobre não ter utilizado características vocais de pessoa natural e sobre não ter causado confusão ou erro no público, devendo arcar com as consequências desfavoráveis da impossibilidade de provar.
A regra estabelecida pelo tribunal: olhar a identificabilidade, não a origem técnica
A tese central da decisão deste caso pode ser resumida em uma frase: sem o consentimento da pessoa natural, usar a voz da pessoa natural como corpus de treinamento, imitar seu timbre, entonação e estilo de pronúncia e gerar uma voz sintética capaz de identificar essa pessoa natural deve ser considerado violação dos direitos de voz da pessoa natural.
Aqui há dois pontos que merecem ser destacados separadamente.
Um deles é que a linha de defesa comum entre desenvolvedores de voz por IA não se sustenta. Alguns diriam que a voz é uma reconstrução algorítmica da impressão vocal, diferente da cópia direta de uma gravação original, e por isso não configuraria violação. A resposta do tribunal é que o critério recai sobre o resultado da síntese: se ele permite que o público geral faça uma associação com uma identidade específica.
O outro é que o limiar de identificação é fixado no nível do público geral, não no de especialistas. No caso, o resultado pericial foi de alta similaridade, portanto há identificabilidade. Mas isso também significa que, quando a similaridade se aproxima desse nível, já se cruza a linha, e não apenas quando se atinge uma reprodução indistinguível da realidade.
Este precedente se conecta com o documento do Supremo Tribunal Popular
Se ampliarmos a linha do tempo, este caso não é uma decisão isolada.
Em 7 de setembro, o Supremo Tribunal Popular publicou o 'Parecer sobre a apreciação de casos de disputas envolvendo inteligência artificial conforme a lei', cujo artigo 4º esclarece duas coisas: sem consentimento, utilizar IA para processar o nome ou a imagem de outra pessoa, gerar uma imagem digital virtual identificável e usá-la ou divulgá-la constitui violação de direitos de personalidade, como o direito ao nome e o direito à imagem; sem consentimento, usar a voz de outra pessoa para treinamento, imitar seu timbre, entonação e estilo de pronúncia e gerar uma voz sintética identificável constitui violação dos direitos de voz.
Este é o primeiro documento de regras judiciais sobre IA emitido pelo mais alto órgão judicial do país. O ponto mais importante é que, pela primeira vez, a voz recebe proteção equivalente à da imagem, e a identificabilidade se torna o critério unificado para determinar a violação.
O caso de Xangai surgiu depois desse parecer, equivalendo a aplicar a regra no papel a uma situação concreta: a perícia apontou 90% de similaridade, o tribunal com base nisso reconheceu a identificabilidade, a plataforma não conseguiu apresentar prova da origem legal dos materiais, e a indenização foi assim estabelecida.
Antes disso, outro caso típico foi listado pela Suprema Corte como referência. Em 2024, uma empresa de mídia cultural de Xuzhou contratou um influenciador de vendas para produzir um vídeo promocional; o influenciador usou trechos de palestras públicas da Sra. Li, estudiosa da área de educação familiar, combinados com áudio sintetizado por IA altamente semelhante à voz dela em timbre, entonação e estilo de pronúncia. O Tribunal de Internet de Pequim, em julho de 2025, condenou o réu a pedir desculpas e a pagar 120 mil yuans por perdas econômicas e despesas razoáveis de defesa. Os dois casos apontam para a mesma lógica: usar a imagem de outra pessoa sem autorização e, somado a isso, uma voz sintetizada por IA altamente correspondente, constitui violação dupla do direito à imagem e dos direitos de voz.
Reação do mercado: troca de rosto apertou, clonagem de voz ainda é vendida
Depois que a regra entrou em vigor, a reação no lado das transações não foi simétrica.
Segundo relatos da mídia, na semana seguinte à publicação do parecer da Suprema Corte, em buscas em algumas plataformas de comércio eletrônico, o bloqueio a serviços de troca de rosto foi relativamente rigoroso, e os resultados de busca não mostraram produtos relacionados; porém, ao buscar clonagem de voz, os produtos continuavam amplamente à venda. Alguns produtos de síntese de voz custavam 33,88 yuans e já haviam vendido mais de 700 unidades; alguns treinamentos sob encomenda de modelos de voz estavam anunciados por 20 yuans; e em plataformas de segunda mão havia ainda serviços de clonagem de voz por 8,85 yuans, com mais de 770 unidades vendidas.
Essa assimetria por si só revela uma realidade: a barreira para clonagem de voz é muito mais baixa do que para troca de rosto, e a demanda por materiais também é mais discreta. Uma obra de dublagem pública, um episódio de podcast, um vídeo curto já podem constituir um corpus de treinamento suficientemente bom.
Para os usuários, os sinais dados por esses casos são muito claros. Primeiro, não se deve esperar isenção de responsabilidade por não conseguir explicar a origem dos materiais; a parte que detém os dados de treinamento fica em posição desfavorável quanto ao ônus da prova. Segundo, a determinação da identificabilidade depende de perícia técnica; uma vez que o resultado da síntese se aproxime a ponto de o público conseguir associá-lo a uma pessoa específica, o uso comercial configura violação. Terceiro, o valor da indenização será determinado com referência ao valor de licenciamento de uso similar pelo titular do direito; o custo economizado ao contornar a autorização com IA pode, no fim, ser devolvido na forma de indenização.
O que isso significa para equipes que fazem produtos de voz por IA
A lógica decisória deste caso traz alguns alertas diretos para o lado do produto.
A comprovação da origem dos dados de treinamento precisa ser arquivada. O ponto mais fatal no caso foi a empresa A não conseguir explicar a origem dos materiais de alimentação. Para equipes que trabalham com clonagem de voz, síntese de voz e geração de conteúdo em áudio, a cadeia de autorização do corpus deve ter registros rastreáveis, em vez de depender de confirmação verbal.
A imitação de características vocais deve ser desvinculada de uma pessoa específica. Se o produto precisa gerar um timbre específico, a autorização é condição prévia, não uma correção posterior. Por outro lado, se o objetivo é apenas um timbre genérico, os dados de treinamento devem vir de fontes garantidamente comerciais e rastreáveis.
A linha da identificabilidade deve ser tratada como linha vermelha, não como valor de referência. A similaridade de 90% no laudo pericial é a base da decisão neste caso, mas o tribunal não estabeleceu um limiar numérico fixo. Isso significa que qualquer resultado de geração que se aproxime das características vocais de uma pessoa natural específica precisa ser avaliado com cautela.
O caso da Sra. Wang resultou em 50 mil yuans de indenização. Comparado aos 300 mil yuans pedidos, o valor não é alto. Mas seu significado não está neste caso, e sim no fato de que, daqui em diante, a premissa padrão de todos ao trabalhar com voz por IA mudou.
Artigos relacionados
DeepSeek está levantando US$ 12 bilhões e construindo um cluster Huawei de 160.000 chips
A maior aposta individual da IA chinesa neste momento é em silício doméstico, feita pelo laboratório com mais credibilidade em modelos abertos.
O dinheiro está migrando para a IA física: os US$ 1,45 bilhão da SiMa.ai e agentes que projetam hardware
O capital está chegando antes das evidências. As implantações ao longo do próximo ano dirão se a aposta estava certa.
Um tribunal do Arizona anulou uma sentença porque um vídeo de IA falou pela vítima
Reproduzir o que uma pessoa fez é uma coisa. Falar em nome dela é outra, e a linha entre as duas agora está registrada em um processo judicial.
OpenAI vai aplicar marca d'água ao texto do ChatGPT na UE. Seus próprios números mostram o quão frágil isso é
Um marcador que a paráfrase de rotina consegue remover pode satisfazer a letra do Artigo 50 enquanto falha na tarefa para a qual o artigo foi escrito.