Primo caso a Shanghai di violazione del diritto alla voce con AI: sentenza d'appello stabilisce l'identificabilità come criterio, la piattaforma risarcisce 50.000 yuan

--- title: Primo caso a Shanghai di violazione del diritto alla voce con AI: sentenza d'appello stabilisce l'identificabilità come criterio, la piattaforma risarcisce 50.000 yuan meta_title: Come si giudica la violazione del diritto alla voce con AI? Il primo caso d'appello a Shanghai fornisce il criterio meta_description: Il Tribunale Intermedio di Shanghai, in secondo grado, conferma la sentenza di primo grado: la voce di una doppiatrice è stata sintetizzata con AI per una promozione, la piattaforma risarcisce 50.000 yuan. Il tribunale stabilisce l'identificabilità come criterio centrale per la violazione del diritto alla voce. ---
La doppiatrice Wang ha scoperto il problema solo grazie all'avvertimento di un'amica. Qualcuno le ha detto che in una campagna di acquisizione nuovi utenti di un'app veniva usata una voce molto simile alla sua.
Ha verificato e ha stabilito che quell'audio era con ogni probabilità sintetizzato con AI. Poi ha fatto autenticare le prove tramite notaio, ha citato in giudizio il gestore e ha chiesto 300.000 yuan di risarcimento. La causa è arrivata fino al Tribunale Intermedio di Shanghai, che con sentenza definitiva ha confermato la decisione di primo grado: la piattaforma è responsabile di violazione del diritto alla voce e deve risarcire 50.000 yuan.
Si tratta del primo caso a Shanghai di controversia sulla tutela del diritto alla voce causata da voce sintetizzata con AI. Vale la pena esaminarlo a parte, e il motivo non ha nulla a che fare con l'importo del risarcimento: il tribunale ha chiarito una questione, cioè a quali condizioni l'imitazione della voce di una persona tramite AI costituisce violazione.
Tre fatti chiave del caso
Primo, il convenuto ammette che l'audio è stato generato con AI, ma non riesce a spiegare da dove provengano i materiali.
La difesa della società A è questa: l'audio in questione è stato effettivamente generato dall'AI sviluppata dalla società, ma la provenienza specifica e i materiali di addestramento non possono essere confermati perché l'ex dipendente responsabile si è dimesso. La società inoltre non sapeva che la signora Wang fosse una doppiatrice, e non vi è stato alcun prelievo o utilizzo della sua voce.
Secondo, la perizia ha fornito risultati quantitativi.
La signora Wang ha richiesto una perizia giudiziaria, confrontando l'audio autenticato con la sua voce registrata sul momento. Su 28 indicatori acustici di formanti, 24 presentavano una deviazione inferiore al 10%, di cui 16 inferiore al 5,36%. Le parti moderatamente simili e altamente simili raggiungevano il 90%.
Terzo, il tribunale ha addossato l'onere della prova alla piattaforma che deteneva i dati di addestramento.
Il Tribunale Intermedio di Shanghai ha ritenuto che la società A, in quanto soggetto che controllava i dati originali di addestramento, non abbia fornito prove sufficienti in merito alla legalità della provenienza dei materiali utilizzati per l'addestramento, al fatto di non aver utilizzato le caratteristiche vocali di una persona fisica e di non aver causato confusione o errore nel pubblico, e debba quindi sopportare le conseguenze negative della mancata prova.
La regola stabilita dal tribunale: conta l'identificabilità, non l'origine tecnica
La ratio centrale di questa decisione si riassume in una frase: senza il consenso della persona fisica, usare la voce di una persona fisica come corpus di addestramento, imitarne timbro, intonazione e stile di pronuncia, e generare una voce sintetica in grado di identificare quella persona fisica, deve essere considerato una violazione del diritto alla voce della persona fisica.
Qui ci sono due aspetti che vale la pena distinguere.
Il primo è che una linea difensiva comune tra gli sviluppatori di voce AI non regge. Qualcuno sostiene che la voce è una ricostruzione dell'impronta vocale tramite algoritmo, diversa dalla copia diretta di una registrazione originale, e quindi non costituisce violazione. La risposta del tribunale è che il criterio di giudizio si basa sul risultato sintetico: se esso consente al pubblico generale di associarlo a una specifica identità.
L'altro è che la soglia di identificazione è fissata al livello del pubblico generale, non degli esperti. Nel caso in esame la perizia ha concluso per un'elevata somiglianza, quindi sussiste l'identificabilità. Ma ciò significa anche che una somiglianza vicina a questo livello fa scattare la linea rossa, e non solo quando si raggiunge un'imitazione indistinguibile dal reale.
Questa pronuncia si collega al documento della Corte Suprema del Popolo
Se si allunga la linea temporale, questo caso non è una sentenza isolata.
Il 7 settembre la Corte Suprema del Popolo ha pubblicato le «Opinioni sulla trattazione conforme alla legge dei casi di controversia relativi all'intelligenza artificiale», il cui articolo 4 chiarisce due cose: senza consenso, utilizzare l'intelligenza artificiale per trattare il nome o l'immagine di altri, generare un'immagine digitale virtuale identificabile e usarla o pubblicarla costituisce violazione del diritto al nome, del diritto all'immagine e degli altri diritti della personalità; senza consenso, utilizzare la voce di altri per l'addestramento, imitarne timbro, intonazione e stile di pronuncia e generare una voce sintetica identificabile costituisce violazione del diritto alla voce.
È il primo documento di regole giudiziarie in materia di intelligenza artificiale emanato dal massimo organo giurisdizionale nazionale. Il punto più significativo è che per la prima volta la voce ottiene la stessa protezione dell'immagine, e l'identificabilità diventa il criterio unitario per accertare la violazione.
Il caso di Shanghai è comparso dopo questo documento, e in pratica ha calato le regole sulla carta nel caso concreto: la perizia ha indicato una somiglianza del 90%, il tribunale su questa base ha ritenuto sussistente l'identificabilità, la piattaforma non ha prodotto prove sulla provenienza legale dei materiali, e il risarcimento è stato quindi riconosciuto.
In precedenza un altro caso tipico era stato indicato dalla Corte Suprema come riferimento. Nel 2024, una società di media culturali di Xuzhou ha incaricato un influencer di live commerce di realizzare un video promozionale; l'influencer ha usato frammenti di un discorso pubblico della signora Li, studiosa nel campo dell'educazione familiare, accompagnandoli con un audio sintetico AI altamente simile alla sua voce per timbro, intonazione e stile di pronuncia. Il Tribunale Internet di Pechino nel luglio 2025 ha condannato il convenuto a porgere scuse e a risarcire 120.000 yuan per danni economici e spese ragionevoli per la tutela dei diritti. I due casi puntano alla stessa logica: l'uso non autorizzato dell'immagine di altri, sommato a una voce sintetica AI altamente corrispondente, costituisce una duplice violazione del diritto all'immagine e del diritto alla voce.
La reazione del mercato: il face swapping si stringe, la clonazione vocale è ancora in vendita
Dopo l'entrata in vigore delle regole, la reazione sul fronte degli scambi non è simmetrica.
Secondo quanto riportato dai media, nella settimana successiva alla pubblicazione delle opinioni della Corte Suprema, cercando su alcune piattaforme di e-commerce, il blocco dei servizi di face swapping era piuttosto severo e i risultati di ricerca non mostravano prodotti correlati; ma cercando clonazione vocale, i prodotti erano ancora in vendita in grandi quantità. Alcuni prodotti di sintesi vocale costavano 33,88 yuan e ne erano stati venduti oltre 700; l'addestramento su commissione di modelli vocali era prezzato 20 yuan; su piattaforme di compravendita dell'usato c'erano anche servizi di clonazione vocale a 8,85 yuan, con oltre 770 venduti.
Questa asimmetria di per sé dice una cosa: la soglia della clonazione vocale è molto più bassa di quella del face swapping, e il bisogno di materiali è più nascosto. Un'opera di doppiaggio pubblica, un episodio di podcast, un breve video possono costituire un corpus di addestramento sufficientemente buono.
Per chi utilizza questi strumenti, i segnali di questi casi sono chiari. Primo, non sperare di essere esonerato da responsabilità solo perché non si riesce a spiegare la provenienza dei materiali: chi detiene i dati di addestramento si trova in una posizione sfavorevole quanto all'onere della prova. Secondo, la valutazione dell'identificabilità dipende da perizie tecniche: una volta che il risultato sintetico si avvicina al punto da poter essere associato dal pubblico a una persona specifica, l'uso commerciale costituisce violazione. Terzo, l'importo del risarcimento viene determinato facendo riferimento ai canoni di licenza di analogo tipo del titolare dei diritti: il costo risparmiato aggirando l'autorizzazione con l'AI potrebbe alla fine essere restituito sotto forma di risarcimento.
Cosa significa per i team che sviluppano prodotti vocali AI
La logica di questa sentenza offre alcuni spunti diretti per il lato prodotto.
La prova della provenienza dei dati di addestramento deve essere archiviata. Il punto più letale del caso è che la società A non riusciva a spiegare la provenienza dei materiali di addestramento. Per i team che si occupano di clonazione vocale, sintesi vocale e generazione di contenuti audio, la catena di autorizzazione del corpus deve avere registrazioni tracciabili, non basarsi su conferme verbali.
L'imitazione delle caratteristiche vocali deve essere svincolata da una persona specifica. Se il prodotto deve generare un timbro specifico, l'autorizzazione è una condizione preliminare, non un rimedio successivo. Viceversa, se si vuole solo un timbro generico, i dati di addestramento devono provenire da fonti utilizzabili commercialmente e tracciabili.
La linea dell'identificabilità va trattata come linea rossa, non come valore di riferimento. Il 90% di somiglianza indicato nella perizia è la base dell'accertamento in questo caso, ma il tribunale non ha fissato una soglia numerica fissa. Ciò significa che qualsiasi risultato generato vicino alle caratteristiche vocali di una persona fisica specifica deve essere valutato con cautela.
Il caso della signora Wang si è concluso con un risarcimento di 50.000 yuan. Rispetto ai 300.000 yuan richiesti, la cifra non è alta. Ma il suo significato non sta in questo caso, bensì nel fatto che da quel momento sono cambiate le assunzioni predefinite di tutti coloro che lavorano con la voce AI.
Articoli correlati
DeepSeek sta raccogliendo 12 miliardi di dollari e costruendo un cluster Huawei da 160.000 chip
La più grande scommessa singola nell'IA cinese in questo momento è sul silicio nazionale, fatta dal laboratorio con la maggiore credibilità nei modelli aperti.
Il denaro si sposta verso l'IA fisica: i 1,45 miliardi di SiMa.ai e gli agenti che progettano hardware
Il capitale arriva prima delle prove. Le implementazioni del prossimo anno diranno se la scommessa era giusta.
Un tribunale dell'Arizona ha annullato una condanna perché un video AI ha parlato per la vittima
Riprodurre ciò che una persona ha fatto è una cosa. Parlare al posto suo è un'altra, e la linea tra le due è ora scritta in un fascicolo giudiziario.
OpenAI applicherà un watermark al testo di ChatGPT nell'UE. I suoi stessi numeri mostrano quanto sia fragile
Un marcatore che la parafrasi di routine può rimuovere può soddisfare la lettera dell'articolo 50 ma fallire il compito per cui l'articolo è stato scritto.