← Torna al blog
Newscirca 8 min di lettura

Primo caso a Shanghai di violazione del diritto alla voce con AI: sentenza d'appello stabilisce l'identificabilità come criterio, la piattaforma risarcisce 50.000 yuan

Pubblicato 6 ott 2026
Primo caso a Shanghai di violazione del diritto alla voce con AI: sentenza d'appello stabilisce l'identificabilità come criterio, la piattaforma risarcisce 50.000 yuan

--- title: Primo caso a Shanghai di violazione del diritto alla voce con AI: sentenza d'appello stabilisce l'identificabilità come criterio, la piattaforma risarcisce 50.000 yuan meta_title: Come si giudica la violazione del diritto alla voce con AI? Il primo caso d'appello a Shanghai fornisce il criterio meta_description: Il Tribunale Intermedio di Shanghai, in secondo grado, conferma la sentenza di primo grado: la voce di una doppiatrice è stata sintetizzata con AI per una promozione, la piattaforma risarcisce 50.000 yuan. Il tribunale stabilisce l'identificabilità come criterio centrale per la violazione del diritto alla voce. ---

La doppiatrice Wang ha scoperto il problema solo grazie all'avvertimento di un'amica. Qualcuno le ha detto che in una campagna di acquisizione nuovi utenti di un'app veniva usata una voce molto simile alla sua.

Ha verificato e ha stabilito che quell'audio era con ogni probabilità sintetizzato con AI. Poi ha fatto autenticare le prove tramite notaio, ha citato in giudizio il gestore e ha chiesto 300.000 yuan di risarcimento. La causa è arrivata fino al Tribunale Intermedio di Shanghai, che con sentenza definitiva ha confermato la decisione di primo grado: la piattaforma è responsabile di violazione del diritto alla voce e deve risarcire 50.000 yuan.

Si tratta del primo caso a Shanghai di controversia sulla tutela del diritto alla voce causata da voce sintetizzata con AI. Vale la pena esaminarlo a parte, e il motivo non ha nulla a che fare con l'importo del risarcimento: il tribunale ha chiarito una questione, cioè a quali condizioni l'imitazione della voce di una persona tramite AI costituisce violazione.

Tre fatti chiave del caso

Primo, il convenuto ammette che l'audio è stato generato con AI, ma non riesce a spiegare da dove provengano i materiali.

La difesa della società A è questa: l'audio in questione è stato effettivamente generato dall'AI sviluppata dalla società, ma la provenienza specifica e i materiali di addestramento non possono essere confermati perché l'ex dipendente responsabile si è dimesso. La società inoltre non sapeva che la signora Wang fosse una doppiatrice, e non vi è stato alcun prelievo o utilizzo della sua voce.

Secondo, la perizia ha fornito risultati quantitativi.

La signora Wang ha richiesto una perizia giudiziaria, confrontando l'audio autenticato con la sua voce registrata sul momento. Su 28 indicatori acustici di formanti, 24 presentavano una deviazione inferiore al 10%, di cui 16 inferiore al 5,36%. Le parti moderatamente simili e altamente simili raggiungevano il 90%.

Terzo, il tribunale ha addossato l'onere della prova alla piattaforma che deteneva i dati di addestramento.

Il Tribunale Intermedio di Shanghai ha ritenuto che la società A, in quanto soggetto che controllava i dati originali di addestramento, non abbia fornito prove sufficienti in merito alla legalità della provenienza dei materiali utilizzati per l'addestramento, al fatto di non aver utilizzato le caratteristiche vocali di una persona fisica e di non aver causato confusione o errore nel pubblico, e debba quindi sopportare le conseguenze negative della mancata prova.

La regola stabilita dal tribunale: conta l'identificabilità, non l'origine tecnica

La ratio centrale di questa decisione si riassume in una frase: senza il consenso della persona fisica, usare la voce di una persona fisica come corpus di addestramento, imitarne timbro, intonazione e stile di pronuncia, e generare una voce sintetica in grado di identificare quella persona fisica, deve essere considerato una violazione del diritto alla voce della persona fisica.

Qui ci sono due aspetti che vale la pena distinguere.

Il primo è che una linea difensiva comune tra gli sviluppatori di voce AI non regge. Qualcuno sostiene che la voce è una ricostruzione dell'impronta vocale tramite algoritmo, diversa dalla copia diretta di una registrazione originale, e quindi non costituisce violazione. La risposta del tribunale è che il criterio di giudizio si basa sul risultato sintetico: se esso consente al pubblico generale di associarlo a una specifica identità.

L'altro è che la soglia di identificazione è fissata al livello del pubblico generale, non degli esperti. Nel caso in esame la perizia ha concluso per un'elevata somiglianza, quindi sussiste l'identificabilità. Ma ciò significa anche che una somiglianza vicina a questo livello fa scattare la linea rossa, e non solo quando si raggiunge un'imitazione indistinguibile dal reale.

Questa pronuncia si collega al documento della Corte Suprema del Popolo

Se si allunga la linea temporale, questo caso non è una sentenza isolata.

Il 7 settembre la Corte Suprema del Popolo ha pubblicato le «Opinioni sulla trattazione conforme alla legge dei casi di controversia relativi all'intelligenza artificiale», il cui articolo 4 chiarisce due cose: senza consenso, utilizzare l'intelligenza artificiale per trattare il nome o l'immagine di altri, generare un'immagine digitale virtuale identificabile e usarla o pubblicarla costituisce violazione del diritto al nome, del diritto all'immagine e degli altri diritti della personalità; senza consenso, utilizzare la voce di altri per l'addestramento, imitarne timbro, intonazione e stile di pronuncia e generare una voce sintetica identificabile costituisce violazione del diritto alla voce.

È il primo documento di regole giudiziarie in materia di intelligenza artificiale emanato dal massimo organo giurisdizionale nazionale. Il punto più significativo è che per la prima volta la voce ottiene la stessa protezione dell'immagine, e l'identificabilità diventa il criterio unitario per accertare la violazione.

Il caso di Shanghai è comparso dopo questo documento, e in pratica ha calato le regole sulla carta nel caso concreto: la perizia ha indicato una somiglianza del 90%, il tribunale su questa base ha ritenuto sussistente l'identificabilità, la piattaforma non ha prodotto prove sulla provenienza legale dei materiali, e il risarcimento è stato quindi riconosciuto.

In precedenza un altro caso tipico era stato indicato dalla Corte Suprema come riferimento. Nel 2024, una società di media culturali di Xuzhou ha incaricato un influencer di live commerce di realizzare un video promozionale; l'influencer ha usato frammenti di un discorso pubblico della signora Li, studiosa nel campo dell'educazione familiare, accompagnandoli con un audio sintetico AI altamente simile alla sua voce per timbro, intonazione e stile di pronuncia. Il Tribunale Internet di Pechino nel luglio 2025 ha condannato il convenuto a porgere scuse e a risarcire 120.000 yuan per danni economici e spese ragionevoli per la tutela dei diritti. I due casi puntano alla stessa logica: l'uso non autorizzato dell'immagine di altri, sommato a una voce sintetica AI altamente corrispondente, costituisce una duplice violazione del diritto all'immagine e del diritto alla voce.

La reazione del mercato: il face swapping si stringe, la clonazione vocale è ancora in vendita

Dopo l'entrata in vigore delle regole, la reazione sul fronte degli scambi non è simmetrica.

Secondo quanto riportato dai media, nella settimana successiva alla pubblicazione delle opinioni della Corte Suprema, cercando su alcune piattaforme di e-commerce, il blocco dei servizi di face swapping era piuttosto severo e i risultati di ricerca non mostravano prodotti correlati; ma cercando clonazione vocale, i prodotti erano ancora in vendita in grandi quantità. Alcuni prodotti di sintesi vocale costavano 33,88 yuan e ne erano stati venduti oltre 700; l'addestramento su commissione di modelli vocali era prezzato 20 yuan; su piattaforme di compravendita dell'usato c'erano anche servizi di clonazione vocale a 8,85 yuan, con oltre 770 venduti.

Questa asimmetria di per sé dice una cosa: la soglia della clonazione vocale è molto più bassa di quella del face swapping, e il bisogno di materiali è più nascosto. Un'opera di doppiaggio pubblica, un episodio di podcast, un breve video possono costituire un corpus di addestramento sufficientemente buono.

Per chi utilizza questi strumenti, i segnali di questi casi sono chiari. Primo, non sperare di essere esonerato da responsabilità solo perché non si riesce a spiegare la provenienza dei materiali: chi detiene i dati di addestramento si trova in una posizione sfavorevole quanto all'onere della prova. Secondo, la valutazione dell'identificabilità dipende da perizie tecniche: una volta che il risultato sintetico si avvicina al punto da poter essere associato dal pubblico a una persona specifica, l'uso commerciale costituisce violazione. Terzo, l'importo del risarcimento viene determinato facendo riferimento ai canoni di licenza di analogo tipo del titolare dei diritti: il costo risparmiato aggirando l'autorizzazione con l'AI potrebbe alla fine essere restituito sotto forma di risarcimento.

Cosa significa per i team che sviluppano prodotti vocali AI

La logica di questa sentenza offre alcuni spunti diretti per il lato prodotto.

La prova della provenienza dei dati di addestramento deve essere archiviata. Il punto più letale del caso è che la società A non riusciva a spiegare la provenienza dei materiali di addestramento. Per i team che si occupano di clonazione vocale, sintesi vocale e generazione di contenuti audio, la catena di autorizzazione del corpus deve avere registrazioni tracciabili, non basarsi su conferme verbali.

L'imitazione delle caratteristiche vocali deve essere svincolata da una persona specifica. Se il prodotto deve generare un timbro specifico, l'autorizzazione è una condizione preliminare, non un rimedio successivo. Viceversa, se si vuole solo un timbro generico, i dati di addestramento devono provenire da fonti utilizzabili commercialmente e tracciabili.

La linea dell'identificabilità va trattata come linea rossa, non come valore di riferimento. Il 90% di somiglianza indicato nella perizia è la base dell'accertamento in questo caso, ma il tribunale non ha fissato una soglia numerica fissa. Ciò significa che qualsiasi risultato generato vicino alle caratteristiche vocali di una persona fisica specifica deve essere valutato con cautela.

Il caso della signora Wang si è concluso con un risarcimento di 50.000 yuan. Rispetto ai 300.000 yuan richiesti, la cifra non è alta. Ma il suo significato non sta in questo caso, bensì nel fatto che da quel momento sono cambiate le assunzioni predefinite di tutti coloro che lavorano con la voce AI.

Articoli correlati