← Retour au blog
NewsEnviron 10 min de lecture

Première affaire d’atteinte au droit à la voix par IA à Shanghai tranchée en appel : l’identifiabilité comme critère, la plateforme condamnée à 50 000 yuans

Publié le 6 oct. 2026
Première affaire d’atteinte au droit à la voix par IA à Shanghai tranchée en appel : l’identifiabilité comme critère, la plateforme condamnée à 50 000 yuans

--- title: Première affaire d’atteinte au droit à la voix par IA à Shanghai tranchée en appel : l’identifiabilité comme critère, la plateforme condamnée à 50 000 yuans meta_title: Comment juger l’atteinte au droit à la voix par IA ? Le premier arrêt en appel à Shanghai donne le critère meta_description: La Cour intermédiaire n°1 de Shanghai confirme en appel le jugement de première instance : la voix d’une actrice de doublage a été synthétisée par IA à des fins promotionnelles, la plateforme paie 50 000 yuans. Le tribunal érige l’identifiabilité en critère central de l’atteinte au droit à la voix. ---

L’actrice de doublage Mme Wang n’a découvert le problème que sur l’alerte d’une amie. Quelqu’un lui a dit que, dans une campagne d’acquisition de nouveaux utilisateurs d’une application, la voix utilisée ressemblait beaucoup à la sienne.

Elle a vérifié et estimé que cet audio avait probablement été synthétisé par IA. Elle a ensuite fait notarier les preuves, a poursuivi l’exploitant et réclamé 300 000 yuans. L’affaire est allée jusqu’à la Cour intermédiaire n°1 de Shanghai, dont l’arrêt définitif a confirmé le jugement de première instance : la plateforme est coupable d’atteinte au droit à la voix et doit verser 50 000 yuans d’indemnisation.

Il s’agit de la première affaire à Shanghai de litige relatif à la protection du droit à la voix causé par une voix synthétisée par IA. Elle mérite d’être examinée à part, pour une raison sans rapport avec le montant de l’indemnisation : la cour a clarifié une question, à savoir dans quelles conditions l’imitation de la voix d’une personne par IA constitue une atteinte.

Trois faits clés de l’affaire

Premièrement, le défendeur admet que l’audio a été généré par IA, mais ne peut pas dire d’où viennent les matériaux.

La société A répond que l’audio en cause a bien été généré par l’IA qu’elle a développée, mais que la source exacte et les matériaux d’entraînement ne peuvent être confirmés en raison du départ d’anciens employés. La société ne savait pas non plus auparavant que Mme Wang était actrice de doublage et n’a pas collecté ni utilisé sa voix.

Deuxièmement, l’expertise judiciaire a fourni des résultats quantifiés.

Mme Wang a demandé une expertise judiciaire, comparant l’audio notarié à sa propre voix enregistrée sur place. Sur 28 indicateurs acoustiques de formants, 24 présentaient un écart inférieur à 10 %, dont 16 inférieurs à 5,36 %. Les parties assez similaires et hautement similaires atteignaient 90 %.

Troisièmement, la cour a fait peser la charge de la preuve sur la plateforme qui détient les données d’entraînement.

La Cour intermédiaire n°1 de Shanghai a estimé que la société A, en tant que partie contrôlant les données d’entraînement originales, n’avait pas suffisamment prouvé la légalité de la source des matériaux d’entraînement, l’absence d’utilisation des caractéristiques vocales d’une personne physique, ni l’absence de confusion ou d’erreur dans le public, et devait supporter les conséquences défavorables de l’impossibilité de prouver ses affirmations.

La règle établie par la cour : l’identifiabilité, pas la source technique

Le cœur de la décision dans cette affaire tient en une phrase : sans le consentement d’une personne physique, utiliser sa voix comme corpus d’entraînement, imiter son timbre, son intonation et son style de prononciation, et générer une voix synthétique permettant d’identifier cette personne, doit être considéré comme une atteinte au droit à la voix.

Deux aspects méritent d’être distingués ici.

Le premier est que l’argument de défense fréquent des développeurs de voix IA ne tient pas. Certains diront que la voix est une reconstruction algorithmique de l’empreinte vocale, différente de la copie directe d’un enregistrement original, et qu’il n’y a donc pas d’atteinte. La cour répond que le critère repose sur le résultat de la synthèse : permet-il au grand public d’établir un lien avec une identité déterminée ?

L’autre est que le seuil d’identification est fixé au niveau du grand public, et non des spécialistes. Dans cette affaire, l’expertise conclut à une grande similitude, donc à l’identifiabilité. Mais cela signifie aussi qu’une similitude proche de ce niveau franchit la ligne, et qu’il ne faut pas attendre une imitation parfaite pour qu’il y ait atteinte.

Ce jugement rejoint un document de la Cour populaire suprême

Si l’on replace les choses dans une perspective plus longue, cette affaire n’est pas une décision isolée.

Le 7 septembre, la Cour populaire suprême a publié les « Opinions sur le traitement conformément à la loi des litiges liés à l’intelligence artificielle », dont l’article 4 précise deux points : sans consentement, utiliser l’intelligence artificielle pour traiter le nom ou l’image d’autrui, générer une figure numérique virtuelle identifiable et l’utiliser ou la divulguer constitue une atteinte au droit au nom, au droit à l’image et à d’autres droits de la personnalité ; sans consentement, utiliser la voix d’autrui pour l’entraînement, imiter son timbre, son intonation et son style de prononciation et générer une voix synthétique identifiable constitue une atteinte au droit à la voix.

Il s’agit du premier document de règles judiciaires de Chine relatif à l’intelligence artificielle publié par la plus haute institution judiciaire nationale. Son point le plus marquant est que la voix bénéficie pour la première fois d’une protection équivalente à celle de l’image, et que l’identifiabilité devient le critère unifié de reconnaissance de l’atteinte.

L’affaire de Shanghai est apparue après ces opinions, ce qui revient à appliquer la règle écrite à un cas concret : l’expertise a établi une similitude de 90 %, la cour en a déduit que l’identifiabilité était établie, la plateforme n’a pas pu produire de preuve de la légalité de la source des matériaux, et l’indemnisation a donc été retenue.

Une autre affaire typique avait déjà été citée en référence par la Cour suprême. En 2024, une société de médias culturels de Xuzhou a chargé un animateur de vente en direct de réaliser une vidéo promotionnelle ; l’animateur a utilisé des extraits d’un discours public de Mme Li, universitaire spécialiste de l’éducation familiale, en les accompagnant d’un audio synthétisé par IA très proche de sa voix par le timbre, l’intonation et le style de prononciation. En juillet 2025, le Tribunal de l’internet de Pékin a condamné le défendeur à présenter des excuses et à payer 120 000 yuans pour pertes économiques et frais raisonnables de défense des droits. Les deux affaires relèvent de la même logique : l’utilisation non autorisée de l’image d’autrui, aggravée par une voix synthétique par IA hautement concordante, constitue une double atteinte au droit à l’image et au droit à la voix.

La réaction du marché : l’échange de visages se resserre, le clonage vocal se vend encore

Après l’entrée en vigueur des règles, la réaction du côté des transactions n’a pas été symétrique.

Selon les médias, dans la semaine suivant la publication des opinions de la Cour suprême, sur certaines plateformes de commerce en ligne, le filtrage des services d’échange de visages était relativement fort, les recherches ne montrant aucun produit pertinent ; mais pour le clonage vocal, les produits restaient nombreux en vente. Certains produits de synthèse vocale étaient vendus 33,88 yuans, plus de 700 exemplaires vendus ; certains entraînements de modèles vocaux étaient affichés à 20 yuans ; sur les plateformes de seconde main, des services de clonage vocal à 8,85 yuans affichaient plus de 770 ventes.

Cette asymétrie révèle une réalité : le seuil du clonage vocal est bien plus bas que celui de l’échange de visages, et le besoin en matériaux est plus discret. Une œuvre de doublage publique, un épisode de podcast ou une courte vidéo peuvent suffire à constituer un corpus d’entraînement de bonne qualité.

Pour les utilisateurs, le signal donné par ces affaires est clair. Premièrement, il ne faut pas espérer être exonéré en ne pouvant pas expliquer la source des matériaux : la partie qui détient les données d’entraînement est en position défavorable sur le plan de la preuve. Deuxièmement, l’appréciation de l’identifiabilité dépend d’une expertise technique ; dès que le résultat synthétique est suffisamment proche pour que le public l’associe à une personne déterminée, l’usage commercial constitue une atteinte. Troisièmement, le montant de l’indemnisation sera déterminé par référence aux redevances de licence de même nature du titulaire des droits ; les coûts économisés en contournant l’autorisation grâce à l’IA pourraient finalement être restitués sous forme d’indemnisation.

Ce que cela signifie pour les équipes qui développent des produits vocaux IA

La logique de cette décision donne plusieurs indications directes pour le côté produit.

La preuve de l’origine des données d’entraînement doit être archivée. Le point le plus fatal dans cette affaire est que la société A ne pouvait pas expliquer la source des matériaux d’entraînement. Pour les équipes qui font du clonage vocal, de la synthèse vocale ou de la génération de contenus audio, la chaîne d’autorisation des corpus doit être traçable, et non reposer sur une confirmation orale.

L’imitation de caractéristiques vocales doit être dissociée d’une personne déterminée. Si le produit doit générer un timbre particulier, l’autorisation est une condition préalable, et non une mesure corrective a posteriori. À l’inverse, si l’on veut seulement un timbre générique, les données d’entraînement doivent provenir de sources commercialisables et traçables.

La ligne de l’identifiabilité doit être traitée comme une ligne rouge, et non comme une valeur indicative. La similitude de 90 % retenue dans l’expertise sert de base à la décision dans cette affaire, mais la cour n’a pas fixé de seuil numérique fixe. Cela signifie que tout résultat généré proche des caractéristiques vocales d’une personne physique déterminée doit être évalué avec prudence.

Dans l’affaire de Mme Wang, l’indemnisation s’est élevée à 50 000 yuans. Comparé aux 300 000 yuans réclamés, ce chiffre n’est pas élevé. Mais sa portée ne se limite pas à cette affaire : elle tient au fait que, désormais, les hypothèses par défaut de tous ceux qui travaillent sur la voix IA ont changé.

Articles associés