Shanghai: Erstes Berufungsurteil bei KI-Verletzung von Rechten an der Stimme gefällt – Identifizierbarkeit wird zum Maßstab, Plattform zahlt 50.000 Yuan

--- title: Shanghai: Erstes Berufungsurteil bei KI-Verletzung von Rechten an der Stimme gefällt – Identifizierbarkeit wird zum Maßstab, Plattform zahlt 50.000 Yuan meta_title: Wie wird eine KI-Verletzung von Rechten an der Stimme geurteilt? Erstes Shanghaier Berufungsurteil liefert den Maßstab meta_description: Das Shanghaier Mittlere Volksgericht Nr. 1 bestätigte in zweiter Instanz das erstinstanzliche Urteil: Die Stimme einer Synchronsprecherin wurde per KI für Werbung synthetisiert; die Plattform zahlt 50.000 Yuan. Das Gericht etablierte Identifizierbarkeit als Kernkriterium für die Verletzung von Rechten an der Stimme. ---
Die Synchronsprecherin Frau Wang entdeckte das Problem erst durch den Hinweis einer Freundin. Jemand sagte ihr, in einer Neukunden-Werbeaktion einer App werde eine Stimme verwendet, die ihrer sehr ähnlich klinge.
Sie überprüfte es und kam zu dem Schluss, dass die Audiodatei mit hoher Wahrscheinlichkeit KI-generiert war. Danach ließ sie die Beweise notariell beglaubigen, verklagte den Betreiber und forderte 300.000 Yuan Schadensersatz. Der Fall ging bis zum Shanghaier Mittleren Volksgericht Nr. 1; das Berufungsurteil bestätigte das erstinstanzliche Urteil: Die Plattform hat Rechte an der Stimme verletzt und muss 50.000 Yuan zahlen.
Dies ist der erste Fall in Shanghai, in dem ein Streit über den Schutz der Rechte an der Stimme durch KI-synthetisierte Sprache ausgelöst wurde. Er verdient eine gesonderte Betrachtung, und zwar unabhängig von der Höhe des Schadensersatzes: Das Gericht hat eine Frage geklärt – unter welchen Voraussetzungen die Nachahmung der Stimme einer Person durch KI als Rechtsverletzung gilt.
Drei entscheidende Fakten des Falls
Erstens: Der Beklagte räumte ein, dass die Audiodatei KI-generiert war, konnte aber nicht klären, woher das Material stammte.
Die Verteidigung von Unternehmen A lautete: Die streitgegenständliche Audiodatei sei tatsächlich von der von ihm entwickelten KI erzeugt worden, doch die konkrete Herkunft und das eingespeiste Material ließen sich wegen des Ausscheidens eines früheren Mitarbeiters nicht bestätigen. Das Unternehmen habe zuvor auch nicht gewusst, dass Frau Wang Synchronsprecherin sei, und es habe keine Erfassung oder Nutzung ihrer Stimme gegeben.
Zweitens: Das Sachverständigengutachten lieferte quantitative Ergebnisse.
Frau Wang beantragte eine gerichtliche Begutachtung, bei der die notariell beglaubigte Audiodatei mit ihrer vor Ort aufgenommenen Stimme verglichen wurde. Von 28 akustischen Formant-Indikatoren wichen 24 um weniger als 10 % ab, davon 16 um weniger als 5,36 %. Die relativ ähnlichen und hochgradig ähnlichen Abschnitte machten 90 % aus.
Drittens: Das Gericht verlagerte die Beweislast auf die Plattform, die die Trainingsdaten kontrollierte.
Das Shanghaier Mittlere Volksgericht Nr. 1 befand, Unternehmen A habe als Kontrollinstanz über die ursprünglichen Trainingsdaten nicht hinreichend bewiesen, dass die Herkunft des eingespeisten Materials rechtmäßig sei, dass keine Stimmmerkmale natürlicher Personen genutzt worden seien und dass keine Verwechslung oder Fehlvorstellung in der Öffentlichkeit verursacht worden sei; es müsse daher die nachteiligen Folgen der Beweisfälligkeit tragen.
Die vom Gericht aufgestellte Regel: Es kommt auf Identifizierbarkeit an, nicht auf die technische Herkunft
Der Kernleitsatz dieses Falls lässt sich in einem Satz zusammenfassen: Wer ohne Einwilligung einer natürlichen Person deren Stimme als Trainingsmaterial verwendet, ihren Klang, ihre Intonation und ihren Aussprachestil nachahmt und eine synthetische Stimme erzeugt, die die natürliche Person identifizierbar macht, verletzt die Rechte dieser Person an ihrer Stimme.
Darin stecken zwei Ebenen, die sich getrennt betrachten lassen.
Die eine ist, dass eine bei KI-Sprachentwicklern verbreitete Verteidigungslinie nicht trägt. Manche argumentieren, die Stimme sei eine Rekonstruktion des Stimmabdrucks durch einen Algorithmus und unterscheide sich vom direkten Kopieren einer Originalaufnahme, sodass keine Rechtsverletzung vorliege. Das Gericht antwortet, der Beurteilungsmaßstab liege beim synthetischen Ergebnis: ob es einem durchschnittlichen Mitglied der Öffentlichkeit eine Zuordnung zu einer bestimmten Identität ermöglicht.
Die andere Ebene ist, dass die Schwelle für die Identifizierung beim durchschnittlichen Publikum und nicht bei Fachleuten angesetzt wird. Im vorliegenden Fall ergab das Gutachten eine hohe Ähnlichkeit, daher lag Identifizierbarkeit vor. Das bedeutet aber auch, dass eine Annäherung der Ähnlichkeit an diesen Grad bereits die Grenze überschreitet, und nicht erst eine täuschend echte Nachahmung ausreicht.
Dieser Präzedenzfall knüpft an ein Dokument des Obersten Volksgerichtshofs an
Betrachtet man die Zeitlinie über einen längeren Zeitraum, ist dieser Fall kein isoliertes Urteil.
Am 7. September veröffentlichte der Oberste Volksgerichtshof die „Meinung zur rechtmäßigen Behandlung von Streitigkeiten im Zusammenhang mit künstlicher Intelligenz“; Artikel 4 stellt zwei Dinge klar: Wer ohne Einwilligung mithilfe künstlicher Intelligenz den Namen oder das Bildnis einer anderen Person verarbeitet, ein identifizierbares virtuelles digitales Abbild erzeugt und dieses verwendet oder öffentlich macht, verletzt Persönlichkeitsrechte wie das Namens- und das Bildnisrecht; wer ohne Einwilligung die Stimme einer anderen Person zum Training verwendet, deren Klang, Intonation und Aussprachestil nachahmt und eine identifizierbare synthetische Stimme erzeugt, verletzt die Rechte an der Stimme.
Dies ist in unserem Land das erste von der höchsten nationalen Justizbehörde herausgegebene Dokument mit Regeln für die rechtliche Beurteilung von KI-bezogenen Fällen. Der gewichtigste Punkt darin ist, dass die Stimme erstmals denselben Schutz wie das Bildnis erhält und die Identifizierbarkeit zum einheitlichen Maßstab für die Feststellung einer Rechtsverletzung wird.
Der Shanghaier Fall erschien nach dieser Meinung und setzte die Regel auf Papier in einen konkreten Sachverhalt um: Das Gutachten ergab eine Ähnlichkeit von 90 %, das Gericht stellte darauf gestützt die Identifizierbarkeit fest, die Plattform konnte keinen Nachweis für die rechtmäßige Herkunft des Materials vorlegen, und damit war die Schadensersatzpflicht begründet.
Zuvor hatte der Oberste Volksgerichtshof bereits einen weiteren typischen Fall als Referenz aufgeführt. Im Jahr 2024 beauftragte ein Kulturmedienunternehmen in Xuzhou einen Verkaufs-Livestreamer mit der Erstellung eines Werbevideos; der Streamer verwendete öffentlich zugängliche Ausschnitte aus Vorträgen der im Bereich Familienerziehung tätigen Wissenschaftlerin Frau Li und unterlegte sie mit einer KI-generierten Audioaufnahme, die in Klang, Intonation und Aussprachestil ihrer Stimme hochgradig ähnelte. Das Internetgericht Peking verurteilte den Beklagten im Juli 2025 zu einer Entschuldigung sowie zur Zahlung von 120.000 Yuan für wirtschaftlichen Schaden und angemessene Kosten der Rechtsverfolgung. Beide Fälle folgen derselben Logik: Die unbefugte Nutzung des Bildnisses einer anderen Person in Kombination mit einer hochgradig übereinstimmenden KI-synthetischen Stimme stellt eine doppelte Verletzung des Bildnisrechts und der Rechte an der Stimme dar.
Reaktionen auf dem Markt: Gesichtstausch wird enger reguliert, Stimmklonen wird weiterhin verkauft
Nachdem die Regeln in Kraft getreten waren, fielen die Reaktionen auf der Transaktionsseite asymmetrisch aus.
Medienberichten zufolge wurden innerhalb einer Woche nach Veröffentlichung der Meinung des Obersten Volksgerichtshofs auf einigen E-Commerce-Plattformen Suchanfragen nach Face-Swap-Diensten deutlich stärker blockiert; die Suchergebnisse zeigten keine entsprechenden Produkte. Bei der Suche nach Stimmklonen waren jedoch weiterhin zahlreiche Produkte im Verkauf. Ein Sprachsynthese-Produkt kostete 33,88 Yuan und war über 700 Mal verkauft; das Auftragstraining eines Stimmmodells wurde für 20 Yuan angeboten; auf einem Gebrauchtmarktplatz gab es zudem einen Stimmklon-Dienst für 8,85 Yuan, der über 770 Mal verkauft worden sein soll.
Diese Asymmetrie zeigt eine Realität: Die Hürde für Stimmklonen ist viel niedriger als für Face-Swapping, und der Materialbedarf ist schwerer zu erkennen. Ein öffentlich zugängliches Synchronwerk, eine Podcast-Folge oder ein Kurzvideo kann bereits ausreichend gutes Trainingsmaterial darstellen.
Für die Nutzer sind die Signale dieser Fälle eindeutig. Erstens: Man sollte nicht darauf hoffen, sich durch unklare Materialherkunft entlasten zu können; die Partei, die die Trainingsdaten kontrolliert, ist bei der Beweisführung benachteiligt. Zweitens: Die Beurteilung der Identifizierbarkeit hängt von technischen Gutachten ab; sobald das synthetische Ergebnis so nah kommt, dass die Öffentlichkeit es mit einer bestimmten Person verbinden kann, stellt die kommerzielle Nutzung eine Rechtsverletzung dar. Drittens: Die Höhe des Schadensersatzes wird anhand der Lizenzgebühren für vergleichbare Nutzungen durch den Rechteinhaber bestimmt; die durch den Einsatz von KI unter Umgehung der Lizenzierung eingesparten Kosten können am Ende in Form von Schadensersatz zurückgezahlt werden.
Was bedeutet das für Teams, die KI-Sprachprodukte entwickeln?
Die Urteilslogik dieses Falls enthält mehrere direkte Hinweise für die Produktseite.
Herkunftsnachweise für Trainingsdaten müssen archiviert werden. Der verheerendste Punkt im Fall war, dass Unternehmen A die Herkunft des eingespeisten Materials nicht klären konnte. Für Teams, die Stimmklonen, Sprachsynthese oder die Erzeugung von Audioinhalten betreiben, muss die Lizenzkette der Trainingsdaten nachvollziehbar dokumentiert sein, statt auf mündliche Bestätigungen zu vertrauen.
Die Nachahmung von Stimmmerkmalen muss von konkreten Personen entkoppelt werden. Wenn ein Produkt ein bestimmtes Timbre erzeugen soll, ist eine Lizenzierung eine Voraussetzung und keine nachträgliche Korrektur. Umgekehrt gilt: Wenn nur ein generisches Timbre gewünscht ist, müssen die Trainingsdaten aus kommerziell nutzbaren und nachvollziehbaren Quellen stammen.
Die Linie der Identifizierbarkeit muss als rote Linie und nicht als Richtwert behandelt werden. Die im Gutachten festgestellte Ähnlichkeit von 90 % war die Grundlage der Feststellung in diesem Fall, doch das Gericht hat keine feste numerische Schwelle genannt. Das bedeutet, dass jedes generierte Ergebnis, das den Stimmmerkmalen einer bestimmten natürlichen Person nahekommt, sorgfältig bewertet werden muss.
Im Fall von Frau Wang wurden 50.000 Yuan zugesprochen. Verglichen mit den geforderten 300.000 Yuan ist diese Summe nicht hoch. Doch ihre Bedeutung liegt nicht in diesem Fall, sondern darin, dass sich danach die Standardannahmen aller, die KI-Stimmen einsetzen, verändert haben.
Verwandte Artikel
DeepSeek sammelt 12 Milliarden Dollar ein und baut einen Huawei-Cluster mit 160.000 Chips
Die größte einzelne Wette in der chinesischen KI ist derzeit auf inländisches Silizium gerichtet, getätigt von dem Labor mit der größten Glaubwürdigkeit bei offenen Modellen.
Das Geld fließt in physische KI: SiMa.ais 1,45 Mrd. USD und Agenten, die Hardware entwerfen
Das Kapital kommt vor den Belegen an. Die Einsätze im kommenden Jahr werden zeigen, ob die Wette richtig war.
Ein Gericht in Arizona hob ein Strafmaß auf, weil ein KI-Video für das Opfer sprach
Das zu reproduzieren, was eine Person getan hat, ist eine Sache. Für sie zu sprechen, eine andere – und die Grenze zwischen beidem steht nun in einem Gerichtsprotokoll.
OpenAI wird ChatGPT-Text in der EU mit einem Wasserzeichen versehen. Die eigenen Zahlen zeigen, wie fragil das ist
Eine Markierung, die durch routinemäßiges Paraphrasieren entfernt werden kann, mag dem Wortlaut von Artikel 50 genügen, verfehlt aber die Aufgabe, für die der Artikel geschrieben wurde.