上海首例AI聲音侵權二審落槌:可識別性成為標尺,平台賠5萬

--- title: 上海首例AI聲音侵權二審落槌:可識別性成為標尺,平台賠5萬 meta_title: AI聲音侵權怎麼判?上海首例二審給出標尺 meta_description: 上海一中院二審維持原判,配音員聲音被AI合成用於推廣,平台賠5萬元。法院把可識別性確立為聲音侵權核心標準。 ---
配音員王女士是在朋友的提醒下才發現問題的。有人告訴她,一款App的拉新推廣活動裡,用的聲音很像她。
她去核實,判斷那段音訊很可能是AI合成的。隨後做了公證固定證據,起訴營運方,求償30萬元。案子一路走到上海市第一中級人民法院,終審判決維持原判:平台構成聲音侵權,賠償5萬元。
這是上海首例因AI合成語音引發的聲音權益保護糾紛案。它值得單獨拿出來說,理由跟賠償金額無關:法院把一個問題講清楚了,AI模仿一個人的聲音,在什麼條件下算侵權。
案子裡的三個關鍵事實
第一,被告承認音訊是AI生成的,但說不清素材從哪來。
A公司的答辯是:本案音訊確為該公司開發的AI所生成,但具體的來源和投餵素材因前員工離職無法確認。公司此前也不知曉王女士是配音員,不存在採集、使用其聲音的情況。
第二,鑑定意見給出了量化結果。
王女士申請司法鑑定,將公證音訊與當場採集的本人聲音做比對。在28個共振峰聲學指標中,24個偏離度小於10%,其中16個小於5.36%。兩者較為相似及高度相似的部分達到90%。
第三,法院把舉證責任壓給了掌握訓練資料的平台。
上海一中院認為,A公司作為掌握原始訓練資料的控制方,未能就投餵素材來源合法性、未利用自然人聲音特徵、未造成公眾混淆誤認等事實充分舉證,應承擔舉證不能的不利後果。
法院確立的規則:看可識別性,不看技術來源
這個案子的核心裁判要旨是一句話:未經自然人同意,使用自然人的聲音作為訓練語料,模仿該自然人的音色、語調和發音風格,生成能夠識別該自然人的合成人聲,應當認定侵害自然人聲音權益。
這裡有兩層意思值得拆開。
一層是,AI語音開發者常有的辯護思路站不住。有人會說,聲音是演算法對聲紋的重構,跟直接複製原始錄音有區別,所以構不成侵權。法院的回應是,判斷依據落在合成結果上:它能否讓一般社會大眾進行特定身分關聯。
另一層是,識別門檻定在一般社會大眾這個層級,而不是專業人士。案例中的鑑定結果是高度相似,所以有可識別性。但這也意味著,相似度接近到這個程度就會踩線,而不是只有做到以假亂真才算。
這個判例接上了最高人民法院的文件
如果把時間線拉長看,這個案子不是一個孤立的判決。
9月7日,最高人民法院發布《關於依法審理涉人工智慧糾紛案件的意見》,第四條明確了兩件事:未經同意,利用人工智慧處理他人姓名、肖像,生成可識別的虛擬數位形象並使用、公開的,構成對姓名權、肖像權等人格權益的侵害;未經同意,將他人聲音用於訓練,模仿其音色、語調、發音風格並生成可識別的合成人聲的,構成對聲音權益的侵害。
這是中國首部由國家最高審判機構出台的涉人工智慧司法裁判規則文件。其中最有分量的一點是,聲音第一次與肖像獲得同等保護,而可識別性成為統一的侵權認定標尺。
上海這起案子出現在這份意見之後,等於把紙面規則落到了具體案情裡:鑑定給出90%的相似度,法院據此認定可識別性成立,平台拿不出素材合法來源的證據,賠償就此成立。
此前還有另一起典型案例被最高法列為參考。2024年,徐州一家文化傳媒公司委託帶貨主播製作宣傳影片,主播使用了家庭教育領域學者李女士的公開演講片段,配上與她聲音在音色、語調、發音風格上高度近似的AI合成音訊。北京互聯網法院在2025年7月判決被告賠禮道歉並賠償經濟損失及維權合理支出12萬元。兩案指向的是同一個邏輯:未經授權使用他人肖像,再疊加高度吻合的AI合成聲音,構成對肖像權和聲音權益的雙重侵害。
市場端的反應:換臉收緊了,聲音克隆還在賣
規則落地之後,交易端的反應並不對稱。
據媒體報導,最高法意見發布後的一週內,在部分電商平台搜尋,對換臉服務的屏蔽力度較大,搜尋結果顯示無相關商品;但搜尋聲音克隆,商品依然大量販售中。有的語音合成商品售價33.88元,已售出700餘件;有的聲音模型代訓練標價20元;二手交易平台上還有標價8.85元的聲音克隆服務,顯示已售出770餘件。
這個不對稱本身說明了一個現實:聲音克隆的門檻比換臉低得多,素材需求也更隱蔽。一段公開的配音作品、一集播客、一段短影音,就可能構成足夠好的訓練語料。
而對使用方來說,這些案例給出的信號很明確。第一,不要指望說不清素材來源就能免責,掌握訓練資料的一方在舉證上處於不利位置。第二,可識別性的判斷依賴技術鑑定,一旦合成結果接近到能被公眾關聯到具體個人,商業使用就構成侵權。第三,賠償數額會參照權利人同類許可使用費來確定,用AI繞開授權省下的成本,最終可能以賠償的形式還回去。
對做AI語音產品的團隊意味著什麼
這起案子的判決邏輯對產品側有幾個直接提示。
訓練資料的來源證明需要留存紀錄。案例中最致命的一點是A公司說不清投餵素材的來源。對做聲音克隆、語音合成、有聲內容生成的團隊來說,語料的授權鏈條要有可追溯的紀錄,而不是依賴口頭確認。
聲音特徵的模仿要與具體個人脫鉤。如果產品要生成某個特定音色,授權是前置條件,而不是事後補救。反過來,如果只是想要一個通用音色,訓練資料就要確保來自可商用、可追溯的來源。
可識別性這條線要當作紅線而不是參考值。鑑定結論中的90%相似度是本案例的認定基礎,但法院並沒有給出一個固定的數值門檻。這意味著任何接近特定自然人聲音特徵的生成結果,都需要謹慎評估。
王女士的案子賠了5萬元。相比求償的30萬元,這個數字不高。但它的意義不在這個案子裡,而在於之後所有人做AI語音時的預設假設都變了。
相關文章
DeepSeek 正募集 120 億美元,並打造 16 萬顆晶片的華為叢集
中國 AI 目前最大的一筆單一押注押在國產晶片上,而下注的是在開放模型領域最具公信力的實驗室。
資金正流向實體 AI:SiMa.ai 的 14.5 億美元,以及設計硬體的代理
資金比證據更早到位。未來一年的實際部署,將說明這個賭注是否正確。
亞利桑那州法院撤銷一項量刑,因AI影片替受害者發聲
重現一個人的所作所為是一回事。代替他們發言則是另一回事,而兩者之間的界線如今已寫入法院紀錄。
OpenAI 將在歐盟為 ChatGPT 文字加上浮水印。自家數據顯示這有多脆弱
一個例行改寫就能抹除的標記,或許滿足了第 50 條的字面要求,卻未能達成該條文立意的任務。