상하이 첫 AI 음성 침해 2심 판결 확정: 식별 가능성이 기준이 되다, 플랫폼 5만 위안 배상

--- title: 상하이 첫 AI 음성 침해 2심 판결 확정: 식별 가능성이 기준이 되다, 플랫폼 5만 위안 배상 meta_title: AI 음성 침해는 어떻게 판단하나? 상하이 첫 2심이 제시한 기준 meta_description: 상하이 제1중급인민법원 2심은 원심을 유지했다. 성우의 음성이 AI로 합성돼 홍보에 사용됐고, 플랫폼은 5만 위안을 배상한다. 법원은 식별 가능성을 음성 침해의 핵심 기준으로 확립했다. ---
성우 왕(王) 씨는 친구의 알림을 받고서야 문제를 발견했다. 누군가 그녀에게 한 앱의 신규 유치 프로모션 활동에서 쓰인 음성이 그녀와 매우 비슷하다고 알려준 것이다.
그녀는 확인에 나서 해당 오디오가 AI로 합성된 것일 가능성이 크다고 판단했다. 이어 공증으로 증거를 고정한 뒤 운영사를 상대로 소송을 제기해 30만 위안의 배상을 청구했다. 사건은 상하이시 제1중급인민법원까지 올라갔고, 종심 판결은 원심을 유지했다. 플랫폼의 음성 침해가 성립하며 5만 위안을 배상하라는 것이었다.
이는 상하이에서 AI 합성 음성으로 인해 발생한 첫 음성 권익 보호 분쟁 사건이다. 이를 따로 꺼내 말할 가치가 있는 이유는 배상 금액과 무관하다. 법원이 하나의 문제를 명확히 정리했기 때문이다. AI가 한 사람의 음성을 모방하는 것이 어떤 조건에서 침해로 인정되는가 하는 문제다.
사건 속 세 가지 핵심 사실
첫째, 피고는 해당 오디오가 AI로 생성된 것임을 인정했지만, 소재가 어디서 왔는지는 설명하지 못했다.
A사의 답변은 이러했다. 사건 관련 오디오가 확실히 회사가 개발한 AI로 생성된 것은 맞지만, 구체적인 출처와 학습에 투입된 소재는 전 직원이 퇴사해 확인할 수 없다는 것이다. 회사는 이전에 왕 씨가 성우라는 사실도 알지 못했으며, 그녀의 음성을 수집하거나 사용한 적이 없다.
둘째, 감정 의견이 정량적 결과를 제시했다.
왕 씨는 사법 감정을 신청해 공증된 오디오와 현장에서 채취한 본인 음성을 대조했다. 28개의 포먼트 음향 지표 가운데 24개의 편차가 10% 미만이었고, 그중 16개는 5.36% 미만이었다. 두 음성이 다소 유사하거나 매우 유사한 부분이 90%에 달했다.
셋째, 법원은 입증 책임을 훈련 데이터를 보유한 플랫폼에 지웠다.
상하이 제1중급인민법원은 A사가 원시 훈련 데이터를 보유한 통제 주체로서, 학습 소재 출처의 적법성, 자연인 음성 특징을 이용하지 않았다는 점, 대중의 혼동·오인을 초래하지 않았다는 점 등을 충분히 입증하지 못했으므로 입증 실패의 불이익을 부담해야 한다고 판단했다.
법원이 확립한 규칙: 기술 출처가 아니라 식별 가능성을 본다
이 사건의 핵심 판결 요지는 한 문장으로 정리된다. 자연인의 동의 없이 그 자연인의 음성을 훈련 말뭉치로 사용하고, 그 자연인의 음색·억양·발음 스타일을 모방해 해당 자연인을 식별할 수 있는 합성 음성을 생성했다면, 자연인의 음성 권익을 침해한 것으로 인정해야 한다.
여기에는 두 가지 층위의 의미가 있어 나눠 볼 만하다.
한 층위는 AI 음성 개발자들이 흔히 펴는 변론 논리가 더는 통하지 않는다는 점이다. 누군가는 음성은 알고리즘이 성문(voiceprint)을 재구성한 것으로, 원본 녹음을 직접 복제한 것과는 다르므로 침해가 성립하지 않는다고 말할 수 있다. 법원의 답은 판단 근거가 합성 결과에 있다는 것이다. 즉 그 결과가 일반 사회 대중으로 하여금 특정 신원을 연상하게 할 수 있는지 여부다.
다른 층위는 식별의 문턱이 전문가가 아니라 일반 사회 대중이라는 수준에 놓였다는 점이다. 이 사례의 감정 결과는 '매우 유사'였기에 식별 가능성이 인정됐다. 하지만 이는 유사도가 이 정도에 근접하면 이미 선을 넘는다는 뜻이며, 진짜와 구별할 수 없을 정도가 되어야만 인정되는 것은 아니다.
이 판례는 최고인민법원의 문건과 이어진다
시간선을 길게 늘여 보면, 이 사건은 고립된 판결이 아니다.
9월 7일, 최고인민법원은 《인공지능 관련 분쟁 사건의 법에 따른 심리에 관한 의견》을 발표했고, 제4조는 두 가지를 명확히 했다. 동의 없이 인공지능으로 타인의 성명·초상을 처리해 식별 가능한 가상 디지털 형상을 생성하고 이를 사용·공개하면 성명권, 초상권 등 인격 권익 침해를 구성한다. 동의 없이 타인의 음성을 훈련에 사용하고 그 음색·억양·발음 스타일을 모방해 식별 가능한 합성 음성을 생성하면 음성 권익 침해를 구성한다.
이는 중국에서 최고 국가 심판 기구가 내놓은 첫 인공지능 관련 사법 재판 규칙 문건이다. 그중 가장 무게 있는 대목은 음성이 처음으로 초상과 동등한 보호를 받게 되었고, 식별 가능성이 통일된 침해 인정 기준이 되었다는 점이다.
상하이의 이 사건은 이 의견 이후에 나온 것으로, 종이 위의 규칙을 구체적 사건에 적용한 셈이다. 감정이 90%의 유사도를 제시했고, 법원은 이를 근거로 식별 가능성이 성립한다고 인정했으며, 플랫폼이 소재의 적법한 출처에 대한 증거를 제시하지 못해 배상이 성립했다.
앞서 최고법원이 참고 사례로 든 또 다른 전형적 사례가 있다. 2024년, 쉬저우의 한 문화미디어 회사가 라이브커머스 진행자에게 홍보 영상 제작을 의뢰했는데, 진행자는 가정교육 분야 학자 리(李) 씨의 공개 강연 영상을 사용하고 그녀의 음성과 음색·억양·발음 스타일이 매우 유사한 AI 합성 오디오를 덧입혔다. 베이징 인터넷법원은 2025년 7월 피고에게 사과와 함께 경제적 손실 및 권리 보호를 위한 합리적 비용 12만 위안을 배상하라고 판결했다. 두 사건이 가리키는 논리는 같다. 타인의 초상을 무단 사용하고, 여기에 매우 흡사한 AI 합성 음성을 겹치면 초상권과 음성 권익에 대한 이중 침해를 구성한다.
시장의 반응: 얼굴 바꾸기는 조여졌지만, 음성 복제는 여전히 팔린다
규칙이 시행된 뒤 거래 시장의 반응은 대칭적이지 않다.
언론 보도에 따르면 최고법원 의견 발표 후 일주일 동안 일부 전자상거래 플랫폼에서 검색했을 때 얼굴 바꾸기 서비스는 차단 강도가 커 관련 상품이 검색되지 않았지만, 음성 복제를 검색하면 상품이 여전히 대량으로 판매되고 있었다. 어떤 음성 합성 상품은 33.88위안에 700여 건이 팔렸고, 어떤 음성 모델 대행 학습은 20위안이었으며, 중고 거래 플랫폼에는 8.85위안짜리 음성 복제 서비스가 770여 건 판매된 것으로 표시돼 있었다.
이 비대칭 자체가 하나의 현실을 말해준다. 음성 복제의 진입 장벽은 얼굴 바꾸기보다 훨씬 낮고, 소재 수요도 더 은밀하다. 공개된 성우 작품 한 편, 팟캐스트 한 회, 짧은 영상 하나만으로도 충분히 좋은 훈련 말뭉치가 될 수 있다.
사용자 입장에서 이 사례들이 주는 신호는 명확하다. 첫째, 소재 출처를 설명하지 못하면 면책될 것이라고 기대해서는 안 된다. 훈련 데이터를 보유한 쪽은 입증에서 불리한 위치에 있다. 둘째, 식별 가능성 판단은 기술 감정에 의존하며, 합성 결과가 대중이 특정 개인과 연결할 수 있을 만큼 근접하면 상업적 사용은 침해를 구성한다. 셋째, 배상액은 권리자의 동종 라이선스 사용료를 참조해 정해지므로, AI로 라이선스를 우회해 아낀 비용은 결국 배상의 형태로 되돌려줄 수 있다.
AI 음성 제품을 만드는 팀에게 무엇을 의미하나
이 사건의 판결 논리는 제품 쪽에 몇 가지 직접적인 시사점을 준다.
훈련 데이터의 출처 증명은 문서로 남겨야 한다. 사례에서 가장 치명적이었던 점은 A사가 학습에 투입한 소재의 출처를 설명하지 못했다는 것이다. 음성 복제, 음성 합성, 오디오 콘텐츠 생성을 하는 팀이라면 말뭉치의 라이선스 사슬에 추적 가능한 기록이 있어야 하며, 구두 확인에 의존해서는 안 된다.
음성 특징의 모방은 특정 개인과 분리돼야 한다. 제품이 특정 음색을 생성하려 한다면 라이선스가 사전 조건이지, 사후 구제책이 아니다. 반대로 범용 음색만 원한다면 훈련 데이터가 상업적 이용 가능하고 추적 가능한 출처에서 왔음을 보장해야 한다.
식별 가능성이라는 선은 참고값이 아니라 레드라인으로 삼아야 한다. 감정 결론의 90% 유사도는 이 사례의 인정 근거였지만, 법원이 고정된 수치 기준을 제시한 것은 아니다. 이는 특정 자연인의 음성 특징에 근접하는 모든 생성 결과를 신중하게 평가해야 한다는 뜻이다.
왕 씨의 사건은 5만 위안 배상으로 끝났다. 청구한 30만 위안에 비하면 높은 숫자는 아니다. 그러나 그 의미는 이 사건 안에 있는 것이 아니라, 이후 모든 사람이 AI 음성을 다룰 때의 기본 전제가 달라졌다는 데 있다.
관련 글
딥시크, 120억 달러 조달하고 16만 칩 화웨이 클러스터 구축
현재 중국 AI에서 가장 큰 단일 베팅은 개방형 모델에서 가장 높은 신뢰도를 지닌 연구소가 추진하는 자국산 실리콘이다.
자금이 피지컬 AI로 이동하고 있다: SiMa.ai의 14억 5천만 달러, 그리고 하드웨어를 설계하는 에이전트
자본은 증거보다 앞서 도착하고 있다. 앞으로 1년간의 실제 도입이 그 베팅이 옳았는지를 말해줄 것이다.
애리조나 법원, AI 영상이 피해자를 대신해 발언했다는 이유로 형량 선고를 파기하다
사람이 한 일을 재현하는 것은 한 가지다. 그를 대신해 말하는 것은 또 다른 일이며, 둘 사이의 경계는 이제 법원 기록에 새겨졌다.
OpenAI, EU에서 ChatGPT 텍스트에 워터마크 적용 예정. 자체 수치가 그 취약함을 보여준다
일상적인 바꿔쓰기로 제거될 수 있는 표식은 제50조의 문구는 충족할지 몰라도 그 조항이 하려던 일은 실패할 수 있다.