6개 신문사, 훈련 데이터셋의 유료 기사 문제로 마이크로소프트·OpenAI 제소

10월 2일, 6개 출판사가 미국 미시시피주 남부지방법원에 마이크로소프트와 10개 OpenAI 법인을 상대로 소송을 제기했습니다. 소장은 GPT 모델 개발 과정에서의 저작권 침해와 저작권 관리 정보 제거를 주장합니다.
원고에는 남부 전역에서 신문과 잡지를 발행하는 에머리히 뉴스페이퍼스(Emmerich Newspapers), 오하이 미디어(Ojai Media), 그리고 여러 쿠프우드(Coopwood) 계열사가 포함됩니다. 피고는 마이크로소프트와 상호 연관된 OpenAI 법인들입니다. 사건은 헨리 트래빌리언 윙게이트(Henry Travillion Wingate) 판사에게 배당됐으며, 사건 기록은 10월 5일 마지막으로 갱신되었습니다.
소장이 실제로 주장하는 내용
세 가지 주장이 핵심적인 무게를 지닙니다.
첫째, 소장은 피고들이 유료 장벽(paywall) 뒤의 콘텐츠를 포함해 원고들의 웹사이트를 체계적으로 크롤링하고, 모델이 업데이트될 때마다 기사를 자신들의 서버에 반복적으로 복사했다고 주장합니다. 법적으로 중요한 부분은 반복 복사입니다. 한 번의 크롤링은 한 번의 행위입니다. 훈련 실행마다 코퍼스를 다시 복사하면 침해로 주장되는 복사본의 수가 늘어나고, 이는 책임 노출을 배가시킵니다.
둘째, 원고들은 모델이 암기(memorization)를 보이며 훈련 저작물의 검색 가능한 사본을 인코딩한다고 주장합니다. 이 주장은 훈련이 있었는지가 아니라 결과 모델이 요청 시 보호되는 표현을 재현할 수 있는지를 묻는 일련의 소송과 연결됩니다.
셋째, 소장은 ChatGPT 검색 및 딥 리서치 같은 제품이 원고들의 웹사이트에서 실시간으로 콘텐츠를 검색해 응답에 통합한다고 주장합니다. 이는 훈련과 별개인 검색(retrieval) 계층입니다. 라이선스된 데이터로만 훈련된 모델조차도 답변 시점에 읽도록 라이선스되지 않은 사이트에서 텍스트를 끌어올 수 있습니다.
원고들은 또한 피고들이 기사에서 저자 크레딧, 발행물 이름, 저작권 고지, 이용 약관 정보를 제거했다고 주장합니다. 이는 기저의 복사가 위법했음을 입증할 필요가 없는 저작권 관리 정보 이론에 해당합니다. 미국 법에서 참조된 저작물에서 저작권 고지를 제거하는 행위는 그 자체로 위법입니다.
세 가지 청구는 직접 저작권 침해, 저작권 관리 정보 제거, 기사의 고의적 도용입니다.
유료 장벽 세부 사항이 중요한 이유
유료 장벽 주장은 소장에서 가장 날카로운 부분이며, 저작권이 있는 텍스트로 훈련하는 것이 공정 이용인지라는 일반적 질문과 분리해 볼 가치가 있는 세부 사항입니다.
유료 장벽 뒤의 콘텐츠는 개방된 웹 밖에 있습니다. 이는 대개 유료 결제를 조건으로 접근을 제한하는 약관에 따라 게시되며, 그 약관은 보통 자동 수집을 금지합니다. 유료 장벽을 넘어서는 크롤링은 어떤 페이지가 공개적이었는지에 대한 착오라기보다 접근 조건 자체를 우회하는 것입니다.
그러한 구도는 데이터 소유자들이 소송을 벌이는 방식의 더 넓은 변화와 맞물립니다. 싸움은 복사가 보호되는지에서 수집 방식이 발행자가 설정한 접근 조건을 존중했는지로 옮겨가고 있습니다. 계약과 접근 약관은 저작권만으로는 할 수 없는 역할을 하고 있습니다.

더 넓은 패턴 속에서 이 사건의 위치
이 사건은 저작권 및 접근 관련 소송이 빽빽하게 이어지는 흐름에 합류합니다. 레딧이 앤스로픽을 상대로 한 계약 청구는 진행 중이며, 플랫폼이 저작권법 밖에서 데이터 수집에 이의를 제기할 경로를 제공합니다. 앤스로픽은 호주 의회에 제출한 자료에서 권리자가 robots.txt를 통해 옵트아웃할 수 있게 하는 훈련에 대한 "좁은 형태의 조건부 승인"을 제안했는데, 호주 공영 방송사들은 이 메커니즘이 일상적으로 우회된다며 거부했습니다.
이들 사건 전반에서 동일한 기술적 사실이 계속 등장합니다. 문서화된 테스트에서 주요 크롤러들이 robots.txt 신호를 무시했습니다. 유료 장벽 콘텐츠가 수집된 것으로 보입니다. 검색 기능은 발행자가 라이선스한 적이 없는 경우에도 답변에 발행자 텍스트를 노출합니다.
이 사건의 발행사들은 아카이브가 실제 가치를 지니지만 법률 예산은 크지 않은 지역 및 지방 매체입니다. 바로 그렇기 때문에 이 사건을 지켜볼 가치가 있습니다. 대형 법률팀을 갖춘 대형 발행사의 승리는 법을 시험합니다. 지역 신문사가 제기한 사건은 수년간의 증거 개시 절차를 감당할 수 없는 권리자들이 구제 수단을 실제로 사용할 수 있는지를 시험합니다.
판결이 바꿀 수 있는 것
결과는 법원이 2년 동안 결론을 내리지 못하고 맴돌아온 질문들에 달려 있습니다. 저작권이 있는 텍스트로 훈련하는 것은 공정 이용인가, 그리고 텍스트가 유료 장벽 뒤에 있었을 때 답이 달라지는가? 암기는 훈련상의 이용을 침해적 복제로 바꾸는가? 실시간 검색은 훈련과 별개의 책임을 발생시키는가? 그리고 데이터셋에 등장하는 저작물에서 저작권 고지를 제거하는 것은 복사 자체가 허용되더라도 위법으로 간주되는가?
이 중 어느 것도 해결되지 않았습니다. 소장이 하는 일은 네 가지 질문을 단일한 사실관계에 묶어 지방법원 앞에 제시하는 것입니다. 공개 웹 콘텐츠 위에 제품을 만드는 사람이라면 이 조합을 주시해야 합니다. 답은 곧 나오지 않을 것이며, 먼저 크롤링하고 나중에 협상하는 업계의 현재 관행이 바로 이 소송이 시험하는 대상입니다.
지역 발행사들이 다른 성격의 사건을 제기하는 이유
원고의 정체성은 지난 몇 년간의 대형 발행사 사건들과는 다른 방식으로 소송의 성격을 형성합니다.
뉴욕타임스 사건과 그 이전의 음악 산업 소송들은 수십 년간의 상업적 라이선스 수익을 가리킬 수 있는 기업 아카이브를 활용했습니다. 이들은 시장이 존재했고 그것이 대체되었다고 주장할 수 있었습니다. 지역 신문사 그룹은 다른 증거적 입장을 가져옵니다. 이들의 아카이브는 더 작고, 라이선스 이력은 더 얕으며, 청구는 복사 자체와 저작권 정보 제거에 더 직접적으로 기대고 있습니다.
이는 구제 수단에 중요합니다. 원고들이 저작권 관리 정보 청구에서 승소하면, 기저의 복사가 다투어지는 경우에도 구제 수단을 이용할 수 있습니다. 왜냐하면 고지 제거는 그 자체로 독립적인 위법이기 때문입니다. 긴 라이선스 이력이 없는 원고에게 그 청구는 더 다루기 쉬운 경로입니다.
별도의 책임 노출로서의 검색 계층
ChatGPT 검색 및 딥 리서치에 관한 주장은 다른 종류의 책임을 가리키므로 훈련 문제와 분리해 볼 가치가 있습니다.
훈련은 코퍼스가 몇 번 재구축되든 일회성 행위입니다. 검색은 사용자가 질문하는 순간마다 모든 쿼리에서 발생합니다. 제품이 발행자 사이트에서 실시간으로 텍스트를 검색해 응답에 통합한다면, 침해로 주장되는 행위는 지속적이고 사용자에 의해 촉발됩니다.
그 구분은 원고들에게 훈련에 관한 공정 이용 논쟁에서 이기는 데 의존하지 않는 청구를 부여합니다. 전적으로 라이선스된 데이터로 훈련된 모델조차도 검색 기능을 통해 한 번도 라이선스하지 않은 출처의 텍스트를 노출할 수 있습니다. 소장의 구성은 검색과 훈련을 두 개의 별도 불법 행위로 취급하는데, 이는 모든 것을 훈련 코퍼스에 묶는 것보다 더 강한 구조입니다.
발행사들이 주시하는 것
두 가지 신호가 업계에 이런 종류의 사건을 대규모로 제기할 가치가 있는지 알려줄 것입니다.
첫 번째는 법원이 저작권 관리 정보 청구를 각하 신청에서 살아남도록 허용하는지입니다. 그 청구는 공정 이용을 해결할 필요가 없으므로, 원고들에게 유리한 판결이 나오면 발행사들은 완전한 침해 재판보다 더 빠른 구제 경로를 얻게 됩니다.
두 번째는 증거 개시가 훈련 파이프라인까지 미치는지입니다. 원고들이 무엇이 언제 크롤링되었는지에 관한 기록을 강제로 제출하게 할 수 있다면, 사건은 공정 이용에 관한 법적 논쟁에서 크롤러가 실제로 무엇을 했는지, 유료 장벽을 넘어섰는지를 포함한 사실적 논쟁으로 바뀝니다. 출판 쪽 실무자들은 바로 그런 종류의 명령을 사건 기록에서 주시하고 있습니다. 왜냐하면 그것은 자신들의 소송을 제기하기 전에 어떤 증거를 확보할 수 있는지 알려줄 것이기 때문입니다.
관련 글
인도는 자체 AI 안전 규칙을 쓰고 있으며, 워싱턴의 규칙을 그대로 따르지 않는다
영어로만 테스트하면 포괄한다고 주장하는 대부분의 배포에 대해 아무것도 보증하지 못하는 프레임워크가 된다.
Tavus Griffin, 인간으로 통과한 비율 48%, 그리고 회사는 이를 출시하지 않는다
미리 녹화된 가짜는 준비된 질문에만 답한다. 실시간 시스템은 어떤 질문이든 답한다.
Anthropic, 129,000개의 취약점을 발견한 뒤 문을 더 좁혔다
보안 시연의 정점에 있던 회사가 바로 그 순간 접근을 더 제한하기로 했고, 그 이유는 모순되지 않는다.
여성복 상세 페이지에 진짜 사람이 없다: AI 모델이 이커머스 신뢰를 벼랑 끝으로 밀었다
이미지를 믿을 수 없으니 반품률이 오르고, 반품률이 오르니 판매자는 촬영 비용을 더 압축하며, 비용을 압축하니 이미지는 더 믿을 수 없게 된다. 이 고리는 기술 문제가 아니라 인센티브 구조가 망가진 것이다.