← 블로그로
News약 13 분 읽기

메타가 도서 소송을 합의했다. 이제 허락에는 가격이 붙는다.

게시일 2026년 10월 7일
메타가 도서 소송을 합의했다. 이제 허락에는 가격이 붙는다.

메타가 자사 Llama 모델을 불법 복제 도서로 학습시켰다는 집단 소송을 합의하기로 했다. 제안된 합의안은 9월 말 연방법원에 제출됐고, 며칠 뒤 권리자들에게 통지가 발송됐다. 재정 조건은 판사가 승인할 때까지 봉인되어 있으며, 메타는 여전히 공개적으로 자사의 학습 관행이 공정 이용에 해당한다고 주장하고 있다. 이 합의가 말하지 않는 바는 말하는 바 못지않게 많은 것을 시사한다.

이 사건의 핵심은 학습 측면이 아니라 획득 측면이었다. 작가들은 2018년부터 2024년 사이에 LibGen 같은 섀도 라이브러리에서 가져온 저작물로 Llama 모델이 학습됐다고 주장했다. 이 세부 사항이 중요한 이유는 별도의 판결이 이미 이 문제의 한가운데에 선을 그었기 때문이다. Anthropic 사건에서 윌리엄 앨섭 판사는 저작권이 있는 도서로 모델을 학습시키는 것은 합법이지만, 불법 복제본 도서관을 보관하는 것은 합법이 아니라고 판단했다. 그 사건의 제재, 즉 15억 달러 합의금은 학습 자체가 아니라 도서를 어떻게 입수했는지에 따른 것이었다.

두 결과를 함께 읽으면, 규칙은 말하기는 쉽지만 지키며 살기는 어렵다. 적법하게 입수한 책에서 배우는 것은 괜찮다. 불법 복제본으로 코퍼스를 구축하는 것은 안 된다. 15억 달러라는 수치는 작품당 대략 3,000달러로 계산되는데, 이는 모든 연구소가 자신의 위험 노출을 가격으로 매길 수 있는 방법을 제공한다. 불법 복제 사이트에서 코퍼스를 긁어 모았다면, 이제 그 결정이 얼마의 비용을 초래하는지 대략적인 숫자를 갖게 된 셈이다.

옵트아웃은 가격으로 대체되고 있다

더 중요한 변화는 다음에 일어나는 일이다. 이번 달 보도된 별도의 합의는 자발적 옵트아웃 등록 모델을 데이터 사용량에 연동된 의무 라이선스 요금 구조로 대체했다. 그 배경에 있는 논리는 단순하다. 옵트아웃 창구는 문서상으로는 공정해 보였지만 실제로는 실패했다. 개발자들이 제외 목록을 확인하거나 준수하는 경우가 드물었기 때문이다. 분량당 지불하는 방식은 무시하기가 더 어렵다.

이는 전체 협상의 구도를 바꾼다. 옵트아웃 아래에서 권리자가 가진 유일한 지렛대는 거절하고 기대하는 것뿐이었다. 가격이 매겨진 라이선스 아래에서는 허락이 숫자가 붙은 비용 항목이 되고, 논쟁은 AI 기업이 해당 저작물을 사용해도 되는지에서 얼마를 지불해야 하는지로 이동한다. 출판사와 작가에게 이는 아무도 강제하지 않는 기술적 장벽보다 훨씬 나은 위치다.

연구소에 미치는 실질적 영향은 새로운 규정 준수 예산이다. 데이터 출처는 더 이상 엔지니어링 선호 사항이 아니라 법적 요건이 된다. 수 페타바이트 규모 데이터셋 중 단 하나의 코퍼스가 문서화할 수 없는 출처에서 왔다면, 그것은 전체 학습 파이프라인에 특정한 법적 책임을 끌어들인다. 그리고 이런 실패는 보통 제3자 데이터셋이 명확한 출처 표시 없이 결합되는 집계 계층에서 발생한다.

출력 문제는 여전히 미해결이다

학습 데이터는 두 전선 중 하나일 뿐이다. 다른 하나는 모델이 만들어내는 결과물이며, 그쪽은 상황이 덜 정리되어 있다. 뉴욕타임스는 ChatGPT의 출력물이 자사 저널리즘과 경쟁한다고 그럴듯하게 주장하며 OpenAI의 각하 신청을 넘겼다. 이는 시장 대체 이론으로, 획득 이론과는 다른 방향으로 작용한다. 모델이 저작물에서 학습하되 그것을 재현하지 않으면 변형적 이용 주장은 유지된다. 하지만 그 출력물이 시장에서 원작을 대신하면 주장은 약해진다.

각하 신청을 기각하는 것이 책임을 인정하는 것은 아니며, 타임스 사건은 여전히 진행 중이다. 그러나 두 이론이 함께 존재하기 때문에 AI 기업들은 이제 출처와 출력 모니터링을 하나의 문제로 취급한다. 라이선스된 데이터로 학습한 모델도 원본과 경쟁하는 결과물을 생성할 수 있으며, 라이선스 조건은 점점 더 무엇을 해서는 안 되는지 명시하고 있다.

오디오는 같은 길을 따르지 않는다

도서 출판사들이 라이선스 시장으로 향하고 있다면, 음악은 더 혼란스러운 쪽으로 향하고 있다. Suno는 저작권이 있는 녹음물과 작곡의 사용과 관련해 공연권 단체인 GEMA가 독일에서 제기한 소송에서 패소했다. 미국의 텍스트 사건들은 대체로 지급금과 소급 라이선스로 귀결되고 있다. 오디오 사건들은 금지 명령과 관할권 다툼을 낳고 있는데, 제품 회사에게 이는 더 나쁜 결과다. 금지 명령은 서비스에 세금을 매기는 것이 아니라 서비스를 중단시키기 때문이다.

차이는 결국 출력물이 입력물에 얼마나 가까이 있는지로 귀결되는 듯하다. 책을 요약하는 언어 모델은 텍스트에서 한 단계 떨어져 있다. 아티스트의 스타일로 곡을 생성하는 음악 모델은 비교가 즉각적으로 이루어질 만큼 가까이 있어, 법원들은 변형 이론을 확장해 이를 포괄하려는 데 덜 우호적이었다.

가격이 아직 존재하지 않는 곳

작품당 기준은 지금까지 텍스트 현상이며, 그 이유는 인프라에 있다. 도서 출판사에게는 집단 라이선스 기구, 복제권에 관한 수십 년의 판례, 그리고 작품이라는 상당히 명확한 교환 단위가 있다. 그래서 작품당 가격을 정의하기도, 법정에서 다투기도 쉽다.

따뜻한 린넨 표면 위, 단순한 추를 올린 작은 황동 저울 옆에 가지런히 쌓인 빈 크림색 양장본 책들.

이미지, 비디오, 코드에는 같은 구조가 없다. 스톡 사진 라이브러리는 이미지당 라이선스 가격을 매길 수 있지만, 웹페이지 스크린샷 하나에는 수십 개의 저작권 요소가 한꺼번에 들어 있고, 코드 저장소는 라이선스가 있는 파일, 허용적 라이선스 파일, 출처를 알 수 없는 파일을 같은 트리에 섞어 놓는다. 질문이 텍스트에서 이들 중 하나로 옮겨가면 작품당 공식은 더 이상 적용되지 않고, 논쟁은 공정 이용으로 돌아간다. AI 기업들이 더 선호하는 싸움터다.

또 다른 미해결 질문은 누가 징수하느냐이다. 아무도 관리하지 않는 라이선스 요금은 결국 집단 소송으로 이어진다. 이번 달 보도된 합의 구조들은 여전히 공표된 요율이 있는 상시 시장이 아니라 사안별로 협상된 지급을 설명한다. 요율이 공개되기 전까지 모든 협상은 비공개로 이루어지고, 가장 큰 구매자들이 최상의 조건을 얻는다. 이는 형성되었지만 아직 성숙하지 않은 시장의 모습이다.

이 모델 위에 구축한다면 이것이 의미하는 것

이 글을 읽는 대부분의 개발자는 파운데이션 모델을 학습시키지 않으므로 직접적인 위험 노출은 낮다. 그러나 간접적인 노출은 낮지 않다. 8자리와 9자리 합의금을 흡수하는 연구소들은 비용을 전가하며, 그 메커니즘은 API 가격이다. 향후 1~2년간 모델 접근 비용이 상승할 것으로 예산을 잡아야 한다. 특히 라이선스된 자료로 학습한 모델의 경우, 이제 라이선스 자체가 상품 원가의 일부다.

AI 워크로드를 호스팅하거나 운영하는 사람에게는 더 조용한 두 번째 함의가 있다. 고객을 위해 학습 데이터셋을 저장한다면, 이제 법적 위험은 고객이 그 파일로 무엇을 하는지가 아니라, 그 파일이 어디에서 왔는지에 달려 있다. 명확한 출처 문서화는 더 이상 간접비가 아니라, 8자리 판결금이 당신이 운영하는 시스템에 떨어지지 않게 막아 주는 것이 된다.

미정인 부분은 이 가격 모델이 얼마나 멀리 퍼지는가이다. 텍스트 출판사들은 집단 라이선스 인프라와 가리킬 수 있는 확립된 판례들이 있다. 음악은 단체들이 있지만 출력물 관계가 다르다. 이미지, 비디오, 코드는 각자 다른 역학을 가지고 있으며, 아직 어느 것도 작품당 기준을 갖지 못했다. 메타의 합의는 지도에서 이정표 하나를 지웠다. 나머지 지도를 그려 주지는 않으며, 앞으로의 몇몇 합의가 허락이 시장이 될지, 아니면 일련의 예외로 남을지를 결정할 것이다.

관련 글