← 블로그로
News약 13 분 읽기

제9순회법원, Copilot 출력물은 출처 정보가 삭제된 복사본이 아니라고 판시

게시일 2026년 10월 4일
제9순회법원, Copilot 출력물은 출처 정보가 삭제된 복사본이 아니라고 판시

연방 항소법원이 GitHub와 OpenAI에 좁지만 중요한 승리를 안겨주었으며, 그 과정에서 다른 사람의 작업물로 모델을 학습시키는 모든 기업이 주의 깊게 읽어야 할 선을 그었다.

이 사건은 Doe v. GitHub이다. 원고들은 출처 표시를 요구하는 라이선스 하에 오픈소스 코드를 공개한 익명 프로그래머들이다. 피고들은 GitHub, 그 모회사인 Microsoft, 그리고 OpenAI 법인들이다. 문제가 된 제품은 GitHub, Copilot, OpenAI Codex이며, 모두 공개 저장소로 학습되었다.

원고들은 디지털 밀레니엄 저작권법(DMCA)에 따라 두 가지 이론을 제기했으며, 둘 다 저작권 관리 정보의 제거 또는 변경을 금지하는 1202조에 근거했다. 첫 번째는 입력 이론으로, 피고들이 원고들의 코드를 Copilot에 학습 데이터로 넣기 전에 출처 데이터를 제거했다는 것이었다. 두 번째는 출력 이론으로, Copilot이 때때로 소스 코드의 출처 표시 없이 암기한 학습 데이터를 반환하며, 그렇게 하는 것이 해당 정보를 제거하거나 변경하는 것에 해당한다는 것이었다.

회색 보관 상자가 놓인 금속 선반이 늘어선 어두운 지하 기록 보관소 통로

입력 이론은 주장되지 않았다

제9순회법원은 학습 단계 주장에 이르지 않았으며, 그 이유는 주목할 만하다. 하급법원에서 원고 측 변호사는 학습 데이터를 복사하는 것이 "아마도" 라이선스를 위반하지 않는다고 인정했고, 지방법원은 소장이 "학습에 관한 것이 아니다"라고 명확히 밝혔다. 원고들은 이의를 제기하지 않았다. 항소심에서 재판부는 해당 이론을 포기된 것으로 취급했다.

그 포기는 보이는 것보다 더 중요하다. 학습 단계 문제는 스크랩되거나 라이선스된 데이터로 학습된 모든 모델에 영향을 미쳤을 문제다. 원고들은 본안이 아닌 절차적 인정으로 그것을 놓침으로써 가장 큰 문제를 열어둔 채 다른 사건으로 넘겼다.

출력 이론이 실패한 이유

본안에서 법원은 원고들이 스스로 설명한 Copilot의 작동 방식을 근거로 출력 이론을 기각했다. 소장은 통계적 패턴을 추론하고 가장 가능성 높은 완성을 예측하는 "복잡한 확률적 과정"을 설명했다. 재판부는 이것이 검색이 아니라 생성을 설명하며, 생성된 작업물은 보호되는 코드의 "복사본으로 합리적으로 설명될 수 없다"고 결론지었다.

법원은 Copilot을 검색 엔진과 대비했다. 검색 엔진은 저장된 복사본을 검색하므로 출처 표시가 제거될 수 있는 복사본을 가지고 있다. 다음 토큰을 예측하는 모델은 법원의 해석에 따르면 그러한 복사본을 보유하지 않는다.

재판부는 이른바 동일성 요건을 다루었고, 여기서 수년간 변론서에 인용될 만한 판단을 내렸다. 재판부는 동일성을 1202조 청구의 별도 요소로 취급하기를 거부했다. 대신 동일성을 법조문의 "제거", "변경", "복사본"이라는 단어에 대한 주석이며 테스트가 아닌 증거로 설명했다. 출처 표시 없는 거의 동일한 재현은 출처가 제거되었다는 추론을 뒷받침한다. 실질적 차이는 반대 방향, 즉 출처가 전혀 부착된 적 없는 새로운 저작물을 가리킨다.

이 판결이 실제로 바꾸는 것

실질적 효과는 면제가 아니라 범위의 축소다. DMCA가 공정 이용과 실질적 유사성이라는 더 어려운 문제를 우회할 지름길을 제공하기를 바랐던 저작권자들은 이제 먼 길을 가야 한다.

법원의 표현 자체가 다음 분쟁의 위치를 가리킨다. 저작권자들은 데이터가 모델에 도달하기 전에 출처 표시가 제거되었다고 주장하며 학습 단계 이론에 더욱 의지할 것이다. 그리고 그들은 출력물에 대한 일반적인 침해 주장을 계속 밀어붙일 것이며, 여기서 기준은 출처 메타데이터의 작동 방식이 아니라 보호되는 저작물과의 유사성이다.

기억해둘 만한 두 번째 해석이 있다. 재판부는 동일성이 요소가 아니라 증거라고 신중히 밝혔다. 이는 저작권자들에게 경로를 제공한다. 보호되는 코드를 거의 그대로 재현하고 출처 표시가 없는 출력물 기록을 구축하면 추론이 가능해진다. 암기한 모델과 일반화한 모델 사이의 경계는 이제 부분적으로 출력물이 얼마나 가깝게 떨어지는지, 그리고 원고가 이를 얼마나 잘 입증할 수 있는지의 문제다.

문제의 더 큰 형태

한 걸음 물러나 보면, 이 사건은 AI에 대한 평결이라기보다 불균등하게 따라잡고 있는 법체계의 스냅샷처럼 보인다. 출처 표시는 확률적 모델을 견디도록 설계된 적이 없다. 저작권 관리 정보는 메타데이터가 부착된 복사본을 전제로 한다. 시스템이 통계적 과정에서 새로운 무언가를 생성할 때, 메타데이터가 제거되었을 복사본은 존재하지 않는다.

이것은 기술의 형태에 관한 주장이며, 오래된 범주가 맞지 않는 모든 분쟁에서 나타나는 동일한 주장이다. 제9순회법원은 법조문의 단어를 확장하기보다 문자 그대로 읽기로 선택했으며, 이는 방어 가능하면서도 근본적인 긴장을 그대로 남겨둔다.

개발자에게 주는 교훈은 화려하지 않다. DMCA는 일부가 바랐던 것보다 약한 방패이지만 사라진 것은 아니다. 원고들에게 주는 교훈은 지방법원에서 인정한 이론이 항소심에서 패하는 이론이라는 점이다. 그리고 공개 코드로 모델을 학습시키는 모든 사람에게 더 오래가는 경고는 법원 자체의 논리에서 나온다. 출력물이 특정 입력에 더 가깝게 떨어질수록 "새로운 저작물"이라는 틀은 덜 유지될 것이다.

다른 사람의 코드로 모델을 실행한다는 것의 의미

오픈소스 프로젝트를 유지하는 사람에게 실질적 해석은 헤드라인이 시사하는 것보다 좁다. DMCA 출처 표시 경로는 이제 더 어렵지만, 근본적인 라이선스 의무는 변하지 않았다. 코드가 MIT 또는 Apache 라이선스라면, 이를 암기하고 고지 없이 재현하는 모델은 여전히 라이선스 문제이며, 법원의 논리 자체가 이를 입증하는 방법을 가리킨다.

불편함은 반대 방향으로도 흐른다. 이 판결은 Copilot을 검색 시스템이 아닌 확률적 생성기로 설명하는 데 의존한다. 그 설명은 대부분의 프롬프트와 대부분의 출력물에 대해 정확하다. 모델이 길고 독특한 구절을 거의 정확히 재현하는 꼬리 부분에서는 덜 정확하며, 원고가 기록을 구축해야 하는 부분이 바로 그 꼬리다. 법원은 그 사건에 대한 문을 닫지 않았다. 기록 자체를 전체 논증으로 만든 것이다.

도구 측면에서도 실질적 결과가 있다. 지방법원이 GitHub 자체의 중복 감지 필터(150자 일치를 표시)를 언급한 것이 이제 항소심 기록의 일부가 되었다. 출력물이 학습 데이터에 얼마나 가깝게 떨어지는지 이미 측정하는 시스템이 법원이 열어둔 질문에 답할 가장 좋은 위치에 있으며, 이는 컴플라이언스 인프라와 소송 전략이 같은 방향을 가리킨다는 것을 시사한다.

아직 진행 중인 사건들

이 결정은 붐비는 분야에 도착했다. Thomson Reuters는 9월 제3순회법원에서 Ross Intelligence에 대한 항소에서 승소했는데, 이는 출처 메타데이터가 아닌 공정 이용 문제에 관한 것이었고, 그 판결은 Ross가 학습에 사용한 바로 그 데이터베이스와 경쟁하는 제품을 만들었다는 사실에 크게 좌우되었다. 제9순회법원의 Copilot 판결과 제3순회법원의 Westlaw 판결은 서로 다른 질문에 답하고 있으며, 어느 쪽도 다른 쪽을 구속하지 않는다.

그러한 차이는 2026년 AI 저작권법의 현주소다. 법원들은 자신에게 도달한 조각들을 순회법원별로 증분적으로 해결하고 있으며, 그 사실들은 잘 일반화되지 않는다. 법률 연구 도구에 관한 판결은 코드 어시스턴트에 대해 거의 말해주지 않으며, 출처 메타데이터에 관한 판결은 공정 이용에 대해 거의 말해주지 않는다. 단일 결정이 문제를 해결해주기를 기다리는 사람은 시스템 구조가 만들어내지 않는 무언가를 기다리는 것이다.

이 결정은 하나의 경로를 좁히고 여러 다른 경로를 열어둔다. 그것이 지금 대부분의 AI 저작권 문제가 해결되는 방식이며, 한 번에 한 조각씩, 먼저 거기에 도달하는 사건에서 해결된다.

관련 글