第九巡迴法院:Copilot 的輸出並非遭剝除標示的複製品

一個聯邦上訴法院給了 GitHub 與 OpenAI 一場狹窄但影響深遠的勝利,並藉此劃下一條界線,凡是拿他人作品訓練模型的公司都應仔細解讀。
本案是 Doe v. GitHub。原告是匿名程式設計師,他們依據要求姓名標示的授權條款發布開源程式碼。被告是 GitHub、其母公司 Microsoft,以及 OpenAI 旗下實體。系爭產品是 GitHub、Copilot 與 OpenAI Codex,全都以公開儲存庫訓練。
原告依《數位千禧年著作權法》(DMCA)提出兩項理論,兩者都以第 1202 條為基礎;該條禁止移除或變更著作權管理資訊。第一項是輸入理論:被告在將原告程式碼餵入 Copilot 作為訓練資料之前,先移除了其中的姓名標示資料。第二項是輸出理論:Copilot 有時會回傳已記憶的訓練資料,卻未附上原始碼的姓名標示,而這麼做等同於移除或變更該資訊。

輸入理論從未進入辯論
第九巡迴法院拒絕處理訓練階段的主張,而箇中原因值得注意。在下級法院,原告律師讓步承認,複製訓練資料「或許」並未違反授權條款,而地方法院也明言該起訴「並非關於訓練」。原告並未提出異議。到了上訴階段,合議庭將該理論視為已失權。
這項失權的重要性比表面看來更大。訓練階段的問題,正是會觸及每一個以爬取或授權資料訓練之模型的問題。原告因為程序上的讓步、而非實體理由而輸掉這點,等於讓最大的問題保持開放,並留待另一件案件處理。
輸出理論為何失敗
在實體審理上,法院依賴原告自己對 Copilot 運作方式的描述,駁回了輸出理論。起訴書描述了一套「複雜的機率過程」,會推論統計模式並預測最可能的接續內容。合議庭結論認為,這描述的是生成,而非檢索;而生成的作品「無法合理地被描述為」受保護程式碼的「複製品」。
法院將 Copilot 與搜尋引擎對比。搜尋引擎檢索的是儲存的複製品,因此它有一個可從中移除姓名標示的副本。依法院的解讀,預測下一個符元的模型並不持有這樣的副本。
接著,合議庭處理所謂的「同一性」要件,而它在這裡做的事,未來數年將被引用於書狀之中。它拒絕將同一性視為第 1202 條主張的獨立要件。相反地,它將同一性描述為對法條文字「移除」、「變更」與「複製品」的註解,並且是證據,而非一項檢驗標準。幾近相同的重製而未附姓名標示,支持推論姓名標示遭移除。重大差異則指向另一方向,亦即這是一件從未附上姓名標示的新作品。
這項裁決實際改變了什麼
實際效果是限縮,而非解脫。原本希望 DMCA 能讓他們繞過合理使用與實質相似等較困難問題的著作權人,現在必須走漫長的路。
法院自身的論述框架指出了下一波戰場所在。著作權人將更用力倚賴訓練階段理論,主張姓名標示在資料進入模型之前就已被剝除。他們也會繼續推動關於輸出的通常侵權主張;在那裡,檢驗標準是與受保護作品的相似性,而不是姓名標示中介資料的運作機制。
還有第二種值得記住的解讀。合議庭謹慎表示,同一性是證據,而非要件。這給了著作權人一條路:建立一份輸出紀錄,顯示這些輸出幾近逐字重製受保護程式碼,且未附姓名標示,如此便能使用該推論。模型究竟是記住了,還是泛化了,如今部分取決於輸出落點有多接近,以及原告能證明到什麼程度。
問題的更大輪廓
退一步看,這起案件與其說是對 AI 的判決,不如說是一個法律體系正以不均勻步伐追趕的縮影。姓名標示從來就不是為了在機率模型下存續而設計。著作權管理資訊預設了一個附有中介資料的副本。當系統透過統計過程產出新東西時,並不存在一個可供中介資料被剝除的副本。
這是有關技術形態的論點,也是每一場舊分類不合用的爭議中都會出現的同一套論點。第九巡迴法院選擇按法條文字的字面意義解讀,而非加以延伸;這有其正當性,卻也讓底層的緊張關係原封不動。
對開發者而言,重點並不光鮮。DMCA 這面盾牌比一些人原本希望的更弱,但它並未消失。對原告而言,重點是你在地方法院讓步的理論,就是你在上訴時輸掉的理論。而對每個以公開程式碼訓練模型的人來說,更持久的警示來自法院自身的邏輯:你的輸出愈接近某個特定輸入,「新作品」這個框架就愈站不住腳。
以他人程式碼來運行模型,代表什麼
對任何維護開源專案的人來說,實際的解讀比新聞標題所暗示的更狹窄。DMCA 的姓名標示途徑如今更難走,但底層的授權義務並沒有改變。如果你的程式碼是 MIT 或 Apache 授權,一個記住了它並在未附聲明的情況下重製它的模型,仍然構成授權問題,而法院自身的推理也指出了該如何證明。
這種不安也存在於另一方向。這項裁決依賴的是將 Copilot 描述為機率生成器,而非檢索系統。這樣的描述對大多數提示與大多數輸出而言是準確的。但對長尾情況就較不準確:模型幾乎精確地重製一段長而獨特的段落;而原告若要建立紀錄,正是必須圍繞這種長尾情況。法院並未對那樣的案件關上大門,而是讓紀錄本身成為全部的論證。
這對工具開發也有實際後果。地方法院提到 GitHub 自家的重複偵測篩選器,該篩選器會標記 150 字元的相符內容,這如今已成為上訴紀錄的一部分。已經在衡量輸出與訓練資料有多接近的系統,正是最有能力回答法院未解問題的系統;這暗示合規基礎設施與訴訟策略指向同一個方向。
仍在進行中的案件
這項裁決出現在一個案件擁擠的領域。Thomson Reuters 於九月在第三巡迴法院贏得對 Ross Intelligence 的上訴,爭點是合理使用,而非姓名標示中介資料;該裁決很大程度上取決於 Ross 打造了一項產品,與它訓練所用的資料庫直接競爭。第九巡迴法院的 Copilot 裁決與第三巡迴法院的 Westlaw 裁決回答的是不同問題,彼此互不拘束。
這種分歧就是 2026 年 AI 著作權法的現狀。法院以巡迴法院為單位、一點一滴地解決送到面前的片段,而且事實往往不易一般化。一項關於法律研究工具的裁決,對程式碼助理沒什麼說明力;一項關於姓名標示中介資料的裁決,對合理使用也沒什麼說明力。任何等待單一判決來解決這個問題的人,等的是一件制度結構不會產出的事情。
這項裁決窄化了一條路,同時讓其他幾條路保持開放。此刻,大多數這些 AI 著作權問題就是這樣被解決的:一次一小塊,由剛好最先到達那裡的那個案件來處理。