六家報社就訓練資料集中的付費牆文章控告微軟與 OpenAI

10 月 2 日,六家出版公司在美國密西西比州南區聯邦地方法院對微軟及十個 OpenAI 實體提起訴訟。訴狀指控,在開發 GPT 模型的過程中涉及著作權侵害,以及移除著作權管理資訊。
原告包括 Emmerich Newspapers、Ojai Media,以及數家 Coopwood 旗下公司,這些公司在美國南部各地發行報紙與雜誌。被告為微軟,加上一組彼此關聯的 OpenAI 實體。本案由法官 Henry Travillion Wingate 承審,案件摘要最後更新於 10 月 5 日。
訴狀究竟指控了什麼
有三項指控最具份量。
第一,訴狀稱被告系統性爬取原告網站,包括付費牆後的內容,並在模型更新時反覆將文章複製到自家伺服器。反覆複製在法律上是關鍵所在。單次爬取只是一個行為。每次訓練執行時重新複製語料庫,會使被指控侵權的複製品數量倍增,連帶使風險倍增。
第二,原告主張模型展現出記憶現象,將訓練作品的內容編碼為可提取的副本。這項主張連結到一連串訴訟,其中的問題不在於訓練是否發生,而在於所產出的模型能否按要求重現受保護的表述。
第三,訴狀指稱 ChatGPT Search 與 Deep Research 等產品即時從原告網站檢索內容,並將其納入回應之中。這是檢索層,與訓練分開。即使模型是以取得授權的資料訓練而成,在回答當下仍可能從一個它並未獲授權閱讀的網站抓取文字。
原告也主張,被告從文章中刪除了作者署名、刊物名稱、著作權聲明與使用條款資訊。這對應著作權管理資訊的理論,該理論不須證明底層的複製行為違法。在美國法下,從被引用的作品中移除著作權聲明本身即構成違法。
三項訴因分別為:直接著作權侵害、移除著作權管理資訊,以及故意竊取文章。
為何付費牆這個細節很重要
付費牆的指控是訴狀中最銳利的部分,而這個細節值得與「以受著作權保護的文字進行訓練是否構成合理使用」這個一般性問題分開來看。
付費牆後的內容存在於開放網路之外。它是在附帶條件(通常是付費)的條款下發布,而這些條款一般禁止自動化收集。越過付費牆的爬取,繞過的是取用條件本身,而不是搞錯了哪些頁面屬於公開。
這樣的定調,與資料擁有者提起訴訟方式的整體轉變相符。爭點正從「複製是否受保護」轉向「收集方法是否尊重了出版者設定的取用條件」。契約與取用條款正在發揮著作權法本身無法達成的作用。

本案在更大格局中的位置
本案加入了一連串密集的著作權與取用訴訟。Reddit 對 Anthropic 的契約主張正在進行中,這給了平台一條在著作權法之外挑戰資料收集的途徑。Anthropic 在提交給澳洲國會的意見書中,提議對訓練採取「窄化的有條件核准」,讓權利人得以透過 robots.txt 退出,而澳洲公共廣播機構認為這個機制經常遭到繞過而予以拒絕。
在這些案件中,同樣的技術事實不斷出現。在留有紀錄的測試中,主要爬蟲忽略了 robots.txt 訊號。付費牆內容似乎遭到收集。即使出版者從未授權,檢索功能仍會在回答中呈現出版者的文字。
本案的出版者是區域性與地方性機構,其資料庫具有實質價值,法律預算卻相當有限。這正是本案值得關注的原因。大型出版者有大規模法律團隊,打贏官司是在測試法律。區域報紙提起的訴訟,測試的則是對於負擔不起多年證據開示程序的權利人而言,救濟是否真的可用。
一項裁決可能改變什麼
結果將取決於法院兩年來一直迴避、尚未有定論的問題。以受著作權保護的文字進行訓練是否構成合理使用,而當文字位於付費牆後時,答案是否改變。記憶現象是否會讓訓練使用變成侵權重製。即時檢索是否會在訓練之外另外產生責任。以及,從出現在資料集中的作品移除著作權聲明,即使複製本身被允許,是否仍構成違法。
這些問題沒有一項獲得解決。訴狀所做的,是把這四個問題綁在同一組事實上,送交地方法院審理。對於任何以公開網路內容為基礎打造產品的人來說,這個組合就是該持續追蹤的重點。答案不會很快出現,而業界目前「先爬取、後談判」的慣例,正是這場訴訟所要檢驗的對象。
為何區域性出版者打的是不一樣的官司
原告的身分,以過去幾年大型出版者案件所沒有的方式,形塑了這場訴訟。
《紐約時報》案以及更早的音樂產業訴訟,背後有累積數十年商業授權收入的公司檔案庫可援引。它們能主張市場曾經存在且遭到取代。一群區域報紙則帶來不同的舉證態勢。它們的檔案庫較小,授權歷史較單薄,主張更直接建立在複製行為本身,以及移除著作權資訊之上。
這對救濟方式有影響。若原告在著作權管理資訊這一項訴因上勝訴,即使底層複製行為仍有爭議,救濟仍然可用,因為移除聲明本身即為獨立的違法行為。對於沒有長期授權歷史的原告而言,這項訴因是較可行的一條路。
檢索層是另一項獨立風險
關於 ChatGPT Search 與 Deep Research 的指控,值得與訓練問題分開來看,因為它指向的是另一種責任。
訓練是一次性的行為,無論語料庫重建多少次。檢索則在每一次查詢、使用者提問的當下發生。若產品即時從出版者網站檢索文字並納入回應,被指控侵權的行為便是持續的、由使用者觸發的。
這項區別讓原告得以主張一項不依賴於在訓練合理使用爭議中勝訴的請求。即使模型完全以取得授權的資料訓練,仍可能透過檢索功能,呈現出來自從未授權來源的文字。訴狀的架構將檢索與訓練視為兩種不同的不法行為,這比把所有事情都綁在訓練語料庫上更為有力。
出版者在觀察什麼
兩個訊號將告訴業界,這類案件是否值得大規模提起。
第一,法院是否允許著作權管理資訊的請求通過駁回聲請。這項訴因不須解決合理使用問題,因此原告若在此項獲勝,將為出版者提供一條比完整侵權審判更快的救濟途徑。
第二,證據開示是否能觸及訓練流程。若原告能強制取得關於爬取了什麼、何時爬取的紀錄,本案就會從關於合理使用的法律論辯,轉變為關於爬蟲實際做了什麼的事實論辯,包括它是否越過了付費牆。出版界的從業者正緊盯案件摘要,等待的正是這類命令,因為那會告訴他們,在決定自行提訴之前,能取得什麼樣的證據。