← 返回部落格
News預計閱讀 11 分鐘

robots.txt 是一道紙牆:Reddit 訴 Anthropic 與澳洲的合規聽證會

發布於 2026年10月7日
robots.txt 是一道紙牆:Reddit 訴 Anthropic 與澳洲的合規聽證會

每個網站都有一個名為 robots.txt 的小型文字檔。它告訴自動化程式可以讀取哪些頁面、哪些頁面不要碰。它是一張貼在未上鎖門上的禮貌告示。告示背後沒有鎖。

請求與執法機制之間的這道落差,如今是兩場不同爭鬥的核心:一場在美國法院,一場在澳洲議會聽證會。兩者從不同角度問同一個問題:當「不要爬取」的訊號被忽視時,它究竟代表什麼?

澳洲:無法真正選擇退出的退出機制

Anthropic 於十月初出席澳洲人工智慧聯合特設委員會。它提出所謂「有條件批准的狹義形式」,用於以本地內容進行 AI 訓練,並讓權利人可透過在 robots.txt 中封鎖爬蟲來選擇退出。該意見書默認接受了澳洲否決廣泛的文本與資料探勘豁免,並提出這種退出機制作為折衷方案。

公共廣播機構並不接受。ABC 內容與法務營運主管 Kate Gilchrist 告訴委員會,著作權制度已經足夠,AI 公司可以就其所需的授權進行協商。她反對這種退出機制的理由是結構性的。她說,廣播機構不可能翻遍整個網際網路,以確保自己在所有相關網站上都已退出:「這根本行不通。」

SBS 在其自身意見書中也提出相同觀點,寫道 robots.txt 訊號經常被繞過,避免不當行為的責任應落在 AI 公司身上。

Gilchrist 所描述的不對稱正是關鍵。權利人必須無限期地辨識、監控並維護每一個可能爬取管道上的退出訊號。AI 公司繞過訊號的技術成本幾乎為零,而且在具體救濟措施出現之前,法律成本也幾乎為零。爬蟲可以改用不同的使用者代理識別碼、透過中介者,或在封鎖設置之前就已收集內容,來忽視 robots.txt。

這種懷疑有文件紀錄佐證。TollBit 是一家在出版商與 AI 公司之間促成授權交易的初創公司,它發現來自多個來源的 AI 代理人都會繞過 robots.txt 協定來取得內容。Business Insider 隨後報導,OpenAI 與 Anthropic 儘管公開聲稱尊重 robots.txt 訊號,卻仍繞過它們。

ABC 自身的立場帶有值得注意的諷刺。2026 年 7 月,該廣播機構選擇 Anthropic 的 Claude 作為其企業 AI 平台,啟動一項有 100 名員工參與的試點計畫,將廣播內容轉換為數位文章,同時卻主張 Anthropic 的產品很可能未經許可就以其內容進行訓練。這兩件事可以同時為真,而這正是重點:在一條戰線上的合作,並不能解決另一條戰線上的問題。

美國:合約路徑

Reddit 對 Anthropic 的案件走的是不同的法律途徑。聯邦法院允許 Reddit 的合約主張繼續進行,這為平台提供了一條在著作權法之外挑戰資料收集的途徑。

這項區別很重要。著作權問的是受保護材料是否被複製,以及是否有抗辯事由適用。合約則問收集者是否接受了關於存取、自動化收集或商業使用的條件。對於價值部分來自其託管但並非完全擁有的材料的平台而言,合約理論是較為可用的那一個。

發回更審的命令並未判定 Anthropic 違反了 Reddit 的協議。它更廣泛的重要性其實更為狹窄:法院將 Reddit 的合約權利視為與著作權權利有本質上的不同,從而使違約理論在正在進行的爭議中得以存續。

當服務條款具有實際分量時,它們就會變成資料治理基礎設施。公司需要證明通知、同意、存取條件,以及收集當下適用的是哪一版本的條款,而不只是政策表面上寫了什麼。訴訟可能取決於在爭議存取期間適用的是哪些條款,以及它們是如何顯示的。

為什麼 robots.txt 從來就守不住

這個檔案有一段被翻轉的歷史。在 1990 年代,robots.txt 主要是為了阻止搜尋引擎過度猛打伺服器而存在。網站競相被索引,因為被索引就意味著有訪客。後來這段關係翻轉了。同一個檔案現在被用來關上一扇門,因為在網路上閱讀的新機器不會把人送回來。

封鎖只對遵守封鎖的爬蟲有效。受敬重的新聞網站中,封鎖 AI 程式的比例從 2023 年 9 月的約 23% 躍升至 2025 年 5 月的近 60%。然而,OpenAI 自家的爬蟲在 2024 年底被觀察到有 42% 的時間忽視這些註記,而更廣泛的測試發現,英國商業網站中有 72% 出現違規。

告示的效力取決於站在它背後的律師有多強,而大多數網站並沒有 Reddit 那種律師。

這對建構者意味著什麼

對打造 AI 系統的公司而言,實際的教訓是盡職調查。當你購買或收集訓練資料時,你需要知道它是否在與來源平台條款相衝突的條件下被蒐集。這把合約溯源與那些本應讓自動化合規成為可能的機器可讀信任訊號連結起來。

令人不安的結論是,這套自願性協定正在它最脆弱的地方受到考驗。Reddit 建立了付費牆、發出法律警告、看著其內容被引用次數在某個競爭對手的答案中增加近 40 倍,然後提起訴訟。告示提出請求。閘門封鎖。只有訴訟能構成威脅。

robots.txt 是否長出牙齒,取決於 Reddit 的合約理論結果如何,以及澳洲是否立法制定救濟措施,而不是依賴一個該國國家廣播機構說行不通的訊號。在那之前,未上鎖門上的那張禮貌告示仍舊只是那樣。

沒人能從外部回答的合規問題

這場辯論之所以不斷回到執法,而不是原則,是有原因的。抽象而言,每個人都同意網站的存取條款應該有意義。分歧在於由誰承擔讓這件事成真的成本。

在 Anthropic 提出的退出模式下,成本落在權利人身上。出版商必須找出有哪些爬蟲正在讀取它的內容、編寫正確的封鎖設定、在新爬蟲出現時保持更新,並監控是否發生違規。那是一項會隨著 AI 公司數量增加而擴大的持續營運負擔,而且當爬蟲忽視封鎖時,它不會產生任何救濟。

在 ABC 主張的許可優先模式下,成本落在 AI 公司身上。它必須辨識自己想用什麼進行訓練、就授權進行協商,並記錄自己獲准使用哪些內容。那是一項熟悉的安排,也是著作權已經支持的模式。

兩塊淺色板子直立在深色石板上,兩者之間有一道細細的光線穿過

這兩種模式把監控成本放在不同各方身上,這是一項具有實務影響力的政策差異,而目前承擔成本的那一方說它負擔不起。這就是為什麼只要哪個司法管轄區試圖就 AI 訓練立法,robots.txt 的辯論就會一再浮現:這項技術標準正被要求去做它從未被設計來做的法律工作。

為什麼技術解方總是力有未逮

即使有一套完美的退出登錄機制,也無法解決根本問題,因為該訊號辨識的是爬蟲,而不是公司。一家公司可以透過中介者爬取、使用不同的使用者代理,或依賴它在任何封鎖設置之前就已收集的內容。

歷史紀錄讓這一點變得具體。GPTBot 直到讓它具商業價值的模型都已經訓練完成之後,才開始正式遵守 robots.txt 指令。事前的封鎖無法撤銷事後的收集,而對某一個識別碼的封鎖,也約束不了一家可以用另一個身分出現的公司。

這就是 ABC 所指出、當它說無法站在權利人一方監管整個網際網路時的落差。這個訊號對發送者而言成本低廉,對接收者而言卻代價高昂,這與有效的合規機制通常的運作方式正好相反。除非忽視這個訊號會附帶某種救濟,否則誘因只會朝著一個方向跑。

相關文章