robots.txt 是一堵纸墙:Reddit 诉 Anthropic 与澳大利亚合规听证会

每个网站都有一个名为 robots.txt 的小型文本文件。它告诉自动化程序可以读取哪些页面、哪些页面不要碰。它就像贴在一扇未上锁的门上的礼貌告示。告示背后并没有锁。
请求与执行机制之间的这一缺口,如今成为两场独立争斗的核心:一场在美国法院,一场在澳大利亚议会听证会。两者从不同角度提出同一个问题:当“禁止抓取”信号被无视时,它究竟意味着什么?
澳大利亚:无法真正退出的退出机制
Anthropic 于 10 月初出席了澳大利亚人工智能联合专责委员会。它提出了一种所谓的“窄范围有条件批准”,用于在本地内容上训练 AI,并让权利持有人通过在 robots.txt 中屏蔽爬虫来退出。其提交材料含蓄地接受了澳大利亚对广泛文本与数据挖掘豁免的拒绝,并将这种退出机制作为折中方案。
公共广播机构并不接受。ABC 的内容与法律运营主管凯特·吉尔克里斯特告诉委员会,版权体系已经足够,AI 公司可以就其所需许可进行谈判。她对退出机制的反对是结构性的。她说,该广播机构无法搜遍整个互联网来确保自己在所有相关网站上都已退出:“这根本行不通。”
SBS 在其提交材料中也提出同样观点,写道 robots.txt 信号经常被绕过,避免不当行为的责任应当落在 AI 公司身上。
吉尔克里斯特所描述的不对称才是关键。权利持有人必须无限期地识别、监控并维护所有可能抓取渠道上的退出信号。AI 公司绕过信号的技术成本几乎为零,而且在存在具体救济措施之前,法律成本也几乎为零。爬虫可以通过使用不同的用户代理标识、通过中介,或利用在屏蔽设置之前就已收集的内容,来无视 robots.txt。
这种怀疑有据可查。TollBit 是一家为出版商与 AI 公司撮合许可交易的初创公司,它发现来自多个来源的 AI 智能体绕过 robots.txt 协议来获取内容。Business Insider 随后报道称,OpenAI 和 Anthropic 绕过了 robots.txt 信号,尽管它们公开声称尊重这些信号。
ABC 自身的立场带有一种值得注意的讽刺。2026 年 7 月,该广播机构选择 Anthropic 的 Claude 作为其企业 AI 平台,启动了一项 100 名员工的试点,将广播内容转换为数字文章,同时却主张 Anthropic 的产品很可能未经许可使用其内容进行训练。这两件事可以同时为真,而这正是要点:在一个领域的合作并不能解决另一个领域的问题。
美国:合同路径
Reddit 对 Anthropic 的案件走的是不同的法律路径。一家联邦法院允许 Reddit 的合同主张继续进行,这为平台提供了一条在版权法之外挑战数据收集的途径。
这一区别很重要。版权问的是受保护材料是否被复制,以及是否有抗辩理由适用。合同问的是收集者是否接受了围绕访问、自动收集或商业使用的条件。对于价值部分存在于其托管但并不完全拥有的材料的平台而言,合同理论是更可用的那一种。
发回重审令并未裁定 Anthropic 违反了 Reddit 的协议。其更广泛的重要性其实更窄:法院将 Reddit 的合同权利视为与版权权利有性质上的不同,从而使违约理论在正在进行的争议中得以存续。
当服务条款具有实际分量时,它们就变成了数据治理基础设施。公司需要证明通知、同意、访问条件以及收集时相关版本条款,而不仅仅是政策表面所陈述的内容。诉讼可能取决于争议访问期间适用的是哪些条款,以及这些条款是如何展示的。
为什么 robots.txt 从来就守不住
这个文件的历史发生了反转。20 世纪 90 年代,robots.txt 主要用于阻止搜索引擎过度冲击服务器。网站争相被索引,因为被索引意味着访客。此后关系发生了翻转。如今,同一个文件被用来关门,因为读取网络的新机器不会把任何人送回来。
屏蔽只对遵守屏蔽的爬虫有效。受尊敬的新闻网站中屏蔽 AI 程序的比例从 2023 年 9 月的约 23% 跃升至 2025 年 5 月的近 60%。然而,OpenAI 自己的爬虫在 2024 年底被观察到有 42% 的时间无视这些说明,更广泛的测试发现英国商业网站中有 72% 存在违规。
告示的力量取决于站在它身后的律师,而大多数网站并没有 Reddit 那样的律师。
这对构建者意味着什么
对于构建 AI 系统的公司来说,实际教训是尽职调查。当你购买或收集训练数据时,你需要知道这些数据是否是在与来源平台条款相冲突的条件下收集的。这将合同来源与那些本应使自动合规成为可能的机器可读信任信号联系起来。
令人不安的结论是,这套自愿协议恰恰在它最薄弱的地方受到考验。Reddit 建起付费墙,发出法律警告,眼看着其内容在某个竞争对手的回答中被引用次数增长近 40 倍,然后提起了诉讼。告示提出请求。门禁进行阻拦。只有诉讼才构成威胁。
robots.txt 是否会长出牙齿,取决于 Reddit 的合同理论进展如何,以及澳大利亚是否会立法规定救济措施,而不是依赖一种其本国国家广播机构都说行不通的信号。在那之前,未上锁门上的礼貌告示仍然只是告示。
无人能从外部回答的合规问题
这场辩论之所以不断回到执行而非原则,是有原因的。抽象地说,每个人都同意网站的访问条款应当有意义。分歧在于谁承担让这一点成真的成本。
在 Anthropic 提出的退出模式下,成本落在权利持有人身上。出版商必须发现哪些爬虫在读取其内容,编码正确的屏蔽规则,随着新爬虫出现保持更新,并监控违规行为。这是一种持续存在的运营负担,会随着 AI 公司数量增加而扩大,而且当爬虫无视屏蔽时,它并不能提供任何救济。
在 ABC 主张的“许可优先”模式下,成本落在 AI 公司身上。它必须确定自己想要训练什么,谈判取得许可,并保存获准使用内容的记录。这是一种熟悉的安排,也是版权已经支持的安排。

这两种模式将监控成本置于不同方身上,这是一种具有实际锋芒的政策差异,而目前承担成本的一方表示自己负担不起。这就是为什么 robots.txt 辩论在每一个试图立法规范 AI 训练的司法管辖区不断重现:人们要求这一技术标准去做它从未被设计来承担的法律工作。
为什么技术修复总是力不从心
即使有一个完美的退出登记处,也无法解决根本问题,因为该信号识别的是爬虫,而不是公司。一家公司可以通过中介抓取、使用不同的用户代理,或依赖在任何屏蔽设置之前就已收集的内容。
历史记录让这一点变得具体。GPTBot 直到那些使其具有商业价值的模型已经训练完成之后,才开始正式遵守 robots.txt 指令。前瞻性的屏蔽无法撤销追溯性的收集,而对一个标识符的屏蔽也无法约束一家可以换一个身份出现的公司。
这正是 ABC 所指出的缺口:它说自己无法站在权利持有人一边监管整个互联网。这一信号对发送者成本低廉,对接收者却代价高昂,这与有效合规机制通常的运作方式相反。除非无视信号会带来救济后果,否则激励只会朝一个方向运行。
相关文章
女装详情页里没有真人:AI模特把电商信任推到了悬崖边
图不可信所以退货率上升,退货率上升所以商家更压缩拍摄成本,压缩成本又让图更不可信。这个圈不是技术问题,是激励结构坏了。
孟买高等法院给AI深伪划界:18名被告、约翰·多伊令与人格权三分法
这份禁令的分量不在赔偿金额,而在它搭建的框架:把人格权拆成三条独立主张,让原告不必先证明自己损失了多少钱。
DeepSeek 正筹集 120 亿美元,并建设拥有 16 万颗芯片的华为集群
当前中国 AI 领域最大的单笔押注,押在国产芯片上,由在开放模型方面最具公信力的实验室做出。
上海首例AI声音侵权二审落锤:可识别性成为标尺,平台赔5万
当拆解一段声音比获得一段声音更便宜,能证明相似度到了哪一档的鉴定意见,就成了一切争议的起点。