六家报纸就训练数据中的付费墙文章起诉微软与 OpenAI

10月2日,六家出版公司在密西西比州南区美国联邦地区法院对微软及十个 OpenAI 实体提起诉讼。诉状指控,在 GPT 模型的开发过程中存在版权侵权以及移除版权管理信息的行为。
原告包括 Emmerich Newspapers、Ojai Media 以及多家 Coopwood 公司,这些公司在南方各地出版报纸和杂志。被告为微软以及一组相互关联的 OpenAI 实体。案件已分配给法官 Henry Travillion Wingate,案卷最后更新于 10 月 5 日。
诉状实际指控了什么
有三项指控分量最重。
首先,诉状称被告系统性地抓取了原告网站,包括付费墙后的内容,并在模型更新时反复将文章复制到其服务器上。反复复制在法律上才是关键所在。单次抓取是一个行为。每次训练运行都重新复制语料库,会使被指控侵权的副本数量成倍增加,从而成倍放大风险敞口。
其次,原告主张这些模型表现出记忆化,即编码了训练作品的可检索副本。这一主张与一系列诉讼相关,其中的问题不在于训练是否发生,而在于所得模型能否按需重现受保护的表达。
第三,诉状指控 ChatGPT Search 和 Deep Research 等产品实时从原告网站检索内容,并将其纳入回答。这是检索层,独立于训练。即使模型完全基于已授权数据训练,在回答时也可能从某个它未获许可读取的网站抓取文本。
原告还主张,被告从文章中删除了作者署名、出版物名称、版权声明和使用条款信息。这对应版权管理信息理论,该理论不要求证明底层复制行为违法。从被引用的作品中移除版权声明,根据美国法律本身即构成违规。
三项指控分别是直接版权侵权、移除版权管理信息和故意盗取文章。
为什么付费墙这一细节很重要
付费墙指控是诉状中最尖锐的部分,这一细节值得与“使用受版权保护的文本进行训练是否属于合理使用”这个一般性问题区分开来。
付费墙后的内容处于开放网络之外。它依据对访问设定条件的条款发布,通常以付费为条件,而这些条款通常禁止自动采集。越过付费墙进行抓取,绕开的是访问条件本身,而不是搞错了哪些页面是公开的。
这种定性契合了数据所有者提起诉讼方式的更广泛转变。争论正从复制是否受保护,转向采集方法是否尊重了出版商设定的访问条件。合同与访问条款正在发挥仅靠版权无法发挥的作用。

这如何融入更广泛的格局
这起案件加入了一系列密集的版权与访问诉讼。Reddit 针对 Anthropic 的合同主张正在进行,为平台提供了一条在版权法之外挑战数据采集的路径。Anthropic 在提交给澳大利亚议会的意见中,提议对训练采取“一种狭窄形式的有条件批准”,允许权利持有人通过 robots.txt 选择退出,而澳大利亚公共广播机构认为这一机制常被绕过,因此予以拒绝。
在这些案件中,同样的技术事实不断出现。在已记录的测试中,主要爬虫无视了 robots.txt 信号。付费墙内容似乎已被采集。即使出版商从未授权,检索功能也会在答案中呈现出版商的文本。
这里的出版商是地区性和地方性机构,其档案具有真正价值,而法律预算却有限。这正是该案值得关注的原因。大型出版商凭借庞大的法律团队获胜,检验的是法律本身。而由地区性报纸提起的案件,检验的则是那些无力承担多年证据开示的权利持有人能否真正用得上这些救济。
一项裁决可能改变什么
结果将取决于法院两年来一直围绕但尚未解决的问题。使用受版权保护的文本进行训练是否属于合理使用?当文本位于付费墙之后时,答案是否会改变?记忆化是否会把训练用途变成侵权复制?实时检索是否会产生独立于训练的责任?如果复制本身被允许,从出现在数据集中的作品里移除版权声明是否仍构成违规?
这些问题都尚未解决。诉状所做的,是把这四个问题附着在同一组事实上,并提交给地区法院。对于任何基于公共网络内容构建产品的人来说,这种组合正是需要跟踪的。答案不会很快到来,而行业当前先抓取、后谈判的做法,正是这起诉讼所检验的。
为什么地区性出版商会提起不一样的案件
原告的身份以过去几年大型出版商案件所没有的方式塑造着这场诉讼。
《纽约时报》案以及此前的音乐行业诉讼,依托的是拥有数十年商业授权收入可作参照的企业档案。它们可以主张存在一个市场且该市场被取代。而一群地区性报纸带来的是一种不同的证据态势。它们的档案更小,授权历史更薄弱,其主张更直接地依赖于复制行为本身以及移除版权信息。
这对救济很重要。如果原告在版权管理信息指控上获胜,即使底层复制行为存在争议,救济仍可获得,因为移除声明本身即构成独立违规。对于没有长期授权历史的原告来说,这一指控是更可行的路径。
检索层作为独立风险敞口
关于 ChatGPT Search 和 Deep Research 的指控值得与训练问题分开,因为它指向一种不同类型的责任。
训练是一次性行为,无论语料库被重建多少次。检索则在每次查询时、用户提问的那一刻发生。如果产品实时从出版商网站检索文本并将其纳入回答,那么被指控的侵权行为就是持续性的,并且由用户触发。
这一区分赋予原告一项不依赖赢得训练合理使用论证的主张。即使模型完全使用已授权数据训练,也可能通过检索功能呈现其从未获得授权的来源文本。诉状的框架将检索和训练视为两种独立的不当行为,这比把所有问题都绑定到训练语料库上更为有力。
出版商在关注什么
两个信号将告诉行业,这类案件是否值得大规模提起。
第一个是法院是否允许版权管理信息指控在驳回动议中存续。该指控不要求解决合理使用问题,因此若法院就此支持原告,出版商将获得比完整侵权审判更快的救济途径。
第二个是证据开示是否能触及训练流程。如果原告能够强制取得关于抓取了什么以及何时抓取的记录,案件就会从关于合理使用的法律论证,转变为关于爬虫实际做了什么的事实论证,包括它是否越过了付费墙。出版业的从业者正密切关注案卷,期待的正是这类命令,因为这会告诉他们,在决定提起自己的诉讼之前,哪些证据是可以获得的。