汤森路透诉罗斯智能:首例关于AI训练与合理使用的上诉裁决

三年来,围绕AI模型能否使用受版权保护材料进行训练的法律之争,大多要么以和解收场,要么在地区法院层面陷入停滞。今年9月,美国第三巡回上诉法院改变了这一局面。其在汤森路透诉罗斯智能(Thomson Reuters v. Ross Intelligence)一案中的裁决,是首个认定使用受版权保护的材料训练竞争性商业AI工具不构成合理使用的联邦上诉裁决。
法官塔米卡·蒙哥马利-里夫斯(Tamika Montgomery-Reeves)维持了下级法院2025年2月的裁定,即罗斯智能使用2,243条汤森路透判例摘要(由编辑撰写的简短法律要点概述)训练一款竞争性法律检索产品,构成侵权。上诉法院的背书之所以重要,是因为它把某位法官个人意见中的推理提升为对某一联邦巡回区具有约束力的判例——这正是其他法院如今不得不正视的东西。
该案究竟裁定了什么
这一裁决的适用范围较窄,针对的是一类特定的系统。罗斯开发的法律研究工具,其定位就是直接与其训练内容所来源的产品竞争。法院认定该使用未通过合理使用检验,主要原因是其产出与原始作品在同一市场竞争。
该推理依托于市场替代理论。当训练的目的是产出可替代来源材料的东西时,合理使用的第四项要素——对原作潜在市场的影响——就会对使用者极为不利。法院不认为训练过程中涉及的中间复制具有足够的转换性,足以抵消这一点。
有必要准确界定这一裁决涵盖与不涵盖的范围。就相关意义而言,罗斯并非生成原创表达的生成式模型,而是一款检索与调取产品,复制并改用了受版权保护的摘要内容。法院明确作出了这一区分,从而为生成式AI留下了空间——后者可以主张其生成的是新内容而非复制现有内容,因此应获得更广泛的合理使用保护。
这一例外表面上很慷慨,实践中却不那么令人安心。它意味着该上诉裁决并未解决图像与视频行业最想得到答案的问题:用数十亿张受版权保护的图片和视频训练扩散模型,是否属于合理使用。它把这个问题留给了未来的案件,也意味着答案可能因模型类型而异。
生成式AI的问题仍悬而未决
生成式AI一侧的平行诉讼一直在不同法院推进,且并未以有利于行业的方式得到解决。被讨论最多的一个节点是2025年6月Bartz诉Anthropic案的和解,该案以据报道15亿美元了结了一起关于训练数据的集体诉讼请求。和解并非裁决,但这个金额的规模说明了被告律师如何评估自己的胜算。
在这项上诉裁决之外,另一起关于AI图像训练的案子在旧金山进入陪审团审理,成为此类争议中首个交由陪审团而非和解处理的事项。该案的裁决将给行业带来任何一方都尚未获得的东西:关于用艺术家作品训练图像模型是否侵权的事实认定,而且是由普通人而非法官作出的。
把罗斯案的裁决与正在进行的案件放在一起看,它们指向同一个方向。法院越来越不愿把“我们用它训练了模型”当作自动成立的抗辩,并且开始依据产出产品与来源材料的竞争密切程度来区分分析。一个系统越是直接替代它所学习的内容,合理使用的主张就越站不住脚。
为何其影响超出法律科技领域
人们很容易把罗斯案归入“法律研究”这一狭窄类别,然后翻篇。对任何使用AI生产商业内容的人来说,这都是错误的,原因就在于市场替代逻辑。
想想一个很常见的场景:一款撰写产品描述文案的AI工具。如果它是用某零售商的商品目录文案训练的,随后被用来生成与之竞争的商品目录文案,罗斯案的推理就会令人不安地直接适用。同理,如果一个图像模型是用某品牌的产品照片训练的,而它正帮助竞争对手以更低价格冲击该品牌;或者一款文案工具是用某出版物的文章喂养的,并被用来生成争夺同一批读者的内容,情况也是如此。
实际风险并不限于模型开发者。部署AI工具的企业会承继这些工具构建方式所带来的风险,而相关记录往往缺失。使用基于未授权数据训练的免费模型的卖家风险最高,因为他们即便想证明数据来源也无从证明。而那些选用基于已授权或自有数据训练的模型的团队,则可以记录下这一选择,这在争议中是一种可辩护的立场,也正日益成为合作伙伴和平台提出的要求。
这一转变带来的合规成本是实实在在的,而且分布不均。规模较大的参与者可以谈判授权并构建已授权的数据集;较小的参与者则做不到,只能在付费购买授权工具、手工创作原创内容,或承担自己可能无法量化的风险之间做选择。平台很可能会自行填补其中一部分缺口,像如今扫描假货那样,扫描上传内容中未经授权的AI生成素材的迹象。
这种实践中的模糊之处值得明确说明。罗斯案的裁决针对的是检索产品,而非扩散模型,因此不应将其解读为对图像或视频训练的定论。它确实确立的是一种将被更广泛适用的分析方法:法院会追问被训练系统的产出与其学习材料之间的竞争有多直接。对许多商业AI产品来说,这个问题都有令人不安的答案,而且这与模型是否为生成式无关。
短期内的结果是,数据来源正在变成一项产品特性。能展示其训练数据来源的工具,或仅基于客户已拥有的内容构建的工具,风险更低,并可以为此收费。而做不到这一点的工具,将逐渐流向那些不知道要问、或无力在意的客户。
当前格局
目前存在的是一组路标,而非一条已确立的规则。至少在美国第三巡回区,使用受版权保护的材料训练以打造直接竞争的商业产品,不构成合理使用。生成式模型有更大的争辩空间,而这一空间尚未经过陪审团裁决的检验。和解已把这一风险定价到足以引起董事会关注的数字。
对任何在AI之上构建产品的人来说,明智的应对是不再等待法律明朗化。弄清训练数据的来源,保留记录,优先选择能证明其数据来源的模型,并把模型权重的来源当作供应链问题、而非法律脚注来对待。即便终点不明,行进方向是清楚的;今天就能回答数据来源问题的组织,日后被截止日期逼着回答时,将省下远多得多的精力。