第九巡回法院:Copilot 的输出不是被剥离署名的副本

一家联邦上诉法院给了 GitHub 和 OpenAI 一场范围狭窄但影响重大的胜利,并由此划下了一条所有用他人作品训练模型的公司都应仔细解读的界线。
此案为 Doe 诉 GitHub。原告是匿名程序员,他们依据要求署名的许可证发布了开源代码。被告是 GitHub、其母公司微软以及 OpenAI 旗下实体。涉案产品为 GitHub、Copilot 和 OpenAI Codex,三者均基于公开代码库训练。
原告依据《数字千年版权法》提出了两项主张,二者都建立在第 1202 条之上,该条禁止移除或更改版权管理信息。第一项是输入理论:被告在将原告代码作为训练数据输入 Copilot 之前,剥离了其中的署名数据。第二项是输出理论:Copilot 有时会返回已记忆的训练数据,却不附带源代码的署名,而这样做等同于移除或更改了该信息。

输入理论从未得到辩论
第九巡回法院拒绝审理训练阶段的主张,其原因值得注意。在下级法院,原告律师承认复制训练数据“或许”并未违反许可证,而地区法院明确表示,起诉状“并非关于训练”。原告未提出异议。在上诉阶段,合议庭将该理论视为已放弃。
这一放弃比表面看起来更重要。训练阶段的问题本会触及每一个基于抓取或许可数据训练的模型。由于原告是因程序性让步而非实体问题败下这一阵,他们把最大的问题留在了未决状态,并把它留给了另一个案件。
输出理论为何失败
在实体问题上,法院借助原告自己对 Copilot 工作原理的描述,驳回了输出理论。起诉状描述了一个“复杂的概率过程”,它推断统计模式并预测最可能的补全内容。合议庭得出结论,这描述的是生成而非检索,而生成的作品“不能被合理地描述为”受保护代码的“副本”。
法院将 Copilot 与搜索引擎作了对比。搜索引擎检索存储的副本,因此它拥有一个可被移除署名的副本。而在法院的解读中,一个预测下一个 token 的模型并不持有这样的副本。
随后,合议庭讨论了所谓的“同一性”要求,而在这里,它做了一件在未来数年都会被法律文书引用的事。它拒绝将同一性视为第 1202 条主张的独立要件。相反,它把同一性描述为对法条用语“移除”“更改”和“副本”的阐释,并且是证据而非检验标准。不带署名的近乎完全相同的复制,支持推断署名已被移除。实质性差异则指向相反方向,即指向一部从未附加过署名的新作品。
该裁决实际改变了什么
实际效果是收窄,而非解脱。那些曾希望《数字千年版权法》能让他们绕开合理使用和实质性相似这些更难问题的版权所有者,如今不得不走更长的路。
法院自身的论述框架指出了下一轮争斗的所在。权利人将更用力地依赖训练阶段理论,主张署名在数据到达模型之前就已被剥离。他们还会继续就输出提起普通侵权主张,因为那里的检验标准是与受保护作品的相似性,而不是署名元数据的运作机制。
还有第二种解读值得记住。合议庭谨慎地指出,同一性是证据,而不是要件。这为权利人提供了一条路径:建立一份输出记录,证明其近乎逐字复制了受保护代码且未附署名,那么该推断就可以成立。模型是“记忆”还是“泛化”之间的界线,如今在一定程度上取决于输出落得有多近,以及原告能把它证明到何种程度。
问题更大的轮廓
退一步看,此案与其说是对 AI 的裁决,不如说是一个法律体系不均衡追赶的缩影。署名制度从来就不是为在概率模型中存续而设计的。版权管理信息预设了一个附带元数据的副本。当系统通过统计过程生成新内容时,并不存在一个可供元数据被剥离的副本。
这是一个关于技术形态的论点,而它出现在每一场旧类别不再适用的争议中。第九巡回法院选择按字面解读法条,而不是将其拉伸,这站得住脚,但也让底层张力原封不动。
对开发者而言,结论并不光鲜。《数字千年版权法》这块盾牌比一些人希望的更弱,但并未消失。对原告而言,结论是:你在地区法院让步放弃的理论,就是你在上诉时输掉的理论。而对所有用公开代码训练模型的人来说,更持久的警示来自法院自身的逻辑:你的输出与某个具体输入落得越近,“新作品”的框定就越站不住。
在他人代码上运行模型意味着什么
对任何维护开源项目的人来说,实际解读比新闻标题所暗示的更狭窄。DMCA 的署名路径如今更难走,但底层许可证义务并未改变。如果你的代码采用 MIT 或 Apache 许可证,一个记住了它并在复制时不附带声明的模型,仍然构成许可证问题,而法院自身的推理也指出了如何证明这一点。
这种不适也反向存在。该裁决依赖于将 Copilot 描述为概率生成器,而不是检索系统。对于大多数提示词和大多数输出,这种描述是准确的。但对于长尾情形就不那么准确了:模型几乎完全复现一段长而独特的文本,而恰恰是这一长尾,才是原告需要围绕其建立记录的情形。法院并未关上那类案件的大门。它只是让记录本身成了全部论证。
对工具而言也有实际后果。地区法院曾提到 GitHub 自己的重复检测过滤器,该过滤器会标记 150 个字符的匹配,如今这已成为上诉记录的一部分。那些已经在衡量输出与训练数据有多接近的系统,最有能力回答法院留下的问题,这也表明合规基础设施与诉讼策略指向同一个方向。
仍在审理中的案件
这一判决进入的是一个案件密集的领域。Thomson Reuters 于 9 月在第三巡回法院赢得了针对 Ross Intelligence 的上诉,该案涉及的是合理使用而非署名元数据,且该裁决在很大程度上取决于一个事实:Ross 打造的产品所竞争的,恰恰是它用来训练的那个数据库。第九巡回法院的 Copilot 裁决和第三巡回法院的 Westlaw 裁决回答的是不同问题,二者互不具约束力。
这种分歧就是 2026 年 AI 版权法的现状。法院正在解决送到它们面前的各个片段,一个巡回法院接一个巡回法院地逐步推进,而相关事实往往难以普遍适用。一项关于法律研究工具的裁决,对代码助手说明不了多少;一项关于署名元数据的裁决,对合理使用也说明不了多少。任何等待单一判决来终结这个问题的人,都在等待一种制度结构不会产生的东西。
该判决收窄了一条路径,同时让另外几条路径保持开放。当前大多数 AI 版权问题正是这样被解决的:一次一块,在恰好最先到达的那个案件里。