← 返回博客
News预计阅读 10 分钟

Meta 就图书诉讼达成和解。授权如今有了价格。

发布于 2026年10月7日
Meta 就图书诉讼达成和解。授权如今有了价格。

Meta 已同意就一桩集体诉讼达成和解,该诉讼指控其使用盗版书籍训练 Llama 模型。拟议协议于 9 月下旬提交联邦法院,通知也在数日后发给了权利人。财务条款在法官批准前处于密封状态,而 Meta 仍公开表示其训练做法属于合理使用。这份和解协议没有说出口的内容,和它说出口的内容同样说明问题。

此案的核心在获取环节,而非训练环节。作者们指控 Llama 模型在 2018 年至 2024 年间,使用了从 LibGen 等影子图书馆抓取的作品进行训练。这一细节很重要,因为另一项裁决已经在这个问题的正中间划下了一条线。在 Anthropic 案中,法官 William Alsup 认定,用受版权保护的书籍训练模型是合法的,但保留一个盗版副本图书馆则不合法。该案中的处罚——15 亿美元和解金——针对的是书籍的获取方式,而不是学习行为本身。

把这两个结果放在一起看,它们描述了一条说起来容易、执行起来却很难的规则。从你合法获得的书籍中学习,没问题。用盗版副本搭建语料库,则不行。15 亿美元这个数字折算下来大约是每部作品 3,000 美元,这给了每个实验室为自己的风险敞口定价的方法。如果你从盗版网站抓取了一个语料库,那么现在你大概知道这个决定要付出多少代价了。

退出机制正被价格取代

更具深远影响的转变在于接下来会发生什么。本月报道的另一项和解,用与数据使用量挂钩的强制性许可费结构,取代了自愿退出登记模式。其背后的理由很直白:退出通道在纸面上看起来很公平,但在实践中却失败了,因为开发者很少查看或遵守排除清单。按作品数量付费则更难被忽视。

这重新定义了整个谈判。在退出机制下,权利人唯一的杠杆就是说“不”,然后寄希望于此。而在定价许可下,授权变成了一个附有数字的预算条目,争论也从 AI 公司是否可以使用该作品,转向它们应为使用支付多少钱。对出版商和作者而言,这比一个无人执行的技术屏障要好得多。

对实验室的实际影响是新增了一项合规预算。数据来源不再只是一种工程偏好,而成为一项法律要求。如果在一个数 PB 规模的数据集中,有一个语料库来自无法记录来源的渠道,就会给整个训练流程引入一项明确的负债,而问题通常出在聚合层,第三方数据集在那里被合并,却没有清晰的归属信息。

输出问题仍未解决

训练数据只是两条战线之一。另一条是模型生成了什么,而在这方面,局面还远未确定。《纽约时报》挺过了 OpenAI 的驳回动议,因为它合理地指控 ChatGPT 的输出与其新闻报道构成竞争。这是一种市场替代理论,其切入方式与获取理论不同。如果模型从某部作品中学习,但并不复制它,那么转换性使用的论点就成立。如果其输出在市场上替代了原作,该论点就会被削弱。

驳回动议被拒绝并不等于认定存在责任,《纽约时报》案仍在推进。但正是这两种理论合在一起,使 AI 公司如今将来源追溯和输出监控视为同一个问题。即使用授权数据训练的模型,也仍然可能生成与来源相竞争的内容,而许可条款正越来越多地规定它不能做什么。

音频没有走上同一条路

如果图书出版商正走向一个许可市场,那么音乐则正走向更混乱的局面。Suno 在德国输掉了由表演权协会 GEMA 提起的一项裁决,该案涉及使用受版权保护的录音和作品。美国的文本类案件大多正以赔款和追溯许可的方式解决。而音频类案件正在产生禁令和管辖权之争,对产品公司而言,这是更糟糕的结果,因为禁令会直接叫停服务,而不是对其征税。

差异似乎归结为输出与输入之间的距离有多近。一个总结书籍的语言模型与原文之间隔了一步。一个生成某位艺术家风格歌曲的音乐模型,则离得足够近,以至于比较会立刻发生,而法院一直不太愿意把转换性使用的论点扩展到覆盖这种情况。

价格尚未出现的地方

按作品计价的基准到目前为止是一种文本现象,原因在于基础设施。图书出版商拥有集体许可机构、数十年来关于复制权的判例,以及一个相对清晰的交易单位,也就是一部作品。这使得按作品定价既容易定义,也容易在法庭上争论。

一摞整齐的空白米色精装书,旁边是一台小型黄铜天平,天平上放着素面砝码,置于温暖的亚麻布表面。

图片、视频和代码则没有同样的条件。图库可以为每张图片的许可定价,但一张网页截图会同时包含数十个受版权保护的要素,而一个代码仓库会在同一目录树中混合授权文件、宽松许可文件和无法归属的文件。一旦问题从文本转向其中任何一类,按作品计价的公式就不再适用,争论又会回到合理使用,而这是 AI 公司更愿意作战的阵地。

另一个悬而未决的问题是谁来收取费用。一项无人管理的许可费最终还是会变成集体诉讼,而本月报道的和解结构仍然描述的是逐案谈判的付款,而不是一个公布费率的常设市场。在费率公开之前,每次谈判都私下进行,最大的买家获得最好的条件。这就是一个已经形成但尚未成熟的市场形态。

如果你基于这些模型进行开发,这意味着什么

读这篇文章的大多数开发者并不训练基础模型,所以直接风险敞口很低。但间接风险敞口并不低。承担八位数和九位数和解金的实验室会把成本转嫁出去,而转嫁机制就是 API 定价。未来一两年,模型访问预算将会上升,尤其是用授权材料训练的模型,因为许可本身现在已成为商品成本的一部分。

对于任何托管或运行 AI 工作负载的人来说,还有第二个更安静的影响。如果你为客户存储训练数据集,法律风险如今取决于这些文件来自哪里,而不是客户用它们做什么。清晰的数据来源文档不再是一项额外负担,而是开始成为防止八位数判决落到你所运营系统上的关键。

尚未确定的部分是这种定价模式会扩散到多远。文本出版商拥有集体许可基础设施,以及一批已和解案件可以作为依据。音乐有集体管理组织,但输出关系不同。图片、视频和代码各有自己的动态,而且它们都还没有按作品计价的基准。Meta 达成和解只是从地图上移除了一个地标,并没有画出其余部分,而接下来的几项和解将决定授权会成为一个市场,还是继续作为一系列例外存在。

相关文章