字节跳动未能摆脱一场关于其如何获取视频的诉讼

一群 YouTuber 起诉了字节跳动,指控该公司抓取了数百万条视频,用于训练其文生视频模型。字节跳动请求加利福尼亚州一家联邦法院驳回此案。10 月 2 日,法官 Jacqueline Scott Corley 拒绝了这一请求。
该裁决的关键,在于版权法中一个此前一直处于 AI 训练争论边缘的条款。人们一直在争论的是合理使用,即第 107 条。而 YouTuber 们主张的是第 1201 条,该条禁止规避用于控制对受版权保护作品进行访问的技术措施。
这是另一个法律问题,而字节跳动的抗辩正取决于这一区别。
字节跳动提出的论点
该公司的立场是,YouTube 的防护措施规制的是下载,而非访问。涉案视频是公开的,任何人都能观看。字节跳动辩称,如果内容本就对所有人开放,那么一项只是减缓批量下载的措施,并不构成法条所指意义上的访问控制,第 1201 条并不适用。
Corley 法官驳回了这一主张。她认定,字节跳动被指控规避的那些 YouTube 防护措施,属于 DMCA 禁止规避的访问控制类型。按照她的解读,该平台所限制的是访问的方式和数量,而这同样算数。
她所划出的这条界线,才是今后关键所在。付费墙是访问控制,登录也是。而显然,用于保护本可免费观看内容的速率限制器或反机器人措施同样如此。法条并未规定作品必须是保密的。
为什么这对训练数据流程是个问题
其实际影响是:即便数据本身是公开发布的,采集数据的方法也可能构成违法。
如果法院认同这一解读,那么模型训练方的合规问题就发生了变化。它不再只是“我是否有权从这部作品中学习”,还变成了“我获取该作品的方式是否得到平台许可”。这是两个独立的问题,答案也各自独立,一家公司可能在第一个问题上站得住脚,却在第二个问题上出错。
对原告而言,第二个问题也更容易诉讼。合理使用需要进行关于目的、性质、数量和市场影响的四要素分析,且各项结论都可争辩。而抓取工具是否破解了技术措施,更接近于一个事实认定:工具要么绕过了该控制,要么没有。

第 1201 条围绕 AI 案件盘旋已久
这并非该条款首次出现在训练相关的纠纷中,而此前的案件走向了相反的方向。
在 Doe 诉 GitHub 案中,开发者主张 Copilot 未经许可复制了他们的代码,而法院对第 1202 条主张(该条涉及删除版权管理信息)的处理,比原告期望的更为狭窄。在 Roblox 案中,一位名叫 Austin Beaulier 的艺术家就训练数据集中使用的 3D 模型上的 NoAI 标签被移除而提起诉讼。Beth Labson Freeman 法官同样在 10 月 2 日驳回了该案,认定 NoAI 标签确实构成内容管理信息,但原告未能证明 Roblox 是故意将其剥离。
这两起案件都涉及第 1202 条,该条针对的是附着于作品之上的信息。而字节跳动的案件涉及第 1201 条,针对的是作品之前的那道门。Roblox 案在同一天被驳回、字节跳动案却在同一天得以存续,让这一分野变得清晰可见:关于被丢弃的元数据的主张难以证明,而关于被绕过的门禁的主张则更容易。
合理使用的局面同样尚未尘埃落定
同一周还公布了 Thomson Reuters 诉 ROSS Intelligence 案的未经删节版判决意见,第三巡回法院认定,用 Westlaw 判例要旨训练一款法律检索工具不构成合理使用。该案涉及第 107 条,其中完全不涉及技术措施。ROSS 复制了编辑摘要,并用它们构建了一款竞争性产品。
这三项裁决共同描绘出一种局面:AI 训练流程的法律风险取决于具体机制,而非原则。数据是如何获取的、元数据是否在流程中留存下来、输出结果是否与来源构成竞争,各自都适用不同的规则。
对于大规模采集训练数据的公司而言,其运营后果是:采集层如今本身就是一个合规界面。记录爬虫的行为方式、遵守速率限制和 robots 指令、拒绝绕过平台防护,这些都已不再是礼貌之举。它们如今决定着一起案件能否在起诉阶段就被驳回。
为什么平台的利益与创作者的利益同样重要
第 1201 条项下的主张,既属于建造那道门的人,也属于作品置于其后的那个人。
YouTube 的防护措施之所以存在,是因为该平台在控制其内容库被如何访问上有着自身利益。对于一家大规模提供视频服务的公司而言,批量下载成本高昂,而抓取行为会对带宽、广告计量以及平台与版权方谈判的许可交易产生影响。将这类措施视为访问控制的裁决,等于给了平台一件针对任何形式自动化采集的法律武器,而此前它们并没有这样的武器。
其影响范围远超 AI 训练。它涵盖价格监测、学术研究数据集、竞品分析,以及任何大规模读取网站的行为。这项反规避条款比上述所有活动都早了几十年,如今却被要求去规制一类其起草者从未想象过的活动。
对版权方而言,其后果是多了一条进入法院的途径。一位无法在合理使用之争中胜过模型训练方的创作者,仍可就作品的获取方式提出主张,而该主张并不需要以同样的方式证明经济损失。它需要证明的是某项技术措施被破解了。
证据开示可能会走向何处
如果该案得以存续并进入证据开示阶段,真正有意思的材料将是运营层面的,而非法律层面的:使用了哪些爬取工具、它们是否被配置为尊重平台指令、发出了多少请求、持续了多长时间,以及公司自己的工程师当时对相关风险写下了什么。
内部文件已推动了近期多起 AI 案件的走向,而字节跳动这种规模的训练流程会留下大量痕迹。是否有人在抓取开始之前就提示过法律风险,这个问题往往决定和解金额。
接下来会发生什么
该裁决并未判定字节跳动是否构成侵权。它只是在起诉阶段让案件得以存续,这意味着 YouTuber 们将获得证据开示。正是在这一阶段,具体细节会公之于众:哪些视频、哪些工具、哪些措施被破解,以及次数。
最可能的路径是在开庭前达成和解。这类诉讼通常都以这种方式收场,而字节跳动也无意让训练流程如何运作的公开记录留存下来。但这一法律问题如今已进入司法体系,其答案将塑造未来每一个抓取者如何面对平台的防护。
还有一个更宏观的要点。AI 行业的数据问题一直被当作许可问题来处理:付钱给版权方,一切就都妥当。这一系列案件表明,付钱并不足够,因为承载作品的平台有其自身利益,这些利益被写进技术措施,并由一部并不关心作品是否可免费阅读的法条作为后盾。合法地获取内容与干净地获取内容,如今是两项彼此独立的义务。