OpenAI 将一起推理提取行动追溯至与月之暗面有关联的人员

9月30日,OpenAI 发布了一份说明,描述其所谓的、一场有组织地试图从其模型中提取受保护推理内容的行动。该公司表示已挫败该行动,并将其中一个核心活动群组归因于与月之暗面(Moonshot AI)有关联的个人——月之暗面是 Kimi 模型系列的开发者。
这份披露篇幅简短,并且在“一家公司”与“一群人”的界线上一字不苟。OpenAI 并未指控月之暗面策划了这场行动。它只是说,其识别出的人员与该公司有关联。这一区分承担着法律层面的作用,应当按字面理解。
这场行动做了什么
模型蒸馏通常指用一个大模型的输出训练一个小模型,让小模型以极低的成本学会模仿大模型。这种做法很常见,而且往往合法,正因如此,各家实验室的做法是设法限制它,而非彻底禁止。
OpenAI 描述的是一种更具对抗性的版本。操作者操纵交互,使模型受保护的推理过程以可见形式被复现。其中一种手法是:把一段对话中的加密推理内容复制出来,再在另一段对话中要求模型将其解密。前沿模型之所以把推理轨迹隐藏起来,是有原因的:它们会暴露模型如何得出结论,而这也是最有利可图的可窃取之物。
该公司描述了一次快速升级。相关活动始于7月1日,在7月24日和25日达到峰值,来自 4000 多名用户的约 16000 次提取尝试请求。另一个涉及超过 15000 名用户的关联群组则在7月28日之前被完全挫败。
OpenAI 表示,没有任何加密被破解,也没有任何数据库被入侵。它关闭了推理重放的路径,封禁了相关账户,并通过前沿模型论坛(Frontier Model Forum)和政府渠道分享了其发现。
加密推理这一角度为何重要
有意思的技术细节在于跨对话重放。如果实验室对推理轨迹加密,并把密钥留在用户接触不到的地方,这段轨迹看起来就是安全的。而该攻击并不试图破解加密。它把密文搬到一个全新的上下文里,实际上就是让模型自己去理解它。模型本身成了解密预言机。
这更像是一堂设计课,而非一起事件。任何系统,只要它把本不应泄露的数据交给模型,然后又允许同一个模型回答有关这些数据的问题,就存在薄弱之处。修复之道在于架构:让受保护的内容远离任何模型可能被诱导去翻译的上下文。
背后的经济账
推理轨迹之所以有价值,是因为从零训练一个有竞争力的推理模型既昂贵又缓慢。而复制一个已经具备良好推理能力的模型的轨迹则便宜得多。这两种成本之间的差额,就是全部的动机所在。
这同样是检测很难、归因更难的原因。这类行动中的用户分散在众多账户、地区和支付方式之中。要把他们与某家特定公司绑定,需要的证据远超“使用同一套工具”,这想必就是 OpenAI 将该关联表述为“有关联”而非“归属”的原因。
中国背景
这一归因恰逢中国模型发布密集的时点。国庆假期期间,多家国内公司同时推出新版本:Kimi 的下一代模型出现在某个 API 注册表中,Step 5 Preview 向第三方端点开放,可灵(Kling)则将其视频模型推入测试阶段。市场变化迅速,而保持在接近前沿水平的成本不断攀升。
放在这一背景下看,OpenAI 的披露只是关于前沿如何被防守的若干信号之一。各家实验室正把推理提取当作一个配有研究预算的安全问题,而不是服务条款里的一条脚注。
还有第二种解读:这份披露本身就是一种信息。通过前沿模型论坛和政府渠道公布归因,等于是在提醒其他实验室:哪些行为会招致公开回应。
业界该如何应对
针对蒸馏的防御手段大多是技术性的,也大多并不光鲜。实验室可以对高频查询限流、对流量做指纹识别、并监测提取行为所产生的模式。它们也可以加密推理轨迹——OpenAI 就这么做了——然后发现,如果模型可以被要求解读自己的密文,那么仅靠加密并无用处。
还有政策层面。前沿模型论坛的存在,部分目的正是在竞争对手之间协调这类发现,因为它们在让提取保持昂贵这件事上有着共同利益。通过政府渠道分享还有第二个用途:给监管者一个具体案例,让他们无需起草一部全新的法律就能采取行动。
这些都无法让蒸馏变得不可能,因为一个会回答问题的模型,总会被一个读答案的模型所模仿。它抬高的是成本,而这才是现实的目标。实验室并不想终结模仿。它们只是想让它不至于便宜到可以省下训练这笔账。
为何归因是最微妙的部分
点名一群人、把他们与一家公司联系起来,却不指控这家公司——这是一条窄路,OpenAI 是有意这样走的。措辞很重要,因为不同的解读会带来截然不同的后果。由国家支持的行动是外交事务。一群工程师自作主张是公司治理事务。而一个普通的用户群体在模型允许的边界上不断试探,则两者都不是。
这份披露并未解答哪种解读才是对的。它所做的,是把这一发现以其他实验室可以佐证的方式记录在案,并给监管者一个可以指认的具体事件。这往往就是此类披露的实际目的。与其说它是一则新闻事件,不如说它是一份备案。
还有声誉层面的考量。蒸馏方面的投诉已成为前沿竞争中的常规组成部分,而每一次投诉的解读方式,取决于提出者是谁。一家公布证据、点明模式并与同行分享的实验室,比一家只发布一页政策声明的实验室立场更有利。
这份披露未能厘清的部分
OpenAI 的说明并未提及,是否有任何东西是用提取到的材料训练出来的,也没有说明在路径被关闭前有多少内容被获取。除了一般的“有关联”表述外,它没有点名任何外部方。它也没有谈到类似手法是否正被用于针对其他服务商——而这很可能正在发生。
这些空白并不证明有什么险恶之处。它们是一份安全披露的正常形态:公司分享足够的信息以警示整个领域,同时不发布操作指南,也不损害调查。
真正具有普遍意义的,是那个模式。前沿模型最有价值的产出,已不再只是它的答案。而是答案底下的推理过程,而围绕这一推理过程的防御,如今正像网络上的任何系统一样,被有意地反复测试。