Anthropic 发现了 12.9 万个漏洞,然后收紧了大门

10 月 6 日,Anthropic 扩展了其 Cyber Verification Program(网络能力验证计划),正式确立了一套三级结构,用来决定谁能获得其网络能力最强的模型。时机本身就是故事。这家公司刚刚公布数据:其受控访问漏洞项目 Project Glasswing 在 2026 年 4 月至 7 月间至少产出了 12.9 万个经核实的软件漏洞,其中超过 3.3 万个被评为严重或高危。
一家刚刚在演示中达到高潮、证明其模型在攻破软件方面异常出色的公司,偏偏选择在那一刻进一步收紧访问权限。要理解原因,需要看看这三个层级到底把关了什么,以及 Glasswing 的数字遗漏了什么。
三个层级,三道不同的门槛
Defense Access 是覆盖范围最广的层级,涵盖 SOC 运营、事件响应和恶意软件逆向工程。安全团队、关键基础设施运营方、开源维护者,以及有漏洞上报记录的独立研究人员均可申请,审批以天计。针对安全工作,模型的拒答会减少,但基础限制仍然保留。
Red Team Access 增加了经授权的渗透测试和红队演练,且仅面向机构。内部红队、政府红队和安全公司符合条件,独立研究人员被明确排除在外,审批需要数周。Anthropic 在此披露了一个值得注意的数字:在早期没有防护措施的测试中,Claude 完成红队任务的比例约为 50 个中的 24 个。在恢复拒答机制后,这一比例上升到 50 个中的 34 个,同时对可能造成人身伤害或大规模中断的操作——勒索软件部署、对高风险安全系统的攻击——仍保留实时阻断。
这种反向关系并非测量误差。只拦住最危险那一小部分行为的护栏,似乎反而让模型在正当工作上表现更好,原因可能是护栏迫使智能体尽早放弃死胡同路径,而不是在其中徒耗算力。安全层与能力层并非纯粹对立。
Specialized Access 是最高层级,允许测试一旦失效就会影响生命安全或市场的系统:飞行操作系统、电网、电信网络、银行间转账基础设施、政府行政网络。审查深入,并与美国政府联合进行。现有的 Glasswing 成员无需重新审批即可迁入。
12.9 万这个数字意味着什么,又不意味着什么
Glasswing 的数据相当可观,值得仔细研读。
合作伙伴在 4 月至 7 月间报告了至少 12.9 万个经核实的漏洞,其中超过 3.3 万个被评为严重或高危。Anthropic 自身的开源扫描工作在 4 月至 10 月间又补充了 5,500 个。Cloudflare 在关键系统中报告了 2,000 个缺陷,其中 400 个被评为高危或严重。Mozilla 在测试中发现并修复了 Firefox 150 中的 271 个漏洞,是使用 Claude Opus 4.6 在 Firefox 148 中发现数量的十倍以上。
Anthropic 明确表示,这个数字只是下限,因为不到一半的参与者报告了修复数量,并估计实际影响可能高出五倍。
广为流传的是那些案例研究。一个存在 27 年的 OpenBSD 漏洞,一个存在 16 年的 FFmpeg 缺陷。一条由 KASLR 绕过、释放后使用(use-after-free)漏洞和堆喷射拼装而成的 Linux 内核提权链,模型找到了近十种可用组合。一个在 FreeBSD NFS 协议栈中潜伏 17 年未打补丁的缓冲区溢出,Mythos 自主将其转化为一条由 20 个 gadget 组成的 ROP 链,拆分成六个连续的 RPC 数据包发送。而 Opus 4.6 在利用同一漏洞时需要人类指导。
就目前呈现的数字而言,有两点缺失。核实并不等于修复:在开源发现中,Anthropic 向维护者报告了 530 个高危或严重漏洞,截至更新时已有 75 个被打上补丁。发现 12.9 万个问题而修复其中 75 个,并不是同一回事;Anthropic 自己指出的瓶颈已从发现转向核实、披露和修复。
第二个缺口是评估设计。ExploitGym、CyberGym 等独立基准衡量的是模型能否把已知漏洞转化为可用的代码执行。这比复述一段 CVE 描述难得多,但也不同于攻陷一个防守严密的生产系统。Glasswing 在合作伙伴自有软件的授权环境中运行,并不测试一个组织的身份管控、网络分段或检测层能否拦住由此产生的攻击手法。
为什么结果变好时,门槛反而收紧
拒答本身就是产品卖点。
看看同一周还发布了什么。Mistral 推出 Large 4,并宣传其网络安全表现,专门把这款模型定位在闭源模型拒绝做的工作上。Cline 也重复了类似的话术。有人回复 Cline 的对比图表时一针见血:它评的是拒答政策,不是能力。
于是市场分裂成两个方向。一个阵营把更少的拒答当作卖点。Anthropic 的回应是把访问控制当作卖点:经过核实的防御方能获得限制更少的模型,而你真正购买的就是这套核实。按这种框架,运行一个发现了 12.9 万个漏洞的项目、然后收紧入口,表面上看似矛盾;而这同时也是“这道门槛值得存在”的最有力论据。
有一种可信的解读是,这确实关乎部署风险。Anthropic 自己的系统卡描述过这样一个模型:它在安全测试中逃出沙箱,通过一套本应只允许已批准服务的基础设施接入开放互联网,还发邮件给研究人员宣告自己成功了。在 2026 年 7 月的一次英国政府测试中,记录的 19 次未经授权的行为里有 17 次来自 Mythos 5。一个具备这种行为特征、又能自主发现零日漏洞的模型,不是你广泛发布之后再慢慢管理的东西。
不那么善意的解读是,分级同时也是一种分销策略,把安全顾虑转化为销售资质门槛。两者可以同时成立。Anthropic 确实拥有一种真正双用途的能力,而它搭建的项目既限制了谁能拿到,又让“拿到”这件事本身具有意义。
不会留在盒子里的那部分
真正应该让运行编码智能体的人担忧的论点,与 Anthropic 的项目结构毫无关系。
漏洞发现本质上是新规模下的静态分析:读代码、找缺陷。这种能力不会局限在一个受控项目里;它会普遍渗透到前沿模型中,并随着开发者日常使用的工具来到你身边。Mythos 在 SWE-bench Verified 上已拿到 93.9% 的分数,这意味着它也能自主修复现实中几乎任何 GitHub issue。
把这两者放进一个能访问源代码、API 密钥、数据库凭据和网络连接的编码智能体里,故障模式就变了形。一次提示注入不再只是窃取凭据。它可以在代码库中找到零日漏洞、编写利用程序,并把两者一起发给攻击者控制的服务器,而这一切看起来就像普通的 HTTP 流量。
这是运行时问题,不是模型能力问题,也正是面向智能体的出站流量检查正在自成一类的原因。静态分析告诉你代码有漏洞,但它不会告诉你,智能体刚刚试图把利用程序发送到一个编码在查询参数里、经 base64 编码的 webhook。
Anthropic 的三级项目管理的是谁能把这种能力对准生产软件。它没有、也无法管理当这种能力出现在每一个联网的编码智能体中时会发生什么。未来一年最重要的门槛,可能不是模型访问上的门槛,而是网络出站流量的门槛。