Gemini 4 Argon 是一个你暂时还不被允许使用的前沿模型

Google 本周发布了 Gemini 4 Argon,并做了一件比模型发布本身更少见的事:它给产品装上了一道门禁。Argon 最初只通过 Fairwind 计划向一组经过挑选的网络防御人员开放。开发者、企业和普通消费者要等到之后,待 Google 利用早期测试者的反馈收紧其安全防护措施之后才能使用。
这种排序本身就是故事的核心。Google 本可以甩出一个亮眼的基准成绩然后开放 API。但它却把一个前沿模型当作受控部署来对待,而这次上线让访问策略成了产品的一部分,而非产品的一个脚注。
数字,以及价格
Argon 瞄准的是长周期软件工程、法律与金融知识工作,以及网络安全防御。Google 列出的输出上限为一百万个 token,并公布 DeepSWE v1.1 得分 77.9%、AutomationBench 得分 51.3%、LVBench 得分 91.7%。Google 表示该模型可以自主发现、验证并修补漏洞,而且已经在内部用于大规模代码库迁移。
定价才是竞争压力暴露的地方。Google 列出的 Introductory 价格为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入可享 95% 折扣。这些数字几乎直接压在 OpenAI 的 GPT-6.1 Sol 之上,而当两家前沿实验室的价格如此接近时,市场会将其解读为对其他所有人的挤压的开始。
就 Anthropic 而言,它正在为争夺企业支出而取消客户折扣。Claude Sonnet 5.5 目前以 68 分位居 Coding Agent Index 榜首,但其任务也是所测得最昂贵的,单项任务最高可达 14.19 美元。GPT-6.1 Sol 在同一指数上得分 63,每项任务成本约为 1.04 美元。Sam Altman 称 Sol 是有史以来增长最快的模型,同时承认它在高负载下运行缓慢。Google 的 Logan Kilpatrick 则表示,每一次 Gemini 版本更新在发布前都会由数千名软件工程师进行数周测试。
把这四个事实并排放在一起,当下的格局就很清晰了。原始能力正在趋同。如今正在被博弈的,是每项任务的成本、高负载下的可靠性,以及一家实验室愿意多早让公众接触其最强的模型。
为什么给模型设门禁是一个产品决策
在聊天机器人时代的大部分时间里,一次发布就意味着一个 API key 和一个速率限制。Argon 打破了这一模式,原因在于它宣称的用例恰恰都是危险的那类。一个能自主定位并修补漏洞的模型,同样也是一个能为别人定位漏洞的模型。一个能在一百万 token 的跨度上处理法律与金融推理的模型,其错误会悄无声息地累积。
门禁还创造了一个 Google 可以控制的反馈循环。受信任的测试者会产出运营证据,这些证据在该模型面对普通受众之前,会反哺安全防护措施的改进。这究竟是真正的谨慎,还是一种用来对抗 OpenAI 争取时间的手段,只有内部信息才能说明。但无论如何,先例已经确立:一个前沿模型可以作为受限计划发布,而访问决策变得和权重本身同样重要。
智能体开发者应从中得到什么
Argon 一百万 token 的轨迹长度,对任何在其之上构建智能体的人来说都很重要。更长的跨度让真正长周期的任务成为可能,同时也让可观测性变得不可妥协。一次跨越一百万 token 的运行,不是一个人靠读结尾就能审计的。
实际应对方式是把权限当作一个设计问题。个人智能体运行时应当把读取、写入、执行和外部发送权限分开,保留原始事件及其来源,并在任何不可逆操作前要求批准。这条建议并非 Argon 专属,但 Argon 让它变得紧迫,因为一个能连续行动数小时的模型,需要一个能在几秒内叫停它的决策层。
同样的逻辑贯穿于整个行业更大的一次转向。AWS 发布了 Strands Decider 2B,这是一个开放的决策模型,它返回的是一个选择和一个置信度度量,而非一段叙述文字,而且小到可以在本地运行。它是为路由、重试、风险分类和工具选择这类有界步骤而构建的。它传递的信息是:并非每个智能体步骤都需要前沿模型,把一个廉价模型放进控制平面,能让你更频繁地做检查。
门禁背后的定价碰撞
门禁并非这次发布中唯一的信号。Google 的 Introductory 价格——每百万输入 token 2 美元、每百万输出 token 10 美元,外加 95% 的缓存折扣——让 Argon 几乎正好压在 OpenAI 的 GPT-6.1 Sol 之上。当两家前沿实验室如此接近地落在同一价格带上时,通常意味着前沿已经不再是一个收取溢价的地方,而开始成为一个靠成本竞争的地方。
这是市场形态的一次转变。在过去两年的大部分时间里,昂贵的模型之所以昂贵,是因为没有更便宜的东西能与之接近。一旦能力趋同,买家问的问题就从“哪个模型最好”变成了“哪个模型在每项完成任务的成本最低的前提下足够好”。当一个模型好 5% 却贵三倍时,如果这种差距很少体现在输出里,那就很难推销。
Argon 的基准成绩很强,而有趣之处在于它们强在哪些方面。DeepSWE v1.1 的 77.9% 和 AutomationBench 的 51.3% 描述的是软件工程与自动化工作,而非通用对话,LVBench 的 91.7% 则指向长视频理解。Google 推销的不是一个更好的聊天机器人。它推销的是一个能处理代码并观看长输入的智能体,而这恰恰是每项任务成本主导总账单的那种工作负载。
信任层正在被正式化
Google 的门禁式发布并非发生在真空中。一项由各大 AI 公司签署的新的《前沿责任联合承诺》,包含内部监测、独立外部评估和一个独立董事会委员会,覆盖网络、生物和化学领域的滥用,以及意外访问技术系统的情况。前沿安全正在变成一个组织与审计问题,而不只是研究团队的问题。
考验在于,外部评估者能否看到足够多的东西以复现某个发现,以及当管控失效时这些承诺是否会带来后果。这些问题既适用于像 Argon 这样带门禁的模型,也同样适用于开放模型。一个由你掌控的门禁,其质量只取决于被允许通过的那些人。
Argon 指向的是一个前沿模型负责规划、而独立的策略层与决策层掌握执行的市场。这种分离已经是谨慎团队构建系统的方式。Google 只是把它变成了自己最强模型的默认做法,而其余玩家也会跟进,因为替代方案是在任何人就“当它做错事时由谁负责”达成一致之前,就发布一个能大规模行动的系统。