中国的新开放模型正被训练为智能体底座

过去一周,中国实验室发布的三个模型共享着一种设计直觉——如果你只是把它们当作一串参数量的清单来读,很容易错过这一点。它们没有一个是冲着擅长对话去做的。
它们被造出来,是为了成为智能体运行其上的那个东西。这是一个不同的目标,而由此衍生出的训练选择,如果在你假定目标是做一个更好的聊天机器人的前提下看,会显得很奇怪。
把任务和它周围的世界一起训练
最清楚的例子是 ZhiZhi Innovation Research Institute(智知创新研究院)于 9 月 29 日发布的 IQuest-Q1。它是一个稀疏混合专家模型,总参数量 3200 亿,激活参数 150 亿,上下文窗口为 524,288 token。与其训练方法相比,它的架构并不起眼。
团队没有在人类对话记录或静态指令集上做微调,而是把任务和任务发生的环境一起合成出来。随后,模型在若干不同的智能体脚手架(scaffold)上训练。它保留每个脚手架原生的工具与上下文管理不变,并且只把模型自身的错误当作学习信号。脚手架本身不允许成为被学习的内容。之后,四个专家模型通过多教师同策略蒸馏(multi-teacher on-policy distillation)合并为一个。
这一点之所以重要,是因为任何做智能体的人都遇到过一个难题:一个在基准测试上得分很高的模型,一旦被套进你自己的工具里就可能崩掉,因为它学到的是别人那套运行框架(harness)的怪癖。在保持框架不变的条件下跨脚手架训练,正是针对这一具体失效模式下手。据报告的结果是,该模型在自然语言到代码仓库的任务上仅略逊于 Claude Opus 5——擅长这种事听起来有点奇怪,但这恰恰是编码智能体所需要的。
在同一步里看和决定
第二个发布走的是通往同一目标的另一条路。同一天,上海人工智能实验室推出了一个名为“书生·明觉”(Shusheng Mingjue)的决策模型,有三种规格:0.8B、2B 和 4B。它的小是刻意为之。
其设计原则是:感知与决策不应是两个分离的阶段。大多数智能体技术栈会先截屏,把它交给视觉模型,得到一段描述,再把描述传给规划器,然后行动。每一次传递都会增加延迟并丢失细节。明觉把原生视觉感知与指令跟随融合在一起,使模型看一眼屏幕就能一次完成判断。实验室报告称,它在决策质量上优于 Jev 以及同类的开放模型。对于一个必须在动态环境中行动的智能体来说,尺寸才是关键:4B 的模型可以贴近循环运行,而 320B 的做不到。
删掉注意力层,以抵达一百万 token
第三个发布在架构上最为激进。来自北京实验室 NaiveAI 的 Naive N0.5 Flash 是一个 3090 亿参数的混合专家模型,激活参数 155 亿,基于小米的 MiMo-V2.5 构建。它原生支持一百万 token 的上下文,并以 MIT 许可证发布。
有意思的地方在于它去掉了什么。该模型混合使用滑动窗口注意力与 DeepSeek 的稀疏注意力,完全没有全注意力层。标准 Transformer 注意力的复杂度随序列长度呈平方增长,这正是长上下文历来昂贵的原因。去掉全注意力,是在赌长序列中的有用信息可以通过结构化稀疏性触达;如果这一赌注成立,它会改变智能体一次能保持在视野中的东西。一百万 token 大致相当于一个大型代码仓库,或者一次长时间工作会话的全部历史,可以被无截断地保留。
那些更小的发布指向同一个方向
这一模式不止出现在这三个模型上。清华的 Puro-2B 训练成本约为 4400 美元,在十五个任务上的平均表现超过了更大的 Qwen 模型。一家电信实验室发布了 TeleOCR,一个 1.2B 的文档解析模型,在一项文档理解基准上登顶。斯坦福和 NVIDIA 发布了一个对比式验证器(contrastive verifier),它通过嵌入对齐而非推理来挑选最佳候选动作,并报告称相比同类评判模型有大幅加速。
这些每一个都是智能体中的一个组件,而不是供用户使用的终点。一个能廉价地为候选动作排序的验证器,一个解析文档的小模型,一个决定点哪里的微型模型。这些部件正变得越来越专用、越来越小,而那个承载整个会话上下文的模型则变得非常大。
没人解决得了的评测难题
这一整条线里有一个贯穿始终的窟窿。面向智能体基础模型的基准,大多仍是从聊天机器人评测里借来的,而后者测的是错的东西。一个模型可以在推理测试上拿高分,却仍然是个糟糕的智能体底座,因为真正重要的性质要跨越整个会话才会显现:上下文在多少轮之后开始退化,一次失败的工具调用会不会被合理地重试,模型是否会察觉到它已经跟丢了最初的目标。
这里报告的大多数数字都来自实验室自己,且跑在它们参与定义的基准上。IQuest-Q1 在自然语言到代码仓库任务上“仅略逊于 Claude Opus 5”,是厂商自述的对比。明觉“优于 Jev”是厂商的说法。Naive N0.5 Flash 没有全注意力是一个容易验证的架构事实,但其实际后果尚未在大规模上被测量。这些都不意味着方向是错的。它意味着诚实的现状是:我们有了三个有意思的设计,却几乎没有独立证据说明,当智能体连续运行六个小时时,哪一个站得住。
这个缺口正开始被承认。独立团队一直在构建面向生产服务而非代码生成、面向智能体劫持(agent hijacking)而非模型安全的基准,这表明这个领域知道自己一直在测量错误的层面。在这些基准成熟之前,像这样的发布所传递的有用信号不是分数,而是训练方法——因为一个针对智能体已知失效模式的方法,比一个针对排行榜的数字更可能是真的。
这一转变还有一个容易被忽略的后果。如果重要的模型变成了小型组件而非大型目的地,那么实验室的优势就不再来自拥有最大的模型,而开始来自知道这些部件如何拼在一起。一个能训练出快速的决策模型、廉价的文档解析器和一个验证器,并把它们接成一个能在普通硬件上运行的循环的团队,拥有的是单个巨型 checkpoint 无法匹敌的东西。这是一种不同的竞争,更接近系统工程而非规模扩展,而这个月落地的这些发布说明,至少有几个中国团队已经转向了它。
两年来,开放权重的竞赛一直以“一个免费模型能多接近前沿聊天机器人”来衡量。这个框架正在失去抓手。对话质量已经成了基线,而决定软件是否管用的问题已经转移到别的地面上:上下文在多少轮之后退化,模型在循环里能多快行动,它被丢进别人的工具链时有多能适应。
能回答这些问题的模型不会赢下多少排行榜。它们会赢下一场不那么显眼的竞赛:当聊天机器人已经做完它那一部分、而活儿真的需要干起来的时候,开发者会伸手去拿哪一个。这场竞赛本周悄然上演,就在三个根本没打算用对话打动任何人的发布里。