小米发布了一款媲美前沿水平的全模态模型,还附上了训练配方

一家手机公司于9月22日发布了一款 AI 模型,最抢眼的数字是 46。这是小米 MiMo-V2.6 Pro 在 Artificial Analysis 智能指数(Intelligence Index)上的得分,公司称这是发布时开源模型所记录的最高分。
MiMo-V2.6 有两个版本。Pro 是大杯,Flash 是快杯。小米称 Pro 在大多数智能体基准测试中与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,并指出其在编程、计算机操作、3D 推理和创意任务上有所提升。这些模型是全模态的,意味着它们通过一套权重接受文本、图像和其他输入;它们使用规模化强化学习训练,而正是这一点既解释了它们的能力,也解释了它们的发布形式。
下载包里到底有什么
大多数开放权重的发布只交出权重,然后就到此为止。MiMo-V2.6 则提供了权重、技术报告、强化学习环境和训练代码。小米把这四样东西全部发在自己的网站上,而不是让开发者绕道某个带许可页面和候补名单的模型托管平台。
其中包含强化学习环境,才是真正有意义的差别。权重让你能运行一个模型。环境让你能重新训练它。当一个实验室公开它所训练用的环境时,它是在告诉你这种行为是怎么来的,而不只是这种行为是什么。对于任何想要复现结果、或用自己的奖励信号微调模型的人来说,环境才是真正有价值的产物。
这也提高了发布方为此付出的代价。公开环境会暴露训练信号的形态,而它更接近一份配方,而不是一个检查点。竞争对手读到它,就能省下一年的试错。小米似乎已经认定,在招募人才和建立可信度方面的收益要大过这一代价。
一家设备公司为什么要做前沿研究
小米不是一家恰好卖手机的研究实验室。情况恰恰相反,而这种定位也体现在全模态模型究竟擅长什么上。
手机是这类助手的天然归宿:它能读懂屏幕、理解照片、操作界面,还能用语音对话作答。从这个角度看,计算机操作、3D 推理和创意生成并非抽象的基准测试。它们是一个必须在用户手持设备上运行的系统组件,而且往往网络缓慢、还要顾及电量。把一个模型系列拆成主打能力的 Pro 档和主打延迟的 Flash 档,既是研究决策,也是设备路线图决策。
公开权重有两个目的。一是招募会在公开场合改进模型的研究人员;二是在一个能力宣称通常只能凭信任接受的市场里,为公司的地位托底。一个你可以自己下载并评估的模型,需要的营销更少,而小米争夺开发者注意力所面对的,是那些声誉完全建立在已发表成果之上的实验室。
全模态在实践中意味着什么
这个标签涵盖了一项具体的工程主张:一个模型通过共享表征处理多种输入,而不是把每种输入类型分派给各自的专家模型。对手机而言这很重要,因为另一种做法是运行多个模型再拼接它们的输出,而手机上的内存和延迟都很紧张。小米的 Flash 档出于同样的理由存在。一个在旗舰机上能一秒作答的模型,在中端设备或汽车里可能根本没法用,所以这个系列实际上是能力与延迟曲线上的两个点,而不是一次发布。

训练方法解释了其余部分。规模化强化学习意味着模型是针对奖励信号进行优化的,而不只是被训练来预测下一个 token,这正是近来全行业智能体性能跃升背后的方法。这也是环境与权重同样重要的原因。奖励信号的好坏取决于产生它的环境,因此公开环境更接近于公开一种方法,而非公开一个结果。
设备本身就是分发渠道
小米的优势在于,它不需要开发者生态就能触达用户。它把硬件送到数千万人手中,而一个跑在手机助手里面的模型,一个季度触达的人数就超过模型托管平台一年的量。这就是发布形式如此慷慨的原因。权重和配方让公司损失的许可收入相对有限,却能换来研究界的信任——否则他们只能凭一张基准测试的截图来评判这个模型。
风险与优势如出一辙。手机助手的好坏取决于它是否每次都管用,而一个每二十个任务就失败一次的智能体,在聊天窗口里只是烦人,在一台还负责支付、拍照和收发信息的设备里则是隐患。能力基准测试衡量不了这一差距,46 分的综合得分同样不能。
同一个周二,另外三场发布
时间点很能说明问题。9月22日,小米的模型与阿里巴巴的 Qwen-Image-2.1 一同登场——后者于9月20日开放权重,并在同一天的云栖大会上展示;同时还有腾讯的 Hy Image 3.5 预览版,这是一款专业图像模型,在腾讯云 API 上 2K 图像定价为每张 0.15 元。宇树也利用同一时间窗口发布了 Dex5-S,一款拥有 22 个自由度的灵巧机械手,起售价 6,500 美元。
阿里巴巴还借这场大会宣布,Qwen3.8-Max 在 Artificial Analysis 的智能体排行榜上位列第一,在前端编程的 CodeArena 上排名第一,并表示 Qwen4 正在训练中,后续模型的参数规模计划达到五万亿至十万亿。其 Qwen-Image 负责人指出,团队的目标是降低完成一项任务的成本,而不是把参数数量最大化——这与 MiMo 的双档结构所做的权衡如出一辙。
这些发布彼此并无协调,却都指向同一个方向。今秋中国 AI 的竞争问题,不是前沿级模型是否存在,而是你被允许握住其中多少。
基准测试的注意事项
像 46 这样的数字完全取决于其背后的指数,而 Artificial Analysis 的智能指数只是众多综合指标之一。与 Claude Opus 5 和 GPT-5.6 Sol 的对比由小米做出,用的是小米挑选的基准测试,而“大多数智能体基准”这一说法所承担的说服力,一张结果表格能做得更好。智能体基准测试尤其对脚手架(scaffolding)敏感:同一个模型,因周围框架不同,得分可能天差地别。
让这一宣称不止于营销的,是那份下载包。任何怀疑 46 分的人都可以运行这个模型、阅读报告,并在小米提供的环境里重新训练它。这比排行榜截图是更严苛的检验,而它之所以可行,只是因为公司选择把配方连同结果一并公开。