← 返回博客
Ai预计阅读 9 分钟

蚂蚁集团 Ling 3.1 Flash 在 560B 参数中激活 25B,得分 41

发布于 2026年10月6日
蚂蚁集团 Ling 3.1 Flash 在 560B 参数中激活 25B,得分 41

--- title: 蚂蚁集团 Ling 3.1 Flash 在 560B 参数中激活 25B,得分 41 meta_title: Ling 3.1 Flash 以 25B 的账单承载 560B 参数 meta_description: 蚂蚁集团的 Ling 3.1 Flash 在 Intelligence Index 上得分 41,总参数 560B,激活 25B,展示稀疏 MoE 能走多远。 ---

蚂蚁集团的 AntLingAGI 于 10 月 6 日发布了 Ling 3.1 Flash。最引人注目的数字是模型运行时实际激活的 250 亿个参数,而总参数为 5600 亿。

该模型在 Artificial Analysis Intelligence Index 上得分 41,较其前代明显提升。评估特别指出,智能体能力是提升最显著的领域,而这一类别已开始被企业买家赋予最高权重。

架构即论点

Ling 3.1 Flash 是一个混合专家(MoE)模型。它总共有 5600 亿个参数,但每个 token 仅激活约 250 亿个,并支持最多 100 万 token 的上下文窗口。

这个比例就是全部卖点。能力相近的稠密模型,在生成每个 token 时都需要调动全部参数。而稀疏模型通过将每个 token 路由到一小部分专家,以少得多的计算量给出相近输出。代价是内存:全部 5600 亿个参数仍然必须常驻在某处,尽管在任意一次前向传播中大多数都处于闲置状态。

一小簇发光的金色节点,通过细小的光轨穿过由暗淡灰色节点组成的矩阵相连

实际结果是:只要团队拥有能容纳权重的硬件,模型就能以同等质量水平下稠密模型成本的一小部分来提供服务。这与今年大多数前沿开放权重发布背后的工程故事相同,也正是为什么真正值得关注的指标已从总参数转向激活参数。

基准测试覆盖哪些方面

蚂蚁集团公布了一系列评估结果:GDPVal-AA v2.1 达到 1673 Elo,FrontierSWE 为 75.16,HealthBench 为 65.35,以及在 Design Arena 中,它在移动应用和 SVG 生成方面排名接近榜首。

Intelligence Index 得分 41 是头条新闻,它让该模型跻身来自规模大得多的实验室的发布之列。蚂蚁集团表示,完整模型将开源,文档已经发布。与此同时,为期两周的免费试用正在进行。

工程演示比分数更能说明问题

蚂蚁集团还描述了三个完整示例,这些示例比排行榜更能说明其预期用途。

第一个:从零构建 Lua 到 x86 的编译器,通过 182 项测试中的 178 项。在这类任务中,模型必须在脑中记住一份庞大的规范,在多个文件中生成内部一致的代码,并始终跟踪边界情况。这项工作会惩罚长上下文处理能力较弱的模型。

第二个:加速大型 Python 代码库的类型检查。这是维护任务而非全新开发任务,而大多数真实工程时间实际上正花在这里。一个能推理现有代码库类型关系的模型,其有用性是一个只会编写新函数的模型所不具备的。

第三个:构建一个协调浏览器、本地文件和终端工具的桌面智能体。多工具编排是当前智能体工作的前沿,也是基准测试跃升所指向的能力。

这三项均为公司报告,尚未被独立复现。尤其是 182 项测试的编译器声明,需要外部验证,因为只有测试具有代表性时,通过测试才有意义。一个能处理常见语法但在不常见用例上失败的编译器,仍然可以在与模型同一周编写的测试套件上取得好成绩。

这里还有一个更广泛的模式值得注意。中国实验室越来越多地使用工程演示而非基准分数作为主要营销手段,因为基准测试已变得含糊,而演示是具体的。代价是,演示只展示了问题空间中的一条轨迹,完全无法说明结果的分布。

更长期的趋势:中国开放权重持续在做什么

Ling 3.1 Flash 符合贯穿全年的一个模式。中国实验室以宽松许可证发布前沿规模的开放权重,其节奏没有西方实验室能匹敌,而且它们竞争的是效率而非单纯规模。

背景值得直说。运行这类模型的开发者拥有推理栈,这意味着没有按 token 计费的 API 成本,没有数据离开自己的场所,也没有第三方决定模型何时变更。对于有隐私限制或工作负载可预测但繁重的团队来说,这值真金白银。

Victor Taelin 本月指出,没有任何开放模型仍留在 Artificial Analysis 排名前 25 名中,最好的模型——小米的 MiMo——位列第 26。Ling 3.1 Flash 在 Intelligence Index 上的 41 分是智能得分而非排名,因此这两个数字衡量的是不同事物,而最佳开放模型与最佳闭源模型之间的差距仍然真实存在。变化在于,现在这一差距以分数衡量,而不是以开放模型究竟能否胜任来衡量。

对于选模型的人来说,这意味着什么

有三点考虑比参数比例更重要。

许可证与部署条款。蚂蚁集团表示该模型将开放,但具体许可证决定商业使用是否不受限制。鉴于“开放权重”和“宽松许可证”在被混为一谈时其实并不相同,在任何生产依赖之前,这些条款都值得仔细阅读。同样的谨慎也适用于发布前公布的文档,它描述的是能力而非义务。

上下文窗口声明。100 万 token 是个很大的数字,但可用上下文通常比宣传的短。模型是在整个窗口内保持质量,还是在远未达到窗口上限前就退化,这才是决定其对长文档和大型代码库工作是否有用的问题。蚂蚁集团自己的长上下文演示表明该模型能处理大输入,不过这些同样是厂商测试。

内存需求。560B 的稀疏模型不是笔记本电脑上的部署。激活参数的故事降低的是每个 token 的计算量,而不是权重的占用空间,任何计划自托管的人都应按总参数量而非激活参数量来配置硬件。这个区别经常让人栽跟头。一个被描述为激活 25B 参数的模型听起来很小,直到你尝试加载它——此时完整的 560B 参数必须被安放在某处。

还有一个实际的支持问题。来自频繁发布模型的实验室的模型会被取代,团队应规划迁移路径。蚂蚁集团的发布节奏表明,Ling 3.2 或 Ling 4 只是几个月内的事,这对能力提升是好事,但对任何围绕某一版本构建微调或部署脚本的人来说却很尴尬。

Ling 3.1 Flash 是来自一家持续稳定发布成果的实验室的有力发布。真正的新闻是结构性的:一个激活 25B 的模型,如今可以可信地与规模大得多的稠密系统并列讨论。这正是整个稀疏 MoE 研究路线一直在提出的论点,而基准测试终于开始支持它。

相关文章