← 返回博客
Ai预计阅读 10 分钟

Ai2 开源的是训练栈,而不是又一套权重

发布于 2026年10月5日
Ai2 开源的是训练栈,而不是又一套权重

艾伦人工智能研究所(Allen Institute for AI)发布了 Olmo-core 3,这是一套面向万亿参数规模混合专家(MoE)模型的开放训练基础设施。最引人注目的基准是:一个 470 亿参数的 MoE 在八块 B300 GPU 上达到了此前配置约 2.7 倍的吞吐量。这个数字值得称道。但它也不是这次发布之所以重要的原因。

权重很容易送出去,却很难从中学习。下载一套权重,你就能运行一个模型。但如果不从头重建训练流程,你就无法复现它、审计它,或用自己的数据重新训练它。Olmo-core 3 发布的正是这套流程。

不断被提及的区别

开放权重与开放训练是不同的产品,而二者之间的差距,正是大多数有用信息所在之处。

一个已发布的模型告诉你某个团队取得了什么成果。一套训练栈则告诉你他们是如何做到的,而如果你想自己做,这正是你需要的东西。对于发布组织之外的任何人来说,后者有用得多,也罕见得多,因为训练代码、数据流程和配置细节,正是最耗时间才能做对的部分。

混合专家让这一点变得更重要,而不是更不重要。MoE 模型会把每个 token 路由到一部分专家,因此一个总参数量达到万亿的模型,每个 token 可能只激活其中一小部分。这种设计降低了推理成本,但也引入了路由决策、专家之间的负载均衡,以及跨设备的通信模式,这些都非常难以调优。两个团队可能拥有完全相同的模型架构,却因为训练循环中的选择不同,吞吐量差异巨大。

发布训练基础设施意味着这些选择是可见的。这正是 2.7 倍吞吐量数字有意义的原因,因为它附带着别人可以运行和验证的代码。

一块图形加速卡平放在深色桌面上,旁边有一张空白索引卡

为什么 MoE 训练才是难点

稠密模型的扩展是可预测的。增加参数,增加算力,就会得到一条平滑曲线。MoE 模型则引入了调度问题。如果路由器将大多数 token 发送给少数专家,这些专家就会成为瓶颈,其余硬件则处于闲置状态。如果它把 token 分得太均匀,模型又会失去让这种架构具有吸引力的专业化能力。

要把它做对,需要容量因子、辅助损失和通信叠加机制,而大多数实验室都将其视为专有技术。它还需要能够挺过硬件故障的检查点机制,因为这种规模的训练必然会遇到故障,而从头重启并不是一个选项。

Ai2 报告的八块 B300 GPU 上的吞吐量提升是小规模结果,也应该这样解读。证明训练循环在单个节点上高效,并不等于证明它在数百个节点上依然成立——在那种规模下,节点间通信会占据主导。但这是正确的第一个结果,因为效率问题通常先在小规模上出现,并随着规模扩大而变得更糟。

为什么八块 GPU 上的吞吐量是正确的第一个数字

与万亿参数的框架相比,小规模吞吐量结果看起来并不起眼,但它值得为之辩护。训练效率问题往往出现得很早,并且会越来越严重。如果一个训练循环在单个节点上浪费了三分之一的计算,那么当加入节点间通信后,同一个循环会浪费更多,因为低效会随着每一层协调而累积。

先发布小规模数字,是在对大型集群作出声明之前,表明基础是扎实的。这也是正确的起点。一个先报大规模数字、后报小规模数字的团队,通常报告的是峰值,而不是持续速率。

这个数字重要还有第二个原因。MoE 吞吐量对批量大小和序列长度的敏感程度是稠密模型所没有的,而在八块 GPU 上最大化效率的配置,经过调优后往往可以推广到更大的集群。2.7 倍的提升足够大,说明它反映的是结构性变化,而不是调参细节,因此值得关注。

它的受众比权重的受众要小

大多数谈论开放模型的人都想要权重。他们想运行推理、在某个领域微调,或者构建产品。这个群体可以从每一次开放权重发布中得到满足。

需要训练栈的群体则小得多:研究实验室、国家算力项目、拥有集群访问权限的大学,以及必须记录模型如何产生的受监管行业公司。这些用户一直得不到良好服务,因为他们只能在从零构建流程和使用只适用于特定厂商硬件的东西之间做选择。

开放训练栈改变了第二个选项。它为实验室提供了一个可以修改的起点,也为政府项目提供了一条通往主权模型的路径,而不必依赖外国厂商是否愿意分享实现细节。

发布这样的东西具有战略意义,而 Ai2 在这方面一直很一致。该研究所的模型发布时附带数据、代码和训练日志,这比只发布权重和一篇论文的标准更严格。

关于开放训练的无声争论

开放模型社区内部正在争论开放应该意味着什么,而这样的发布推动了这场争论。

一种立场认为,重要的是权重,因为人们使用的就是权重。按照这种观点,发布模型是一种馈赠,而训练细节属于公司的私事。另一种立场认为,没有训练栈的模型无法被原始团队之外的人审计、复现或改进,把这样的发布称为开放,夸大了它所提供的东西。

第二种立场正在获得支持,原因很实际。多个司法管辖区的监管机构已经开始要求模型开发者记录训练数据和来源。使用已发布流程训练的团队可以回答这些问题。微调借用权重的团队则不能,因为它不知道这些权重里包含了什么。

对研究机构来说,这笔账很简单。发布一套训练栈会耗费工程时间,但不会在商业上失去什么,因为机构并不销售 API 调用。对商业实验室来说,这样做会把先发优势拱手让给竞争对手。正是这种不对称,使得开放训练栈来自研究所和大学的频率远高于公司,也使得每一个出现的开放训练栈都值得审视。

值得关注什么

吞吐量结果能否在规模化时依然成立。真正有意思的测试不是八块 GPU,而是几百块 GPU——届时 Olmo-core 3 所编码的通信模式要么奏效,要么不奏效。

外部实验室是否真的采用它。当别人用它训练出一个模型并发布结果时,训练栈才会传播开来。第一次可信的复现会比任何基准表都更有信息量。

开放训练是否会改变采购。需要记录模型来源的组织,选择一直很有限。如果完整的训练流程在宽松许可证下可用,其中一些组织会基于它来构建,而不是为闭源替代方案付费。

权重发布之所以引人关注,是因为任何人都能下载并尝试。训练发布才是该领域真正知识转移的地方,而这样的发布要少得多。这一次值得仔细阅读,因为模型中可迁移的部分,是它背后的过程。

相关文章