Reflection AI 刚刚发布 Beam:一款 501B 开放权重模型,被誉为美国对中国实验室的回应

10 月 5 日,Reflection AI 发布了其首个开放权重模型 Beam,并以毫不掩饰的地缘政治措辞来定义这次发布。这家总部位于纽约的初创公司由两位前 DeepMind 研究员于 2024 年创立,称 Beam 是企业、政府和开发者的主力工具,帮助他们运行并定制前沿级模型,而无需依赖中国的权重。
Beam 是一个稀疏专家混合系统,总参数量为 5010 亿,每次任务激活 230 亿参数。Reflection 计划本月晚些时候根据 Apache 2.0 发布权重,并附带技术报告和模型卡。目前,该模型处于早期访问阶段,独立基准测试尚未公开。
最后这一点决定了应如何看待这次发布。
数字究竟说明了什么
公司自己的对比显示,Beam 在编码和智能体任务上接近 Z.ai 的 GLM-5.2,并正在逼近阿里巴巴的 Qwen 3.8-Max。从参数量来看,这是一个合理的比较。GLM-5.2 总参数量约为 7440 亿,激活参数为 400 亿,因此 Beam 是更小的网络,每个 token 激活的专家更少。

更值得关注的是效率方面的说法。CEO Misha Laskin 对 Semafor 表示,与同类开放模型相比,Beam 推理一个问题所需的算力仅为可比开放模型的三分之一到四分之一。如果这一点成立,其重要性超过排行榜名次,因为运行模型的成本决定了是否有人会持续运行它。
Reflection 以 250 亿美元的投前估值完成融资,投资方包括英伟达、红杉资本和花旗集团。据报道,英伟达的投资额为 8 亿美元,这让一家硬件供应商同时站在开放权重争论的两边:人们运行的模型越多,购买的芯片就越多。
为什么美国的开放模型也是一个硬件故事
两年来,开放权重一直是中国的一项优势。DeepSeek、Qwen、Kimi 和 GLM 树立了性价比标杆,西方企业开始将重复性工作交给它们处理,从客户服务到常规代码生成。这种采用造成了尴尬的依赖。一家无法检查或自行托管其所依赖模型的公司,对自身技术栈的控制力有限。
Beam 正是瞄准了这一缺口。Laskin 对 Semafor 的推介很直白:那些正在构建主权 AI 系统、不愿或不能使用中国模型的组织,“如今并没有真正很好的选择。”
Beam 即将进入的赛场
Reflection 并不是第一家尝试此事的西方实验室。Thinking Machines Lab 和 Mistral 也发布开放权重模型,并且都已占据一席之地。Beam 的不同之处在于规模和定位。它拥有 5010 亿总参数和 230 亿激活参数,瞄准的是前沿层级,而非大多数西方开放模型竞争的高效助手层级。
这一层级的经济账非常苛刻。这种规模的模型服务成本高昂,而愿意运行它的公司既关心每美元吞吐量,也同样关心基准排名。这就是为什么效率主张是 Reflection 推介的核心,也是为什么它最需要被验证。一个在质量上与 GLM-5.2 相当、但服务成本相同的模型,会消除买家从中国模型转向它的主要理由。
许可证的选择传递了意图。Apache 2.0 允许商业使用、修改和再分发,义务极少,当目标是采用而非控制时,这就是你的选择。想要直接通过权重变现的实验室会选择更严格的许可证。Reflection 押注的是,在基础设施层实现无处不在,比把这一产物把守起来更有价值。
底层还有算力故事。Reflection 与 SpaceX 签署协议,获得 Colossus 2 数据中心的容量,并与美国能源部建立了合作关系。对于训练这种规模模型的公司来说,这些安排至关重要,它们也将这家初创公司与一系列公私机构绑定在一起,而这些机构本身也有理由希望获得中国权重的本土替代品。
仍然只是声称的部分
上述一切都基于 Reflection 自己的评估。发布时第三方基准测试并未公开,权重也尚未发布。在厂商测试中胜过对手的模型,与在生产流水线中胜过对手的模型,是两回事。
与 GLM-5.2 的比较也比宣传框架所暗示的更狭窄。在编码和智能体任务上追平一个中国模型,同时在同一维度上逼近另一个,如果能够复现,确实是一项真实成果。但这并不等于在整个开放权重领域实现竞争力持平,该领域涵盖的模型在优势、许可证和部署形态上差异很大。
Reflection 表示,它已经在训练一个后续模型,其能力将“强大得多”。这话说得合理,却很难验证。
时机并非偶然
Beam 落地于一个特定的监管时刻。整个夏季,一系列涉及自主模型的安全事件将 AI 监管推上了政治议程,美国领先实验室在白宫会议后签署了一项自愿安全协议。该协议依赖企业自我约束,而非联邦法规,围绕它的政治盘算可能会随 11 月中期选举发生变化。
Reflection 表示,此刻进入开放权重业务的理由,是为了在那场对话中占有一席之地。Laskin 对 Semafor 说,公司希望开放模型的构建者为监管辩论做出贡献,理由是开放和闭源开发者都应政府合作,而不是被政府从外部监管。一个西方企业和机构能够自行运行的开放模型,在这场辩论中是一个具体论据,而政策文件做不到这一点。
这一框架也解释了为什么该公司正与美国超级智能创新与标准促进中心以及英国 AI 安全研究所合作,对该模型进行评估。获得独立安全评估,是先发制人地回应针对开放权重最响亮的反对意见的一种方式,即发布权重会取消监督。
值得关注的信号
三个信号将决定问题的答案。
第一个是权重本身。Apache 2.0 允许商业使用和修改,几乎没有附加条件,对于试图培育生态系统的公司来说,这是一个刻意宽松的选择。发布的产物是否与基准测试声明相符,是第一项考验。
第二个是第三方评估。对效率声明的独立复现,或复现失败,将比任何发布文章更能影响采用。
第三个是企业行为。公司已经花了一年时间学习将常规工作交给廉价模型,把前沿模型留给难题。如果 Beam 在成本和能力上落在两个层级之间,它就有市场。如果它更接近昂贵的一端,又没有决定性的质量优势,地缘政治也带不动它。
开放权重竞赛同时是一场价格触底的竞赛和一场能力登顶的竞赛。Reflection 正同时进入这两场竞赛,带来一个鼓励复制的许可证和一项鼓励检验的声明。公司已经说了正确的话。现在,权重必须自己把这些话说出来。
相关文章
Cloudflare 发布 270 亿参数决策模型,在 Jev 自己的本职工作上将其击败
有些模型调用应该返回一个数字,而不是一段文字。一个类别正围绕这一理念形成。
BOSSFIGHT 让前沿模型当 24 周咖啡店老板。大多数输给了什么都不做。
在测验中抵制贿赂,和在真实季度中拒绝妥协,是两种不同的技能,而当前的评估倾向于衡量更容易的那一种。
NASA 与 IBM 开源基于 17 年轨道器数据训练的月球基础模型
该模型可用于发现和表征特征,但在高精度说明特征确切位置方面不可靠。
四步而非四十步:蒸馏如何将开放图像模型压缩进消费级 GPU
低步数蒸馏是一种取舍,而非免费午餐。文本保真度、编辑精度和多参考一致性会最先受损。