← 返回博客
News预计阅读 11 分钟

Aleph Alpha 推出 780 亿参数开放权重模型,守住欧洲的数据边界

发布于 2026年10月4日
Aleph Alpha 推出 780 亿参数开放权重模型,守住欧洲的数据边界

10 月 3 日,Aleph Alpha 发布了 Kolibri-1——一个 780 亿参数的混合专家(MoE)语言模型,并以 Apache 2.0 许可证在 Hugging Face 上公开了完整权重。这家德国公司针对德语和英语对它进行了调优,为它加入了显式的推理模式和工具调用能力,并把营销目标锁定在那些无法或不愿把工作负载交给美国超大规模云厂商的公共部门与受监管行业买家。

技术参数是最容易讲的部分。100 万 token 的上下文窗口、让推理成本低于参数规模所暗示水平的混合专家架构,以及可按需开启的独立推理模式。在 2026 年末,这些对一款准前沿模型来说只是入场门槛。真正让 Kolibri-1 值得再看一眼的,是它的定位叙事。

主权才是产品,许可证不是

如今人人都能下载开放权重。Llama 的衍生物、Qwen 的衍生物、DeepSeek 的衍生物、Mistral 的衍生物。这堆东西又厚又深,而且每周都在变多。Aleph Alpha 无意在纯粹的能力上竞争,它似乎也很清楚这一点。它卖的其实是同一个想法的另一个版本,只不过附带了合规叙事:这个模型诞生于欧洲,为欧洲语言而做,遵循欧洲规则,而且你能把它跑在自己的围墙之内。

对于一个德国政府部门、一个医院集团,或一家承担严格数据驻留义务的银行来说,这套说法很有转化力。替代方案是用美国 API,数据要跨越大洋,服务条款还可能随着一次产品发布就变。替代方案也可能是中国的开放权重模型,而对欧洲公共部门买家来说,这又会带来一堆自己的采购问题。

这里存在一个真实的市场,而它奖励的并不是世界上最好的模型,而是买家被允许使用的最好的模型。

这个上下文窗口是冲着文档去的,不是冲着聊天

100 万 token 这个卖点其实有点奇怪。大多数对话根本用不到这个量级。真正在意它的是那些把法律档案、采购记录、内部政策手册和几十年的监管申报文件一股脑喂进系统,并要求它跨全部材料进行推理,而不希望中间插入一个会丢掉一半上下文的检索步骤的买家。

昏暗的地下室过道,钢制货架上堆满密封的素色档案箱

Aleph Alpha 把长窗口和“拒答训练”配在一起,后者常被忽视,却决定了系统是否真的可用。对一个合规官来说,一个会说“我没有足够信息回答这个问题”的模型,比一个会编造引用的模型有价值得多。在受监管的工作里,一个自信的错误答案比没有答案更糟,因为总得有人花一周时间去证明它是错的。

开放权重这堆东西越来越拥挤,也越来越细分

Kolibri-1 并不是孤例。10 月最初几天,一连串开放权重发布接连登场,各自占据一个细分生态位。通过 Cloudflare 的 Workers AI 平台,两个由公共资金支持的欧洲模型开始商业可用:覆盖欧盟全部 24 种官方语言的 EuroLLM,以及瑞士模型 Apertus——它在 1500 多种语言上训练,40% 的数据来自英语之外。Cloudflare 还推出了 Clef,一个 270 亿参数、采用 Apache 2.0 的模型,瞄准的是更窄的任务。

把它们放在一起看,模式就是各自选一条赛道。这群里没人试图在通用推理上击败最大的闭源模型,因为在这场较量中开源一方早已落败,大家心里都清楚。它们瞄准的是有特定约束的买家:大模型处理得很差的语言、对数据流动有监管的司法辖区,以及用更小的专用模型跑起来更便宜的任务。

这比每次发布都正面强攻前沿要健康得多。这意味着一个欧洲政府部门可以为德语长上下文任务选择 Kolibri-1,为某门稀有语言选择 Apertus,为整个欧盟范围内的翻译选择 EuroLLM,从而拼出一套任何单一美国厂商都无法提供的技术栈。开放权重生态不再只是廉价替代品,而开始变成一份菜单。

同样的逻辑也延伸到许可证。对希望被商业采用的模型来说,Apache 2.0 和 MIT 正在成为默认选项,因为任何更严格的条款都会招来一场拖死试点项目的法务审查。Aleph Alpha 刻意选择了宽松路线,上海 AI 实验室在其近期发布中也做了同样的事。许可证如今已是产品卖点的一部分。

开放权重真正改变了什么

Apache 2.0 消除了大部分法律摩擦。公司可以用内部数据微调 Kolibri-1,部署在自己的硬件上,并把结果打包进产品发布,既不用付许可费,也不用申请授权。对于一直卡在“能力够强但无法审计的闭源 API”和“弱到无法交付的开源模型”之间的团队来说,这是一扇新开的门。

它也抬高了其他人的门槛。一旦一个 780 亿参数、支持百万 token 上下文的开放权重系统以宽松许可证存在,下一个“主权模型”就必须跨过这道线,否则就得解释为什么跨不过。法国、韩国、日本和海湾地区的国家实验室都放出过类似风声。Kolibri-1 不会终结这场竞赛,但它为其中的欧洲赛段定了节奏。

它可能在哪些地方不够看

这个体量的开放权重很难跑起来。一个 780 亿参数的混合专家模型,无论是 FP8 还是全精度版本,都需要相当硬核的硬件,而“你可以自托管”这句话,只对那些已经拥有硬件或有预算购置硬件的组织才成立。对单个开发者而言,Kolibri-1 是一个研究对象,而不是日常干活的工具。

还有一个伴随所有厂商自报基准而来的诚实问题。模型卡上写着不错的结果。独立评测需要数周时间,在结果出来之前,与 Llama 级或 Qwen 级模型的对比只是厂商的说法,而非经过测量的事实。有意思的问题不是 Kolibri-1 能否击败最大的闭源模型——它几乎肯定做不到。问题在于,它能否击败一个欧洲买家现在就能下载到的那些开放权重模型,以及为此要开出多大金额的支票。

这个论证的形态本身就是故事

剥掉营销外衣,Kolibri-1 其实是一个赌注:AI 采购的未来会按国界分裂。一个阵营想要市面上最聪明的模型,并愿意接受由此产生的依赖。另一个阵营想要一个够用、且完全在自己掌控之下的模型。Aleph Alpha 是为第二个阵营而造的,模型规模是按第二个阵营定的,许可证定价也是照它来的。

这个赌注未必能赢。但一家公司能够融到钱、训练出一个 780 亿参数模型,并以 Apache 2.0 免费送出,只为赢得主权买家——这件事本身就说明,至少有一部分市场正在朝哪里走。能力不再是唯一的维度。控制力正在变成一项可以卖钱的功能。

更难的问题是,当每个地区都有自己的版本时会发生什么。碎片化是有代价的。一套只为德语和英语调优的权重,服务不了韩国的医院系统或巴西的银行,而这些买家各自都会想要一个按自己规则打造的模型。这意味着要维护更多的主权技术栈、更多重复投入,以及更缓慢地走向那些在单一生态主导时惠及所有人的共享改进。

Aleph Alpha 的答案就藏在这份发布里。它没有服务所有人的野心。它服务的是那些已经认定控制权重于便利的买家,而这样的买家足够多,足以养活一家公司。这究竟是一门可持续的生意,还是一次踩准监管情绪的押注,未来两年会给出答案。不管怎样,这个模型现在已经存在,而且可以免费下载——这对任何一直在等待“许可”的人来说,都改变了算盘。

相关文章