← 返回博客
Ai预计阅读 9 分钟

Mistral Large 4:欧洲以万亿参数押注开放权重

发布于 2026年10月11日
Mistral Large 4:欧洲以万亿参数押注开放权重

10 月 6 日,Mistral AI 将一款万亿参数模型投入公开预览,并给它起了个昵称:Le Chonk。这家法国实验室称,Mistral Large 4 是来自美国或欧洲的最强开放权重模型。模型权重本身要到 10 月 27 日才会发布,但 API 已经上线,基准测试结果也已公开。

这个昵称是个玩笑,但背后的数字并不小。Large 4 以稀疏专家混合(MoE)架构承载 1.05 万亿总参数,并在任意给定任务上激活约 490 亿参数。Mistral 自己的文档在一处取整为 520 亿激活参数,而早期报道在另一处引用的是 490 亿。无论哪种说法,设计目标都是如今每家大型实验室追逐的同一个目标:获得超大模型的能力,却不必为每个 token 运行全部参数买单。

内部究竟有什么

该模型原生多模态。Mistral 将语言主干与一个独立的 16 亿参数图像编码器配对,可处理文本和图像。上下文窗口达到 100 万 token。训练数据高度偏重多语言,覆盖 160 多种语言,包括欧盟所有官方语言。

Mistral 在自己的欧洲数据中心内,用大约 3,800 到 4,000 块 Nvidia Grace Blackwell GPU,从头训练 Large 4,耗时约两个月。同一批硬件现在为公开预览提供服务。该公司还表示,强化学习仍在模型上运行,因此预计未来几周数字还会变化。

一个由许多小节点构成的密集发光核心,只有一条细窄的带状区域同时亮起

仔细解读基准测试表

在智能体编程方面,Mistral 报告 DeepSWE v1.1 上为 61.7%,SWE-Atlas-QnA 上为 59.4%,Terminal-Bench 4 上为 28.3%,综合编程智能体指数为 49.8%。按该公司的说法,这一数字略高于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。在 AutomationBench 上,该测试跨 Gmail、Google Sheets、Slack 和 Salesforce 等工具运行 657 项业务流程,Large 4 得分为 59.9%。

最有趣的声明与视觉定位有关。在 Dense 200 基准测试中——该测试衡量模型在图像中定位特定对象的能力——Mistral 将 Large 4 定为 42%,比 GPT-6 Astra 的 41% 高一个百分点。单项评估中一个百分点的差距并不构成完胜,也不应被解读为完胜。但这类任务恰恰是开放模型落后于闭源模型的地方,因此能追平值得注意。

网络安全是语气从营销转向论证的地方。Mistral 称 Large 4 在 Artificial Analysis Cyber Index 上位列全球前五。它报告称,在复现并修补开源软件真实漏洞方面成功率为 82%,在 Cybench 的 40 道安全竞赛题上成功率为 93%。该公司还提出一个尖锐观察:一些闭源模型完全拒绝复现漏洞,因为该请求看起来像攻击性活动,这导致它们在同一测试中的得分接近零。

一项盲评给出了更扎实的图景。在与 Surge AI 合作的一次测试中,专业评审在不知道模型身份的情况下,按五分制对生成的代码打分。Large 4 得分 3.74。Claude Opus 5 得分 4.22,GLM-5.3 得分 3.60。因此,就人类评判的代码质量而言,Large 4 在参与比较的五款模型中位列第二,领先于开放竞争对手,但落后于闭源领先者。

这些数字全部来自 Mistral。它们是初步的、自我报告的,尚无独立第三方复现。请将它们视为一个有力的初步声明,而非已定论的结果。

定价与开放权重之赌

API 现已通过 Mistral Studio 和 OpenRouter 提供。标价为每百万输入 token 1.36 美元、每百万输出 token 4.18 美元,发布促销价为半价,即 0.68 美元和 2.09 美元。10 月 27 日,权重将发布,任何人都可以下载并在自己的硬件上运行 Large 4,无需租用访问权限。

最后这一点正是整个战略所在。Mistral 在算力支出上无法超过 OpenAI 或 Anthropic,也无法匹配中国开放权重实验室几乎每月发布大型模型的节奏。它能提供的是控制权。有数据驻留规则的企业,或需要模型帮助复现漏洞且不希望提供商拒绝请求的安全团队,能得到托管闭源模型无法提供的东西。Mistral 大力强调这一点,称 Large 4 从头到尾都在欧洲打造,并可通过其自有云从欧洲部署。

竞争时机让利害关系更加清楚。由 Nvidia 投资的实验室 Reflection AI 于 10 月 5 日发布了 5010 亿参数的开放权重模型,比 Large 4 早一天。包括阿里巴巴、Z.ai、Moonshot 和 DeepSeek 在内的中国实验室,过去两个月一直在滚动发布强大的开放模型。追踪基准测试趋同的分析师报告称,在部分推理任务上,开放权重模型与专有模型之间的差距已经缩小,高端专有 API 价格也因此下降。Mistral 正在进入这样一个市场:成为最大的开放模型,不如成为最受信任的开放模型更有价值,而信任建立在许可证和部署选项上,而非参数数量上。

网络安全红队测试也遵循同样的逻辑。在权重发布前,Mistral 正向经过审查的合作伙伴和国家当局提供同一模型的访问权限,“降低审核力度并扩展网络能力”。该公司认为,提供商层面的拒绝可能阻碍合法的安全事件响应,而在事件处理中途失去对工具的访问本身就是一种风险。

此次发布还恰逢一个特定时刻。Mistral 最近完成了一轮融资,估值超过 240 亿美元,三星是新投资者之一。Reflection AI 仅早一天发布了 5010 亿参数的开放模型。开放权重这一层级正变得拥挤,差异化因素不再是单纯的规模。

这改变了什么,又没有改变什么

Large 4 并未在每项任务上弥合与最佳闭源模型的差距,Mistral 也并未完全这样宣称。它所做的,是在少数对企业重要的任务上缩小差距,并搭配一套这些企业真正需要的许可和部署方案。如果 10 月 27 日发布的权重在外部测试中站得住脚,那么实际问题将不再是开放模型在抽象意义上是否足够好,而是它对某一具体、定义明确的工作是否足够好。

更罕见、值得关注的声明是网络安全方面的。一个能帮助安全团队在自己的策略下、在自己的硬件上修补真实漏洞的模型,与一个拒绝请求的聊天机器人是不同类型的产品。如果这一点成立,它可能比编程基准测试上的几分更重要。如果外部测试者发现 82% 这一数字无法在 Mistral 自身环境之外复现,那么这套说辞就会退回到价格和可移植性上,而这是一个拥挤的立足之地。

无论如何,欧洲现在有了自己的旗舰模型可供争论。这场争论将在 10 月 27 日正式开始。

相关文章