Mistral Large 4:歐洲以一兆參數押注開放權重

10 月 6 日,Mistral AI 將一個一兆參數模型放上公開預覽,還給它取了個暱稱:Le Chonk。這家法國實驗室表示,Mistral Large 4 是美國或歐洲至今最強的開放權重模型。權重本身要到 10 月 27 日才會發布,但 API 已經上線,基準測試結果也已公開。
這個暱稱帶點戲謔,但背後的數字可不小。Large 4 以稀疏混合專家(MoE)架構承載 1.05 兆總參數,並在任何給定任務中啟用約 490 億個參數。Mistral 自家文件在一處將啟用參數進位為 520 億,早期報導則在另一處提到 490 億。無論如何,設計目標都是如今每家大型實驗室追求的同一件事:取得超大模型的能力,又不必為每個 token 支付運行全部參數的成本。
內部實際架構
該模型原生支援多模態。Mistral 將語言主幹與一個獨立的 16 億參數影像編碼器搭配,可處理文字與圖像。上下文視窗達到 100 萬個 token。訓練資料極度偏重多語言,涵蓋超過 160 種語言,包括歐盟所有官方語言。
Mistral 在自家歐洲資料中心內,用約 3,800 至 4,000 顆 Nvidia Grace Blackwell GPU,從零開始訓練 Large 4,歷時約兩個月。同一批硬體如今也用來服務公開預覽。該公司還表示,模型上的強化學習仍在進行,因此預期接下來幾週數字還會變動。

基準測試表,仔細解讀
在代理式程式開發方面,Mistral 回報 DeepSWE v1.1 為 61.7%、SWE-Atlas-QnA 為 59.4%、Terminal-Bench 4 為 28.3%,合併後的 Coding Agent Index 為 49.8%。根據該公司說法,這個數字微幅超越 DeepSeek V4 Pro 0813 與 Qwen3.8 Max。在 AutomationBench 上,該測試橫跨 Gmail、Google Sheets、Slack 與 Salesforce 等工具、執行 657 項業務工作流程,Large 4 得分 59.9%。
最有趣的說法是關於視覺定位。在 Dense 200 基準測試中,該測試衡量模型能否在圖像中定位特定物件,Mistral 將 Large 4 列為 42%,比 GPT-6 Astra 的 41% 高一分。單一評估上的差距一分並不代表擊倒,也不該被解讀成擊倒。但這正是開放模型過去落後閉源模型的任務類型,因此打成平手值得注意。
資安是語氣從行銷轉為論辯的地方。Mistral 表示 Large 4 在 Artificial Analysis Cyber Index 上名列全球前五。它回報在重現與修補開源軟體真實漏洞方面成功率達 82%,在 Cybench(一套 40 道安全競賽題目)上則達 93%。該公司還提出一個犀利觀察:有些閉源模型完全拒絕重現漏洞,因為這類請求看起來像攻擊性活動,導致它們在相同測試中的分數趨近於零。
一項盲測則講述了更踏實的故事。在與 Surge AI 合作的一次測試中,專業評審在不知道程式碼由哪個模型撰寫的情況下,以五分制為生成的程式碼評分。Large 4 落在 3.74。Claude Opus 5 得分 4.22,GLM-5.3 得分 3.60。因此,以人類評判的程式碼品質而言,Large 4 在受比較的五個模型中排名第二,領先開放競爭對手,但落後閉源領導者。
這些數字全都來自 Mistral。它們是初步的、自報的,且尚無獨立第三方重現。請把它們視為強而有力的初步主張,而非已成定論的結果。
定價與開放權重押注
API 目前已可透過 Mistral Studio 與 OpenRouter 使用。定價為每百萬輸入 token 1.36 美元、每百萬輸出 token 4.18 美元,上市促銷價為半價,即 0.68 美元與 2.09 美元。10 月 27 日權重將發布,任何人都能下載,並在自己的硬體上運行 Large 4,無需租用存取權。
最後這一點就是整套策略。Mistral 在算力上無法比 OpenAI 或 Anthropic 花更多錢,也跟不上中國開放權重實驗室幾乎每月發布大型模型的節奏。它能提供的是控制權。一家有資料駐留規範的企業,或一支需要模型協助重現漏洞、又不希望供應商拒絕請求的安全團隊,能從中獲得代管閉源模型無法提供的東西。Mistral 全力押注這套說法,將 Large 4 形容為從頭到尾在歐洲打造,並可透過自家雲端從歐洲部署。
競爭時機讓利害關係更加清楚。由 Nvidia 投資的實驗室 Reflection AI 在 10 月 5 日、即 Large 4 前一天,發布了 5,010 億參數的開放權重模型。包括阿里巴巴、Z.ai、Moonshot 與 DeepSeek 在內的中國實驗室,過去兩個月來持續滾動發布強大的開放模型。追蹤基準測試收斂情況的分析師報告指出,開放權重與專有模型之間的差距已在部分推理任務上縮小,且頂級專有 API 價格也因而下降。Mistral 正進入一個市場:成為最大的開放模型,價值不如成為最受信任的模型,而信任建立在授權條款與部署選項上,而非參數量。
資安紅隊演練也遵循同樣邏輯。在權重發布前,Mistral 讓經過審核的合作夥伴與國家主管機關存取同一個模型,「降低審核限制並擴展網路能力」。該公司主張,供應商層級的拒絕可能阻礙正當的事件應變,而在事件處理過程中失去工具存取權本身就是一種風險。
這次發布也落在一個特定時刻。Mistral 最近完成一輪融資,估值推升至超過 240 億美元,三星是新增投資者之一。Reflection AI 才在一天前推出 5,010 億參數的開放模型。開放權重層級越來越擁擠,差異化因素不再是原始規模。
這改變了什麼,又沒改變什麼
Large 4 並未在每一項任務上都縮小與最佳閉源模型的差距,Mistral 也沒有完全如此宣稱。它做的是在少數對企業重要的任務上縮小差距,並搭配這些企業真正需要的授權與部署方案。如果 10 月 27 日發布的權重能在外界測試中站得住腳,實際問題就不再是開放模型在抽象意義上是否夠好,而是它是否足以勝任某一項具體、定義明確的工作。
更值得關注的罕見主張是資安方面的說法。一個能協助安全團隊修補真實漏洞、依自家政策在自家硬體上運行的模型,與一個拒絕請求的聊天機器人是不同類型的產品。如果這點成立,它可能比程式開發基準測試上的幾分更重要。如果外部測試者發現 82% 這個數字無法在 Mistral 自家環境之外複製,這套說法就會退回價格與可攜性,而那是一個擁擠的立足點。
無論如何,歐洲現在有了自己的旗艦模型可供爭論。這場爭論將在 10 月 27 日正式開始。
相關文章
Decagon 的 PACT 協議,想讓「同意」成為一個標準
Decagon 開源了一個協議,用來驗證個人智能體的身分,以及客戶授予它的權限。這是管道工程,而它決定了智能體經濟能不能跑起來。
AI「重逢」熱潮:一場還沒想好該如何感受的討論
AI 致敬短片把逝去的公眾人物帶回中國螢幕,拿下數十萬點讚。然後反彈來了,而它爭論的是「同意」。
Apple 發布了一個開源多模態模型,卻幾乎沒告訴任何人
蘋果的這次「研究優先」式發布悄然越過了主流視野,但模型那種細粒度的視覺 grounding,透露了它的 AI 棧正走向哪裡。
OpenCut 與「開源剪映」的那一刻
一款免費、MIT 授權的影片剪輯器持續衝上 GitHub 趨勢榜,而它的路線圖裡包含一個面向 AI 智能體的 MCP server。圍繞 AI 媒體的工具,正在追上模型本身。