← 返回部落格
Ai預計閱讀 9 分鐘

小米推出與前沿並駕齊驅的全模態模型,外加訓練配方

發布於 2026年10月4日
小米推出與前沿並駕齊驅的全模態模型,外加訓練配方

一家手機公司在 9 月 22 日發布了一款 AI 模型,而標題數字是 46。這是小米的 MiMo-V2.6 Pro 在 Artificial Analysis 智慧指數上的得分,該公司稱這是發布時開源模型所記錄到的最高分。

MiMo-V2.6 有兩個版本。Pro 是大型版,Flash 是快速版。小米表示,Pro 在大多數代理基準測試中與 Claude Opus 5 和 GPT-5.6 Sol 表現相當,並指出在程式編寫、電腦操作、3D 推理和創意任務方面有所提升。這些模型是全模態的,意味著它們透過同一組權重接受文字、圖像和其他輸入,並且是以規模化強化學習訓練而成,而這部分正好解釋了其能力與發布形式。

下載內容實際上包含什麼

大多數開放權重發布只交出權重,然後就結束了。MiMo-V2.6 隨附權重、技術報告、強化學習環境以及訓練程式碼。小米將這四項全部發布在自己的網站上,而不是讓開發者透過帶有授權頁面和等候名單的模型中心取得。

納入強化學習環境才是關鍵差異。權重能讓你執行模型。環境能讓你重新訓練它。當一個實驗室發布它訓練時所用的環境,等於是在告訴你它如何得到這種行為,而不只是行為本身是什麼。對於任何想重現結果、或用自己的獎勵訊號微調模型的人來說,環境才是真正重要的產物。

這也提高了發布方公司的成本。公開環境會暴露訓練訊號的形狀,而這更接近一份配方,而不是一個檢查點。競爭對手可以閱讀它,並省下一年的反覆試驗。小米似乎認定,招募人才和可信度帶來的好處值得這麼做。

為什麼一家裝置公司要做前沿研究

小米不是一家剛好也賣手機的研究實驗室。情況正好相反,而這種定位也反映在全模態模型適合什麼用途上。

手機是能讀取螢幕、理解照片、操作介面並以語音對話回答的助理的自然歸宿。從這個角度來看,電腦操作、3D 推理和創意生成並不是抽象的基準測試。它們是必須在某人手持的裝置上運行的系統元件,而且往往連線緩慢,還得保護電池續航。一個分為 Pro 層級追求能力、Flash 層級追求延遲的模型家族,既是研究決策,也是裝置產品藍圖決策。

發布權重有兩個目的。它能招募會在公開場合改進模型的研究人員,也為公司在這個能力宣稱否則只能靠信任的市場中,奠定一個下限。一個你能下載並自行評估的模型,需要較少行銷,而小米正與那些整個聲譽都建立在已發表成果上的實驗室,爭奪開發者的注意力。

全模態在實務上意味著什麼

這個標籤涵蓋了一項具體的工程主張:單一模型透過共享表徵處理多種輸入,而不是把每種輸入類型導向各自獨立的專家模型。對手機而言,這很重要,因為替代方案是執行多個模型並把它們的輸出拼接起來,而手持裝置上的記憶體和延遲都很稀缺。小米的 Flash 層級也是出於同樣原因。一個能在旗艦機上一秒內回答的模型,到了中階裝置或汽車裡可能就無法使用,所以這個家族其實是能力與延遲曲線上的兩個點,而不是單一發布。

一枚清澈的玻璃鏡頭置於深色環上,帶有彩虹折射

訓練方法解釋了其餘部分。規模化強化學習意味著模型是根據獎勵訊號進行最佳化,而不只是訓練來預測下一個 token;這也是近期業界代理能力大幅躍進背後的方法。它同時也是環境之所以和權重一樣重要的原因。獎勵訊號的品質取決於產生它的環境,所以發布環境更接近於發布一種方法,而不是發布一個結果。

裝置就是發布通路

小米的優勢在於,它不需要開發者生態系就能觸及使用者。它向數千萬人出貨硬體,而一個在手機助理內運行的模型,一季觸及的人數就超過模型中心一年所能觸及的人數。這就是為什麼發布形式如此大方。權重和配方對公司造成的授權收入損失相對較小,卻能換來研究社群的信任,否則他們只會從一張基準測試截圖來評斷這個模型。

風險和優勢相同。手機助理的評判標準是它是否每次都有效,而一個每二十項任務就失敗一次的代理,在聊天視窗裡只是惱人,在同時處理付款、照片和訊息的裝置裡卻是負擔。能力基準測試並不衡量這個落差,46 的綜合分數也不能。

同一個星期二,另外三場發布

時機很說明問題。9 月 22 日,小米的模型與阿里巴巴的 Qwen-Image-2.1 一同出現;阿里巴巴在 9 月 20 日開放權重,並在同日的雲棲大會上展示。同時還有騰訊的 Hy Image 3.5 預覽版,這是一款專業圖像模型,在騰訊雲 API 上每張 2K 圖像定價 0.15 元人民幣。宇樹科技(Unitree)也利用同一時間窗口發布 Dex5-S,一款具備 22 個自由度的靈巧機械手,起價 6,500 美元。

阿里巴巴也利用這場大會,宣稱 Qwen3.8-Max 在 Artificial Analysis 的代理排行榜上排名第一,並在 CodeArena 的前端程式設計項目排名第一,還表示 Qwen4 正在訓練中,後續模型計畫達到五到十兆參數。其 Qwen-Image 負責人指出,團隊的目標是降低完成任務的成本,而不是最大化參數數量,這正是 MiMo 雙層結構所做的相同取捨。

這些公告沒有一項是協調好的,但全都指向同一個方向。今年秋天中國 AI 的競爭問題,不是前沿級模型是否存在,而是你被允許掌握多少。

基準測試的但書

像 46 這樣的數字完全取決於它背後的指數,而 Artificial Analysis 的智慧指數只是眾多綜合指標之一。與 Claude Opus 5 和 GPT-5.6 Sol 的比較是小米做的,用的是小米選的基準測試,而「大多數代理基準測試」這個說法,若用一張結果表格來表達會更好。代理基準測試尤其對外圍框架敏感:同一個模型會因為周圍配套不同而得到截然不同的分數。

讓這項宣稱不只是行銷的,是下載。任何懷疑 46 的人都可以執行這個模型、閱讀報告,並在小米提供的環境中重新訓練它。這比排行榜截圖是更嚴格的測試,而且它之所以可行,只因為該公司選擇連同結果一起發布配方。

相關文章