螞蟻集團 Ling 3.1 Flash 啟用 560B 參數中的 25B,拿下 41 分

--- title: 螞蟻集團 Ling 3.1 Flash 啟用 560B 參數中的 25B,拿下 41 分 meta_title: Ling 3.1 Flash 讓 560B 參數藏在 25B 的帳單後面 meta_description: 螞蟻集團的 Ling 3.1 Flash 以 560B 總參數中僅 25B 的啟用參數,在 Intelligence Index 拿下 41 分,展現稀疏 MoE 能撐到多遠。 ---
螞蟻集團旗下的 AntLingAGI 於 10 月 6 日發布 Ling 3.1 Flash。最引人注目的數字,是模型執行時實際啟動的 250 億個參數,而總參數為 5600 億。
該模型在 Artificial Analysis Intelligence Index 上拿下 41 分,相較前代是明顯的躍進。評估特別點出代理(agentic)能力是進步最凌厲的領域,而這正是企業買家近來最看重的類別。
架構本身就是論點
Ling 3.1 Flash 是混合專家(mixture-of-experts)模型。它總共帶有 5600 億個參數,但每個 token 僅啟用約 250 億個,並支援最高一百萬 token 的上下文視窗。
這個比例就是全部的賣點。能力相當的稠密模型,每生成一個 token 都得搬動每一個參數。稀疏模型則把每個 token 導向一小群專家,因此能交出相近的輸出,卻只需動用遠少得多的算力。代價是記憶體:全部 5600 億個參數仍必須常駐在某處,儘管在任一次前向傳遞中大多數都閒置著。

實際結果是:只要團隊有硬體能容納這些權重,這個模型就能以遠低於同等品質稠密模型的成本提供服務。這與今年大多數前沿開放權重發布背後的工程邏輯如出一轍,也正是為什麼大家關注的指標已從總參數轉向啟用參數。
基準測試涵蓋了什麼
螞蟻集團公布了一系列評測結果:GDPVal-AA v2.1 拿下 1673 Elo、FrontierSWE 75.16、HealthBench 65.35,以及在 Design Arena 中於行動應用與 SVG 生成項目名列前茅。
41 分的 Intelligence Index 成績是最大亮點,讓這款模型得以與規模大得多的實驗室作品並列。螞蟻集團表示完整模型將會開源,文件也已發布。與此同時,為期兩週的免費試用正在進行中。
工程演示比分數更能說明問題
螞蟻集團也描述了三個實作範例,而這些範例比排行榜更能說明預期用途。
第一:從零打造一個 Lua 到 x86 的編譯器,通過 182 項測試中的 178 項。這類任務要求模型在腦中維持龐大的規格書、在眾多檔案間產出內部一致的程式碼,並全程追蹤邊界情況。這種工作會嚴厲懲罰長上下文處理能力薄弱的模型。
第二:加速大型 Python 程式庫的型別檢查。這是維護型任務,而非從零開始的開發,而現實中的工程時間大多花在這一類工作上。一個能推敲既有程式庫型別關係的模型,其用處不同於只會寫新函式的模型。
第三:打造一個能協調瀏覽器、本機檔案與終端機工具的桌面代理。多工具協同是當前代理工作的前沿,也正是這波基準分數躍升所指向的能力。
這三項皆為公司自行報告,尚未經獨立重現。尤其是 182 項測試的編譯器聲明,需要外部驗證,因為測試通過只有在測試具代表性時才有意義。一個能處理常見語法、卻在罕見情況失手的編譯器,面對一套與模型同一週寫成的測試套件,依然能拿到高分。
這裡還有一個更廣泛的模式值得注意。中國實驗室越來越常以工程演示、而非基準分數作為主要行銷手段,因為基準已變得模糊難辨,而演示則具體可見。代價是:一場演示只展示了問題空間中的某一條路徑,完全無法反映結果的分布。
更長的弧線:中國開放權重持續在做的事
Ling 3.1 Flash 符合今年一整年持續成立的模式。中國實驗室以前所未見、西方實驗室追不上的節奏,釋出前沿規模的開放權重並附上寬鬆授權,而且他們競爭的是效率,而非純粹的規模。
這個背景值得直說。開發者若跑這類模型之一,就等於自己掌握了推論堆疊,意味著沒有按 token 計的 API 費用、資料不離開自家機房,也沒有第三方決定模型何時改版。對於有隱私限制、或工作負載可預測但沉重的團隊,這具有實實在在的價值。
Victor Taelin 本月指出,Artificial Analysis 排名前 25 名中已無任何開放模型,最好的 Xiaomi MiMo 位居第 26。Ling 3.1 Flash 的 41 分是 Intelligence Index 的分數而非排名,兩者衡量的是不同事物,最佳開放模型與最佳閉源模型之間的落差依然真實存在。改變的是,這個落差如今以分數差距來衡量,而不再是「開放模型究竟能不能勝任工作」。
對任何正在挑模型的人來說,這意味著什麼
有三件事比參數比例更重要。
授權與部署條款。螞蟻集團說模型會開源,但具體授權決定商業使用是否受限。鑒於「開放權重」與「寬鬆授權」經常被當成同義詞混用,而它們其實不是同一回事,在任何正式上線依賴之前,條款都值得仔細閱讀。同樣的謹慎也適用於發布前公布的文件——它描述的是能力,而非義務。
上下文視窗的宣稱。一百萬 token 是很大的數字,但可用的上下文通常比宣稱的短。模型是能在整個視窗中維持品質,還是遠早於此就開始劣化,這才是決定它對長文件與大型程式庫工作是否有用的關鍵問題。螞蟻集團自家的長上下文演示顯示模型能處理龐大輸入,但同樣地,這些都是廠商自測。
記憶體需求。560B 的稀疏模型不是筆電能部署的。啟用參數的故事降低的是每個 token 的算力,而不是權重的占用;任何打算自行託管的人,硬體都應以總量而非啟用數來規劃。這個區別經常讓人栽跟頭。一個被形容為「啟用 25B 參數」的模型聽起來很小,直到你試著載入它——此時整整 560B 得想辦法塞進某個地方。
還有一個實務上的支援問題。來自頻繁發布的實驗室的模型,注定會被後繼者取代,團隊應規劃好遷移路徑。螞蟻集團的發布節奏意味著 Ling 3.2 或 Ling 4 只是幾個月內的事,這對能力演進是好事,對任何圍繞某一版本打造微調或部署腳本的人來說卻很棘手。
Ling 3.1 Flash 是來自一家持續穩定出貨的實驗室的扎實之作。真正的新聞是結構性的:一個啟用 25B 的模型,如今已能站上跟大得多的稠密系統同一個對話框。這正是整條稀疏 MoE 研究路線一直在主張的論點,而基準測試終於開始支持它了。