← 返回部落格
Ai預計閱讀 10 分鐘

Ai2 開源的是訓練堆疊,而非另一組權重

發布於 2026年10月5日
Ai2 開源的是訓練堆疊,而非另一組權重

艾倫人工智慧研究所(Allen Institute for AI)發布了 Olmo-core 3,這是一套針對兆級參數混合專家模型的開放訓練基礎設施。最受矚目的基準數字是,一個 470 億參數的 MoE 在八張 B300 GPU 上達到約為先前配置 2.7 倍的吞吐量。這個數字很可觀。但它也不是這次發布之所以重要的原因。

權重很容易送出,卻很難從中學到東西。下載一組權重,你就能執行模型。如果沒有基本上從頭重建訓練管線,你無法重現它、稽核它,或用自己的資料重新訓練它。Olmo-core 3 發布的是這條管線。

反覆出現的那個區別

開放權重與開放訓練是兩種不同的產品,而它們之間的落差,正是多數有用資訊所在之處。

一個已發布的模型告訴你某個團隊達成了什麼。一套訓練堆疊則告訴你他們如何做到,而如果你想自己做,這正是你需要的。對發布組織之外的人來說,後者有用得多,也罕見得多,因為訓練程式碼、資料管線與配置細節,才是耗時最久才做對的部分。

混合專家(MoE)架構讓這件事更加重要,而非更不重要。MoE 模型會把每個 token 路由到一部分專家,因此一個總參數達數兆的模型,每個 token 可能只啟用其中一小部分。這種設計能降低推論成本,但也帶來路由決策、專家之間的負載平衡,以及跨裝置的通訊模式,這些都真的非常難以調校。兩個團隊可能擁有完全相同的模型架構,卻因為訓練迴圈中的選擇不同,而有截然不同的吞吐量。

發布訓練基礎設施意味著這些選擇是可見的。這正是 2.7 倍吞吐量數字之所以有意義的原因,因為它附帶著別人可以執行與驗證的程式碼。

一張顯示卡平放在深色桌面上,旁邊有一張空白索引卡

為什麼 MoE 訓練才是難的部分

稠密模型的擴展是可預測的。增加參數、增加算力,就會得到一條平滑曲線。MoE 模型則引入了排程問題。如果路由器把大多數 token 送往少數專家,那些專家就會成為瓶頸,其餘硬體則閒置。如果它把 token 分得太平均,模型就會失去讓這個架構具吸引力的專精化能力。

要把這件事做對,需要容量因子、輔助損失,以及多數實驗室視為專有的通訊重疊機制。它還需要能在硬體故障後存活的檢查點機制,因為這種規模的訓練執行一定會遇到故障,而從頭重啟並不是選項。

Ai2 在八張 B300 GPU 上報告的吞吐量提升,是小規模結果,也應該如此解讀。證明訓練迴圈在單一節點上有效率,並不等於證明它在數百個節點上依然成立,因為在那種規模下,節點間通訊會成為主導因素。但這是正確的第一步結果,因為效率問題通常會先在小規模浮現,並隨著規模擴大而惡化。

為什麼八張 GPU 上的吞吐量是正確的第一個數字

小規模的吞吐量結果,放在兆級參數的框架旁顯得不起眼,但它值得辯護。訓練效率問題往往很早就出現,並會越來越嚴重。如果一個訓練迴圈在單一節點上浪費三分之一算力,當加入節點間通訊後,同一個迴圈會浪費更多,因為低效率會隨著每一層協調而複合。

先發布小規模數字,是在對大型叢集做出宣稱之前,先表明基本盤穩固的一種方式。這也是正確的起點。一個先報告大規模數字、再報告小規模數字的團隊,通常報告的是峰值,而不是持續速率。

這個數字重要還有第二個原因。MoE 吞吐量對批次大小與序列長度的敏感程度,是稠密模型所沒有的,而在八張 GPU 上能最大化效率的配置,經過調校後往往能推廣到更大的叢集。2.7 倍的提升大到足以反映結構性改變,而非調校細節,因此值得關注。

這件事的受眾比權重的受眾小

大多數談論開放模型的人想要的是權重。他們想執行推論、針對某個領域進行微調,或打造產品。這個群體會被每一次開放權重發布所滿足。

需要訓練堆疊的群體則小得多:研究實驗室、國家級算力計畫、擁有叢集存取權的大學,以及必須記錄模型如何產生的受監管產業公司。這些使用者長期以來得到的服務很差,因為他們的選擇一直是在從頭打造管線,與使用只能在特定供應商硬體上運作的東西之間二選一。

一套開放訓練堆疊改變了第二個選項。它為實驗室提供了一個可以修改的起點,也為政府計畫提供了一條通往主權模型的道路,而且不必依賴外國供應商是否願意分享實作細節。

發布這種東西具有戰略意義,而 Ai2 在這一點上一直很一致。該研究所的模型發布時都附上資料、程式碼與訓練日誌,這是比只發布權重和一篇論文更嚴格的標準。

關於開放訓練的隱性爭論

開放模型社群內部對於開放應該意味著什麼,存在一場辯論,而像這樣的發布會把辯論往前推進。

一種立場認為,重要的是權重,因為人們用的是權重。在這種觀點下,發布模型是一種贈禮,而訓練細節是公司的私事。另一種立場認為,一個沒有附帶訓練堆疊的模型,無法被原始團隊以外的人稽核、重現或改進,而把這樣的發布稱為開放,誇大了它實際提供的東西。

第二種立場基於一個實際理由而逐漸占上風。幾個司法管轄區的監管機關已開始要求模型開發者記錄訓練資料與其來源。使用已發布管線訓練的團隊可以回答這些問題。微調借用權重的團隊則不能,因為它不知道那些權重裡包含了什麼。

對研究機構而言,盤算很簡單。發布一套堆疊要付出工程時間,但在商業上沒有損失,因為研究機構不是在賣 API 呼叫。對商業實驗室而言,做同樣的事等於讓競爭對手取得先機。這種不對稱正是為什麼開放訓練堆疊更常來自研究機構與大學,而非企業,也是為什麼每次出現一套都值得檢視。

值得觀察的重點

吞吐量結果能否在規模擴大後依然成立。真正有趣的測試不是八張 GPU,而是數百張 GPU,在那裡 Olmo-core 3 所編碼的通訊模式不是行得通,就是行不通。

外部實驗室是否真的採用它。一套訓練堆疊會在某個其他人用它訓練模型並發布結果時開始擴散。第一個可信的重現,會比任何基準測試表格都更有資訊量。

開放訓練是否會改變採購。需要記錄模型來源的組織,選擇一直有限。如果一套完整的訓練管線以寬鬆授權提供,其中一些組織會在其上建構,而不是付費使用封閉的替代方案。

權重發布會受到關注,因為任何人都能下載來試用。訓練發布才是這個領域真正知識轉移的地方,而它們出現的頻率低得多。這一次值得仔細閱讀,因為模型可轉移的部分,是它背後的流程。

相關文章