← 返回部落格
News預計閱讀 7 分鐘

阿里把大模型塞進自家矽晶片:真武 V900 提速三倍,Qwen 4 已在訓練

發布於 2026年10月3日
阿里把大模型塞進自家矽晶片:真武 V900 提速三倍,Qwen 4 已在訓練

九月下旬的杭州雲棲大會上,阿里把三件事擺在了同一張桌子上:一款新晶片、一版在訓練的模型、一張到 2032 年的資料中心帳單。往年這類大會通常是模型唱主角,今年真正被反覆提及的是矽晶片。

阿里旗下的平頭哥發布了訓推一體的 AI 晶片真武 V900。按官方說法,它的算力是真武 M890 的三倍,配 216GB 顯示記憶體、1200GB/s 的晶片間互連頻寬,原生支援 FP8 和 FP4 兩種低精度格式。真武 M890 是今年五月才發布的,中間只隔了四個月。V900 要到 2027 年第一季才量產販售,所以現在擺在台上的仍是一份規格表,而不是可以下單的現貨。

真正值得看的是它背後的組網方式。平頭哥為 V900 配了自研的 ICNSwitch 互連晶片,做的是記憶體語意和記憶體統一編址,號稱上千顆 V900 能像一顆「超級晶片」那樣協同。配套發布的超節點伺服器裡,除了 V900,還塞進了自家的智慧網卡和 SSD 主控晶片,算、存、網都想握在自己手裡。按阿里披露的口徑,單一叢集可以擴展到 50 萬卡規模。

深色檯面上整齊排布的空白晶片裸片,冷光下的重複幾何結構

阿里手裡已經有一批真實負載。基於真武 M890 的超節點此前已成功運行過 Qwen3.8、Kimi K3 這類超過兩兆參數的模型,真武系列晶片累計服務了 650 多家企業客戶,覆蓋智駕、金融、能源、製造等行業。這些數字解釋了阿里為什麼敢把下一代叢集的規模喊到 50 萬卡。

模型側的動作更直接。阿里確認 Qwen 4 已經在訓練,Qwen 4.5 和 Qwen 5 的目標參數規模在 5 兆到 10 兆之間。作為參照,目前阿里最強的 Qwen3.8-Max 是 2.4 兆參數。參數變大和叢集變大是同一件事的兩面:沒有足夠的卡,兆級模型的訓練週期會被拉長到失去意義。

阿里雲把基礎設施目標定在 2032 年全球資料中心規模超過 20GW,同時計畫在未來一年開出土耳其、芬蘭、荷蘭三個新區域,並在馬來西亞、德國、阿聯酋、法國等地擴容。把晶片、模型、雲放在同一個戰略裡講,是這次大會最清晰的主線。

數字漂亮,但基準是對著自己比的

判斷這份路線圖時,有兩處口徑需要留意。

第一,三倍提升是拿 V900 比自家的 M890,不是比輝達的 Blackwell,也不是比任何一款第三方加速卡。顯示記憶體容量和互連頻寬並不能直接換算成真實的訓練吞吐、推理延遲和每 token 成本。阿里也沒有公布獨立第三方測試下的跑分。

第二,軟體生態。全球主流的大模型訓練程式碼長期圍繞 CUDA 撰寫,驅動的函式庫、容器、編排工具都建立在多年累積之上。把一套跑在輝達平台上的工作負載遷到新晶片,成本往往不體現在硬體參數上,而體現在工程師改程式碼、調效能的那幾週裡。阿里這次沒有說明 V900 與現有輝達工具鏈之間的遷移難度,也沒公布定價、可用執行個體類型和區域支援。

這不是阿里一家的問題。先進製程的產能、良率、每瓦效能,都是國內自研晶片要面對的現實約束。真武 V900 的意義更多在於把「能不能自己造」這件事推進了一步,而不是在單點上追平。

為什麼是現在

時間點值得掰開看。過去兩年,美國對先進 GPU 出口到中國的限制持續收緊,國內雲端廠商不得不在自研加速器上加速投入。阿里、華為,加上燧原、天數智芯這些規模更小的玩家,都在往同一個方向使勁。同期有報導稱華為也在把下一代 AI 晶片的發布節奏往前趕。兩家公司對外的說法都差不多:在被規則進一步卡住之前,先在中國市場裡把輝達的位置換掉。

對阿里自身來說,自研矽晶片有兩層收益。一層是降低對美國政策波動的暴露,讓算力規劃不再隨出口規則起落;另一層是把歷史上被輝達吃掉的晶片加雲的那部分利潤,留在自己體內。

如果只看模型發布,會覺得這一輪競爭還是比誰的參數大、誰的跑分高。把晶片、超節點、雲區域和模型路線圖放在一起看,競爭的戰場其實已經挪到了矽晶片和機房這一層。模型是門面,能不能自己造卡、自己組網、自己供電,才決定這棟樓能蓋多高。

考驗在後頭

接下來十二到十八個月,有三件事會給出答案。50 萬卡的超節點說法能不能經得住真實客戶部署裡的檢驗;Qwen 4.5 和 Qwen 5 是否真能跑到接近十兆參數的規模;以及 20GW 的資料中心目標能不能拿到對應的融資和電力。

如果其中任何一項兌現一半,都足以說明中國的 AI 硬體堆疊在縮小與輝達的距離。這種縮小未必體現在某一項指標的對等上,而更可能體現在部署規模本身。阿里已經在杭州把話說了出來,剩下的要交給量產線和電錶來回答。

相關文章