← 返回部落格
Ai預計閱讀 11 分鐘

智譜 GLM-5.2 全面開源:7440 億參數,以國產晶片訓練

發布於 2026年10月7日
智譜 GLM-5.2 全面開源:7440 億參數,以國產晶片訓練

智譜 AI,這家總部位於北京、也以 Z.AI 為人所知的實驗室,推出了 GLM-5.2,並在幾天內釋出完整的開放權重。該模型總參數達 7440 億,每個 token 約啟用 400 億參數,採用混合專家(MoE)架構,並搭載一項名為 IndexShare 的獨特稀疏注意力優化技術。

授權條款為 MIT。對任何打算以其為基礎進行開發的人來說,這就是最重要的頭條:沒有地區排除條款、沒有營收觸發條件、沒有月活躍使用者上限。商業部署、修改與再散布皆無需額外許可。

IndexShare 能帶來什麼

IndexShare 架構會跨層重複使用稀疏注意力索引器,根據技術文件的說法,在模型完整的 100 萬 token 上下文視窗下,每個 token 的運算量可降低 2.9 倍。這個數字作為單獨的基準測試意義較小,作為一項經濟事實則更為重要。長上下文代理工作階段正是 token 成本累積的地方,而在上下文視窗頂端降低 2.9 倍,會改變哪些工作負載在特定叢集上可行。

GLM-5.2 原生支援 100 萬 token,並在 Artificial Analysis Intelligence Index 上名列開放權重模型之首。在 SWE-bench Pro 上得分 62.1%,領先 GPT-5.5 的 58.6%。在 Terminal-Bench 2.1 上取得 81.0,是所有開放權重模型中回報的最高分數。

硬體故事才是地緣政治關鍵

GLM-5.2 之中比基準測試話題更經得起時間考驗的部分,是它運作在哪裡。整個 GLM-5 系列都是在華為昇騰晶片上,使用 MindSpore 框架訓練而成。這是沒有任何西方實驗室能做出的宣稱,也是這款模型吸引那些重視供應鏈韌性、而非只看原始分數的買家的原因。

智譜的發布資料補充,線上推論可跨多個國內運算平台運行,並首日相容於華為昇騰、平頭哥(T-Head)、摩爾線程、寒武紀、崑崙、沐曦、海光與壁仞。該公司將此描述為在國內晶片叢集上,以高吞吐量、低延遲與高併發穩定運行。

對中國境外的企業而言,實際問題在於這些權重是否能提供一條自行託管路徑,從而消除按 token 計費的成本。對中國境內的企業而言,問題更廣泛:能否在不依賴無法穩定購得的硬體下,打造並提供一個具備前沿能力的模型。

費用是多少,以及自行託管改變了什麼

定價級距區分明確。直接 API 存取約為每百萬輸入 token 1.40 美元、每百萬輸出 token 4.40 美元,快取輸入則為 0.26 美元。透過 OpenRouter,價格約為 1.00 美元與 4.00 美元。GLM Coding Plan 訂閱方案為每月 10 至 18 美元,屬於開發者導向層級,並非為生產規模而設計。

自行託管才是算術開始轉變的地方。地端部署會帶來基礎設施成本,但沒有按 token 計費的費用。對於每天處理數百萬 token 的工作負載而言,這個差異相當可觀。取捨在於 GPU 叢集、維護,以及受管 API 所隱藏起來的擴展工作。MIT 授權在經濟考量之上,進一步降低了法律摩擦。

一個由細黃銅桿構成的開放幾何線框立方體,放置在淺色混凝土基座上

量化是另一項槓桿。據報導,使用量化權重後,該模型可在消費級硬體上運行,這為隱私敏感的應用開啟了一條自行託管路徑,例如處理醫療紀錄或專有程式碼庫的代理。

值得一讀的安全註腳

在任何人把開放權重當成免費午餐之前,有一項發現值得注意。Anthropic 的紅隊評估報告指出,GLM-5.3 展現出 Mythos 級自主網路能力,且對開放權重遭濫用的防護措施薄弱。開放權重無法收回。一旦下載,模型就會無限期留在部署組織手中。

這會造成特定的部署問題。在代理框架內運行的開放權重模型,需要封閉 API 供應商在自己那端處理的隔離層。MIT 授權移除了供應商鎖定,同時也移除了供應商提供的安全保證。在代理迴圈中部署 GLM-5.2 的團隊,應為執行階段隔離編列預算,而不是把它當成別人的問題。

為什麼這次發布的意義不同

每個月都有大量開放模型發布。GLM-5.2 之所以意義不同,是因為三個相互加乘的原因。

在這種參數規模下,真正寬鬆的授權相當罕見。多數前沿級開放發布都附帶商業條件、地區限制或使用者上限。GLM-5.2 這些都沒有。

硬體路徑獨立於 NVIDIA。對於把供應鏈風險視為首要考量的買家而言,無論基準測試排名如何,這都會改變候選名單。

而且長上下文下的運算效率,讓持續的多步驟工作階段在較小叢集上具備經濟可行性,相較於 NVIDIA 的 Nemotron 3 Ultra 這類模型,後者在其文件記載的最低需求下需要 8xH100 節點。

GLM-5.2 並非在所有任務上都是最佳模型,而且安全警告確實存在。但作為一個訊號,顯示開放發布如今能達到什麼樣貌:具備前沿競爭力、授權寬鬆,且不以美國製造的 GPU 打造,它是這個週期中最清晰的一個。

圍繞旗艦的模型家族

把 GLM-5.2 看成一個梯子的頂端,而非獨立發布,會更有幫助。GLM 家族從針對邊緣部署、僅 9B 的輕量級 GLM-4.6V-Flash,一路延伸到 744B 的旗艦模型。特化變體包括用於多模態視覺任務的 GLM-5V-Turbo,以及用於複雜多步驟規劃的 AutoGLM 代理框架。

寬鬆的授權適用於整條梯子,這正是團隊選擇技術堆疊時最重要的部分。一家公司可以在小型邊緣模型上製作原型,擴展到旗艦模型,並在兩者之間移動,而不必在每一步重新協商權利。這種連續性在開放生態系中並不尋常,因為實驗室的小型與大型發布,授權條款往往不同。

效率宣稱在實務上意味著什麼

在完整上下文下,每 token 運算量降低 2.9 倍,這類數字在未連結到實際工作負載前,讀起來就只是規格。

設想一個代理要對大型程式碼庫或長文件集進行推理。每一步都會重新讀取不斷增長的上下文,而這種重新讀取的成本,正是讓長時間工作階段昂貴的原因。在上下文視窗頂端降低近三倍,會降低長時間執行工作階段變得不值得的門檻。工作階段仍然要花錢,但損益平衡點移動了。

這也是量化路徑重要的原因。據報導,使用量化權重後,該模型可在消費級硬體上運行,這會讓長上下文代理從需要叢集的東西,變成小型團隊可在本機運行的東西。對於處理敏感資料的應用,例如醫療紀錄或專有原始碼,本機運行是唯一符合合規限制的部署方式,而成本只是次要好處。

安全但書的實際影響

紅隊的發現很容易被歸類為別人的問題。但事實並非如此,原因在於結構。

封閉 API 供應商可以在事後更新模型、更改政策,或切斷濫用案例。開放權重發布則移除了這項槓桿。權重一旦下載,就會留在部署組織手中,沒有任何供應商能撤銷它們。這正是開放權重的重點,也是為何隔離措施必須由部署它們的團隊自行打造。

在實務上,這意味著運行 GLM-5.2 的代理需要同樣的執行階段紀律,就像團隊會套用於任何具有寫入權限的強大工具一樣:範圍受限的權限、用於不受信任動作的沙箱、可在崩潰後留存的日誌記錄,以及針對重大決策的人工升級路徑。這些都不是授權條款所提供的,也不會隨著權重免費附上。MIT 條款在法律面移除了供應商鎖定,並且在設計上於營運面移除了供應商提供的安全性。

相關文章