← 返回博客
Ai预计阅读 11 分钟

智谱 GLM-5.2 全面开源:7440 亿参数,基于国产芯片训练

发布于 2026年10月7日
智谱 GLM-5.2 全面开源:7440 亿参数,基于国产芯片训练

智谱 AI(Zhipu AI,这家位于北京的实验室也被称为 Z.AI)发布了 GLM-5.2,并在数日内放出了完整的开源权重。该模型总参数量达 7440 亿,每个 token 激活约 400 亿参数,采用专家混合(MoE)架构,并搭载了一项名为 IndexShare 的独特稀疏注意力优化。

许可证为 MIT。对任何打算基于它构建产品的人来说,这就是最大的看点:没有地域限制、没有营收触发条款、没有月活用户上限。商用部署、修改和再分发均无需额外授权。

IndexShare 能带来什么

IndexShare 架构在层与层之间复用稀疏注意力索引器,技术文档称其在模型完整的百万 token 上下文窗口下,将每 token 计算量降低了 2.9 倍。这个数字作为孤立的基准测试意义有限,更应被视为一个经济事实。长上下文智能体会话正是 token 成本累积之处,而在上下文窗口顶端实现 2.9 倍的削减,会改变哪些工作负载在给定集群上可行。

GLM-5.2 原生支持 100 万 token,并在 Artificial Analysis 智能指数上位列开源权重模型榜首。在 SWE-bench Pro 上得分 62.1%,超过 GPT-5.5 的 58.6%。在 Terminal-Bench 2.1 上取得 81.0 分,是所有开源权重模型中已报告的最高分。

硬件故事才是地缘政治的那一面

GLM-5.2 中比基准测试热议更持久的部分,是它在哪里运行。整个 GLM-5 系列均基于华为昇腾芯片、使用 MindSpore 框架训练。这是任何西方实验室都无法宣称的,也正是那些关注供应链韧性而非单纯分数的买家对它予以关注的原因。

智谱的发布材料还提到,在线推理跨多个国产算力平台运行,并实现华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞的零日适配。公司称这能在国产芯片集群上实现高吞吐、低延迟、大并发的稳定运行。

对于中国境外的企业,实际问题在于这些权重是否提供了一条自托管路径,从而消除按 token 计费的成本。对于中国境内的企业,问题则更为宽泛:能否在不依赖无法可靠采购的硬件的情况下,构建并服务一个具备前沿能力的模型。

价格几何,以及自托管改变了什么

定价层级划分得很清晰。直接 API 访问约为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元,缓存输入为 0.26 美元。通过 OpenRouter,费率约为 1.00 美元和 4.00 美元。GLM Coding Plan 订阅为面向开发者的套餐,每月 10 至 18 美元,并非用于生产规模。

自托管才是算账发生转折的地方。本地部署需要承担基础设施成本,但没有按 token 计费的费用。对于每天处理数百万 token 的工作负载,这一差异相当可观。代价是 GPU 集群、运维维护,以及托管 API 所隐藏的扩容工作。MIT 许可证在经济效益之外,又减少了法律层面的摩擦。

An open geometric wireframe cube of thin brass rods resting on a pale concrete plinth

量化是另一个杠杆。据称,在使用量化权重后,模型可在消费级硬件上运行,这为隐私敏感型应用(如处理医疗记录或专有代码库的智能体)开辟了自托管路径。

值得一读的安全脚注

在任何人把开源权重当作免费午餐之前,有一项发现值得关注。Anthropic 的红队评估报告称,GLM-5.3 展现出 Mythos 级别的自主网络能力,而针对开源权重滥用的防护措施薄弱。开源权重无法被召回。一旦下载,模型将永久留在部署组织手中。

这就造成了一个具体的部署问题。运行在智能体框架内的开源权重模型,需要闭源 API 提供商在其自身一侧所处理的隔离层。MIT 许可证消除了供应商锁定,同时也消除了供应商提供的安全保障。在智能体循环中部署 GLM-5.2 的团队应为运行时隔离预留预算,而不是把它当作别人的问题。

为什么这次发布意义不同

每月都有大量开源模型发布。GLM-5.2 之所以意义不同,是因为三个相互叠加的原因。

在如此参数规模上,这样的许可证确实罕见地宽松。大多数前沿级开源发布都附带商业条件、地域限制或用户上限。GLM-5.2 一样都没有。

硬件路径独立于 NVIDIA。对于那些将供应链风险视为首要关切的买家来说,无论基准排名如何,这都会改变候选名单。

而且长上下文下的计算效率,使得持续的多步会话在比 NVIDIA Nemotron 3 Ultra 这类模型更小的集群上具备经济可行性——后者按官方文档的最低要求需要 8xH100 节点。

GLM-5.2 并非在每个任务上都是最好的模型,安全方面的警告也是真实存在的。但作为一次开源发布如今能到达何种程度的信号——具备前沿竞争力、采用宽松许可证、且不依赖美国制造的 GPU——它是本周期最清晰的一个。

旗舰周围的家族

把 GLM-5.2 看作一个阶梯的顶端,而非一次独立发布,会更有帮助。GLM 家族从面向边缘部署的 9B 轻量级 GLM-4.6V-Flash,一直延伸到 744B 旗舰。专用变体包括面向多模态视觉任务的 GLM-5V-Turbo,以及用于复杂多步规划的 AutoGLM 智能体框架。

宽松许可证适用于整个阶梯,这对选择技术栈的团队来说才是关键。一家公司可以在小型边缘模型上做原型,扩展到旗舰模型,并在两者之间迁移,而无需在每一步重新协商权利。这种连续性在开源生态中并不常见——在那里,同一实验室的小型与大型发布往往采用不同的许可证。

效率声明在实践中意味着什么

在完整上下文下每 token 计算量降低 2.9 倍,这类数字在未与具体工作负载挂钩之前,读起来就像一条规格参数。

设想一个需要对大型代码库或长篇文档集进行推理的智能体。每一步都会重新读取不断增长的上下文,而正是这种重复读取的成本让长会话变得昂贵。在上下文窗口顶端实现近三倍的削减,会降低长时间运行的会话不再划算的临界点。会话仍然要花钱,但盈亏平衡点发生了移动。

这也是量化路径重要的原因。据称,使用量化权重后,模型可在消费级硬件上运行,这将长上下文智能体从需要集群才能运行的东西,变成小型团队可以本地运行的东西。对于处理敏感数据的应用,例如医疗记录或专有源代码,本地运行是唯一符合合规约束的部署方式,而成本只是次要收益。

安全警告的痛点所在

红队发现很容易被归档为别人的问题。但它不是,原因在于结构性。

闭源 API 提供商可以在事后更新模型、更改策略或切断滥用案例。开源权重发布则移除了这一杠杆。权重一旦下载,就留在部署组织手中,没有供应商能够撤销。这正是开源权重的全部意义所在,也正是为什么隔离必须由部署它们的团队自行构建。

在实践中,这意味着运行 GLM-5.2 的智能体需要与团队对待任何具有写权限的强大工具相同的运行时纪律:限定范围的权限、针对不可信操作的沙箱、崩溃后仍能留存的日志,以及针对重大决策的人工升级路径。这些都不是许可证所提供的,也不会随权重免费附赠。MIT 条款在法律层面消除了供应商锁定,并按设计在运营层面消除了供应商提供的安全保障。

相关文章