阿里把大模型塞进自家硅片:真武 V900 提速三倍,Qwen 4 已在训练

九月下旬的杭州云栖大会上,阿里把三件事摆在了同一张桌子上:一款新芯片、一版在训练的模型、一张到 2032 年的数据中心账单。往年这类大会通常是模型唱主角,今年真正被反复提及的是硅片。
阿里旗下的平头哥发布了训推一体的 AI 芯片真武 V900。按官方说法,它的算力是真武 M890 的三倍,配 216GB 显存、1200GB/s 的片间互联带宽,原生支持 FP8 和 FP4 两种低精度格式。真武 M890 是今年五月才发布的,中间只隔了四个月。V900 要到 2027 年第一季度才量产售卖,所以现在摆在台上的仍是一份规格表,而不是可以下单的现货。
真正值得看的是它背后的组网方式。平头哥为 V900 配了自研的 ICNSwitch 互联芯片,做的是内存语义和内存统一编址,号称上千颗 V900 能像一颗"超级芯片"那样协同。配套发布的超节点服务器里,除了 V900,还塞进了自家的智能网卡和 SSD 主控芯片,算、存、网都想握在自己手里。按阿里披露的口径,单一集群可以扩展到 50 万卡规模。

阿里手里已经有一批真实负载。基于真武 M890 的超节点此前跑通过 Qwen3.8、Kimi K3 这类超过两万亿参数的模型,真武系列芯片累计服务了 650 多家企业客户,覆盖智驾、金融、能源、制造等行业。这些数字解释了阿里为什么敢把下一代集群的规模喊到 50 万卡。
模型侧的动作更直接。阿里确认 Qwen 4 已经在训练,Qwen 4.5 和 Qwen 5 的目标参数规模在 5 万亿到 10 万亿之间。作为参照,目前阿里最强的 Qwen3.8-Max 是 2.4 万亿参数。参数变大和集群变大是同一件事的两面:没有足够的卡,万亿级模型的训练周期会被拉长到失去意义。
阿里云把基础设施目标定在 2032 年全球数据中心规模超过 20GW,同时计划在未来一年开出土耳其、芬兰、荷兰三个新区域,并在马来西亚、德国、阿联酋、法国等地扩容。把芯片、模型、云放在同一个战略里讲,是这次大会最清晰的主线。
数字漂亮,但基准是对着自己比的
判断这份路线图时,有两处口径需要留意。
第一,三倍提升是拿 V900 比自家的 M890,不是比英伟达的 Blackwell,也不是比任何一款第三方加速卡。显存容量和互联带宽并不能直接换算成真实的训练吞吐、推理延迟和每 token 成本。阿里也没有公布独立第三方测试下的跑分。
第二,软件生态。全球主流的大模型训练代码长期围绕 CUDA 编写,驱动的库、容器、编排工具都建立在多年积累之上。把一套跑在英伟达平台上的工作负载迁到新芯片,成本往往不体现在硬件参数上,而体现在工程师改代码、调性能的那几周里。阿里这次没有说明 V900 与现有英伟达工具链之间的迁移难度,也没公布定价、可用实例类型和区域支持。
这不是阿里一家的问题。先进制程的产能、良率、每瓦性能,都是国内自研芯片要面对的现实约束。真武 V900 的意义更多在于把"能不能自己造"这件事推进了一步,而不是在单点上追平。
为什么是现在
时间点值得掰开看。过去两年,美国对先进 GPU 出口到中国的限制持续收紧,国内云厂商不得不在自研加速器上加速投入。阿里、华为,加上燧原、天数智芯这些规模更小的玩家,都在往同一个方向使劲。同期有报道称华为也在把下一代 AI 芯片的发布节奏往前赶。两家公司对外的说法都差不多:在被规则进一步卡住之前,先在中国市场里把英伟达的位置换掉。
对阿里自身来说,自研硅片有两层收益。一层是降低对美国政策波动的暴露,让算力规划不再随出口规则起落;另一层是把历史上被英伟达吃掉的芯片加云的那部分利润,留在自己体内。
如果只看模型发布,会觉得这一轮竞争还是比谁的参数大、谁的跑分高。把芯片、超节点、云区域和模型路线图放在一起看,竞争的战场其实已经挪到了硅片和机房这一层。模型是门面,能不能自己造卡、自己组网、自己供电,才决定这栋楼能盖多高。
考验在后头
接下来十二到十八个月,有三件事会给出答案。50 万卡的超节点说法能不能经得住在真实客户部署里的检验;Qwen 4.5 和 Qwen 5 是否真能跑到接近十万亿参数的规模;以及 20GW 的数据中心目标能不能拿到对应的融资和电力。
如果其中任何一项兑现一半,都足以说明中国的 AI 硬件栈在缩小与英伟达的距离。这种缩小未必体现在某一项指标的对等上,而更可能体现在部署规模本身。阿里已经在杭州把话说了出来,剩下的要交给量产线和电力表来回答。