AI 芯片的古怪经济学:新机架降低成本,旧芯片却越来越贵

九月,AI 硬件领域发生了两件事,看似指向相反的方向。英伟达开始向大型云服务商交付其最新的机架级系统,承诺大幅降低推理成本。与此同时,其已有三年历史的 H100 芯片的租赁价格上涨了。两者都是真的,合在一起则解释了 AI 经济实际运作的某些道理。
新机架
英伟达确认,其 Vera Rubin NVL144 机架系统正在批量出货,首批大规模部署已在微软、谷歌、亚马逊和甲骨文上线,CoreWeave 表示其首批 Rubin 集群将在九月底前向客户开放。这是行业尝试过的最大规模硬件过渡,取代了过去两年支撑大多数前沿模型训练的 Blackwell 一代。
该架构不是单一芯片。Vera Rubin 每个节点将一个 Vera CPU 与两个 Rubin GPU 配对并连接,使整个机架像一个大型处理器一样工作。NVL144 配置在一个机架内通过 72 个节点连接 144 个 Rubin GPU,首次在生产系统中采用 HBM4 内存,每个 GPU 的内存带宽约为每秒 13 TB。英伟达声称每个机架约有 3.6 exaflops 的 FP4 推理性能,约为可比的 Blackwell NVL72 机架的三倍。这些是理想条件下的数字,保守的独立估计认为实际提升接近两倍到两倍半。
对数据中心之外的每个人来说,重要的数字是每 token 成本。早期云定价表明,基于 Rubin 的实例在发布时可能比 Blackwell 推理便宜 30% 到 40%,而随着容量提升,价格通常会进一步下降。这个数字会向下传导到 API 调用的价格、订阅的规模,以及视频生成功能能否存在于一个 20 美元的套餐中。
变得更贵的旧芯片
反直觉的部分在这里。九月,H100——驱动第一波 AI 产品的那款芯片——的小时租赁价格上涨 22%,达到每小时 3.28 美元。英伟达首席执行官指出,这一上涨证明算力是一种耐用且能产生收入的资产,而不是按计划折旧的东西。
原因是供应。新的 Blackwell 和 Rubin 芯片被保留给最大的买家,这使得较旧的 H100 集群承担日常推理工作负载。数据中心电力与内存供应紧张,让旧硬件保持忙碌,也让租赁价格居高不下。H100 仍比发布时便宜得多——当时大型云公司以每小时七到八美元的价格租用它——但近期的上涨与标准会计相悖,后者会在五到六年内减记芯片价值。
这种差距引起了关注。做空者认为,芯片的实际寿命比官方时间表假设的更短,这意味着云服务商账面上的折旧太慢。英伟达在八月公布了 962 亿美元的创纪录季度营收,而租赁价格上涨为公司提供了新的论据:其芯片在不再是新品很久之后仍在继续赚钱。
扩展新机架的竞赛
部署速度与规格同样重要。CoreWeave 成为首家以多机架规模运行新硬件的云服务商,于 9 月 16 日启用七个 Vera Rubin NVL72 机架,总计 504 个 GPU,作为一个跨两个区域的生产集群。从单个验证机架跃升到多机架网络很重要,因为智能体 AI 工作负载会产生许多小而延迟敏感的调用,而延迟会在反复的模型与工具交互中累积。每个 NVL72 机架将 72 个 GPU 与 36 个 Vera CPU 配对,其网络设计无需重新设计即可支持每轨约 128,000 个 GPU,这意味着增加容量是配置变更,而不是重建。
这次的供应模式看起来也不同。在 Blackwell 一代,需求远超供应,以至于较小的云服务商和国家 AI 项目要等待六个月或更久。英伟达更早地提升了 Rubin 产量,据报道,欧洲和中东的几个主权 AI 项目位于第一批出货浪潮中,而不是第三批。英伟达还宣布与澳大利亚云和数据中心运营商合作,到 2027 年建设最多 2 吉瓦的 AI 工厂容量。如果这一点成立,租用 GPU 时间将变得明显更容易,从而拉低下游所有人的整体成本曲线。
为什么两件事都是真的
一旦把训练和推理分开,表面的矛盾就化解了。训练需要最新、最大的集群,而正是这种需求证明建造 Vera Rubin 这类机架是合理的。推理是模型训练完成之后所做的一切:每一次聊天机器人回复、每一张生成的图像、每一条编码建议。随着使用量增长,服务这些请求的经常性成本可能超过最初的训练账单。
这就是为什么英伟达选择开放其生态系统的一部分,而不是守住每一个插槽。9 月 10 日,它宣布与 d-Matrix 合作,后者是一家专门为推理构建芯片的初创公司。根据协议,d-Matrix 的下一代 Raptor 芯片将通过 NVLink Fusion 连接到英伟达的机架架构。Raptor 专为 AI 推理而构建,尤其是聊天机器人、编码助手和语音代理等低延迟工作,其以内存为中心的设计旨在降低延迟和成本。英伟达没有放弃任何它完全拥有的东西,因为它仍然提供机架周围的 CPU、网络、交换机和软件,同时在推理市场中占有一席之地,即使它不能赢得每一个加速器。
在这一切之下,还有一个更严峻的约束。单个 Vera Rubin NVL144 机架耗电约 600 千瓦,大致相当于 500 个普通家庭的用电量。电力,而非芯片,正在成为 AI 增长的硬性限制,这就是为什么微软、谷歌和亚马逊在过去一年都签署了核能和地热电力协议,为这样的集群供电。如果你想知道 AI 容量将流向哪里,那就关注电力购买协议,而不是基准测试分数。
这对 AI 价格意味着什么
对用户来说,实际解读是:运行模型的成本应该持续下降,即使最新硬件的成本仍然很高。更便宜的推理使得去年过于昂贵的功能今年有可能成为标配。长而细致的聊天机器人回答、能阅读整个代码库的编码助手,以及按需视频生成,都依赖于这条成本曲线向下弯曲。
投资者一直在问的问题是,巨大的数据中心支出是否终将收回成本。Rubin 是答案的一部分。如果同一模型每 18 个月左右运行成本大约降低一半,那么这些支出就开始看起来不太像泡沫,而更像基础设施。如果这条曲线停滞,怀疑者就迎来了他们的时刻。接下来两个季度的云定价将说明走向,而这个数字会以你的 AI 工具成本的形式,远早于任何基准测试到达你面前。