← 返回博客
News预计阅读 10 分钟

内存芯片如今已成为 AI 算力的瓶颈

发布于 2026年10月7日
内存芯片如今已成为 AI 算力的瓶颈

本月 AI 硬件领域最具揭示意义的事件不是一场产品发布,而是一场会面:AMD 首席执行官苏姿丰(Lisa Su)与三星半导体部门负责人面对面坐下来谈。当这个级别的两位 CEO 会面时,摆在桌面上的议题很少是营销合作,而是供应。

据彭博社报道,他们讨论的是高带宽内存(HBM)。HBM 是一种堆叠式内存,紧邻 AI 加速器放置,以足够快的速度向其输送数据,让芯片持续满负荷运转。目前全球只有三家公司生产 HBM——SK 海力士、三星和美光,而 SK 海力士目前占据着英伟达所用 HBM3E 供应的主导份额。如果你想理解为什么 AI 算力如此稀缺,答案已经越来越与逻辑芯片无关,而更多取决于谁能够可靠地大规模堆叠内存。

为什么 HBM 决定了出货数量

AI 加速器的价值,取决于它所挂载的内存带宽。Token 生成是内存密集型任务:系统需要反复读取模型权重和键值缓存(KV cache),因此片上 SRAM 和内存局部性的重要性超过原始算力密度。这正是为什么一颗芯片标称的 FLOPS 数字对推理成本的解释力不如其内存配置,也是为什么英伟达自身的路线图已经转向围绕内存容量和散热的争夺。

三星的困境恰恰说明了利害所在。该公司在 HBM 良率上一直苦苦挣扎,导致其通过英伟达供应链认证的时间被推迟。对 AMD 而言,加深这段合作关系是一种对冲。如果它能锁定三星 HBM 的优先配额,其 MI 系列路线图就能获得一个有竞争力的说法,而不必依赖竞争对手已经绑定的同一家供应商。

规格参数表明内存如今才是关键所在。AMD 的 MI450 采用台积电 2nm 工艺上的 CDNA 5 架构,每颗芯片最高配备 432 GB 的 HBM4。这个数字分量十足:它决定了大型混合专家模型(MoE)是能在单颗加速器上运行,还是必须拆分到多颗加速器上——后者会让硬件成本和网络复杂度成倍增加。

为什么是推理、而非训练,在推动这场短缺

训练吸引了所有关注,但真正决定内存需求的是推理。训练是一次次会结束的有限项目,而推理永不停歇,并随用户规模扩展。生成一个 token 需要从内存中读取模型权重和键值缓存,而缓存会随上下文长度增长,因此一段长对话对每位用户的内存开销高于短对话。分析师估计,一个 AI 用户消耗的 token 量约为普通服务用户的五倍——他们描述的其实就是一台必须为每个人保存远多得多状态的机器。

架构行业的应对之道是解耦(disaggregation):把处理提示词的预填充(prefill)与生成 token 的解码(decode)拆分开来,让各自运行在与自身特性相匹配的硬件上。据报道,AMD 和 Cerebras 一直在合作一种组合方案,将高吞吐处理与低延迟生成结合起来。这在机架层面有所帮助,却无助于缓解两部分都需要的存储芯片供应。在三家供应商的封装良率整体改善之前,任何架构上的取巧都只能提升效率,而无法解除这一约束。

AMD 凭借硬件订单市值突破一万亿美元

商业层面的消息也在同一时间窗口到来。10 月 2 日,AMD 股价收于创纪录的 633.91 美元,市值突破一万亿美元,年内涨幅超过 180%。这轮上涨有具体成因,而非情绪驱动。OpenAI 承诺了一个以 MI450 为核心的 6 吉瓦、多代际建设项目,部署将于 2026 年下半年启动,并附带一份与里程碑挂钩的认股权证,允许其购买最多 1.6 亿股 AMD 股票。甲骨文(Oracle)则作为发布合作伙伴加入,从第三季度起部署一个使用 5 万颗 MI450 GPU 的超级集群。

细看其结构,这更像是一项融资安排,而非芯片订单。与部署里程碑挂钩的认股权证,让买方在供应商的成功中持有股权,这是在双方都对如此规模感到不安时对齐激励的一种方式。英伟达也在下一盘类似的棋,计划为 OpenAI 提供至少 10 吉瓦的自有系统,潜在投资规模最高达 1000 亿美元。这种双供应商格局已不再是一种采购策略,而是一种合资结构。

美光的财季与超级周期论

内存厂商的财报从另一个方向给出了同样的信号。美光的季度业绩远超预期,受益于 AI 驱动的 HBM 和 DRAM 需求,多家机构将这一时刻描述为内存超级周期的开端,而非一次短暂的尖峰。一个支撑论据是消耗量。追踪推理负载的分析师认为,每位 AI 用户的 token 消耗量约为浏览普通服务的人类用户的五倍,这把内存从一项组件成本重新定义为一项按用户计量的运营成本。

这关系到短缺将如何化解。逻辑芯片产能可以通过建厂来增加,但这需要两三年。HBM 产能更难,因为它依赖先进封装,以及少数供应商已经掌握控制方法的堆叠良率。三星的良率困境与其说是管理失职,不如说是有技能的从业者基础有多么狭窄的证据。新增一家合格供应商是一个多年期的项目,而需求曲线不会等待。

同一故事的桌面版本

这一约束在更小的形态中也同样显现。英伟达的 GB300 Blackwell Ultra 在搭配 800Gbps 网络的桌面测试中,每天可处理超过 22 亿个 token,对于一台放在桌下的机器来说,这是个惊人的数字。同时,这台机器的价格也部分取决于能塞进多少内存。限制数据中心机架的同一套物理规律,也限制着工作站。

厂商押注的长期答案是架构层面的。英伟达在 CES 上发布的 Vera Rubin 平台,将 Rubin GPU 与 Vera CPU、NVLink 纵向扩展网络以及完整软件栈配对,公司正推动业界转向「每瓦每秒 token 数」这类指标,而非原始 FLOPS。它还通过 NVLink Fusion 开放了自己的互连技术,让合作伙伴能够集成自有的 CPU 和芯片。此外还有报道称其正在自研内存控制器,这释放出一个信号:公司预期内存供应将长期是一个战略性变量,而非一种可直接采购的大宗商品。

值得关注的三件事

三件事将决定内存约束在 2027 年前是缓解还是加剧。第一是三星在 HBM4 上与 AMD 和英伟达双方的认证时间表,因为真正合格的第三家供应商对定价格局的改变,超过任何单一产品的发布。第二是美光能否作为替代选项缩小差距,这将减轻两家韩国供应商的压力。第三是解耦式推理——即提示词处理与 token 生成在不同类型的加速器上运行——能否普及到足以减轻任何单颗芯片的内存压力。

这些都不会很快有结果。与此同时,对任何购买或基于 AI 算力进行构建的人来说,实际的结论是:将影响你成本的是内存,而非算力。逻辑芯片的路线图是公开且可预测的;而内存的路线图受制于封装良率、多年积累的人才基础以及三家公司的资本计划,而正是它一直在决定实际能出货多少颗加速器。

相关文章