記憶體晶片如今成為 AI 運算的瓶頸

本月 AI 硬體領域最耐人尋味的事件不是一場產品發表,而是一場會面:AMD 執行長蘇姿丰與三星半導體部門負責人親自坐下來對談。當這個層級的兩位執行長碰面,桌上談的很少是行銷合作,而是供給。
根據彭博社報導,他們討論的是高頻寬記憶體(HBM)。HBM 是堆疊式記憶體,置於 AI 加速器旁,以足夠快的速度餵資料給它,讓晶片保持滿載運作。這種記憶體由三家廠商生產——SK 海力士、三星與美光,而 SK 海力士目前握有 Nvidia 所用 HBM3E 供應的主導份額。如果你想知道 AI 算力為何稀缺,答案越來越不在邏輯晶片,而在於誰能穩定地大量堆疊記憶體。
為什麼 HBM 決定了出貨數字
AI 加速器的價值,取決於掛在它身上的記憶體頻寬。Token 生成是記憶體密集型工作:系統會反覆讀取模型權重與鍵值快取,因此晶片內 SRAM 與記憶體局部性的重要性,高於單純的運算密度。這也是為什麼一顆晶片宣傳的 FLOPS 數字,對推論成本的說明力不如它的記憶體配置來得高,也是為什麼 Nvidia 自家的產品藍圖已轉向記憶體容量與散熱的競爭。
三星的處境說明了這件事的代價。該公司在 HBM 良率上苦苦掙扎,導致它取得 Nvidia 供應鏈資格的時程延後。對 AMD 而言,深化這段關係是一種避險。若能鎖定三星 HBM 的優先分配,其 MI 系列藍圖就能取得一項競爭籌碼,而且不必依賴對手已經綁定的同一家供應商。
規格說明了記憶體如今有多關鍵。AMD 的 MI450 採用台積電 2 奈米製程的 CDNA 5 架構,每顆晶片最高搭載 432 GB 的 HBM4。這個數字份量十足:它決定了你能否把一個大型混合專家(MoE)模型跑在單一加速器上,還是必須拆分到多顆加速器,而後者會讓硬體帳單與網路複雜度雙雙倍增。
為什麼推動這波緊縮的是推論,而非訓練
訓練吸引了目光,但推論才決定了記憶體需求。訓練是一次次有終點的專案,跑完就結束;推論則永無止境,並隨使用者規模成長。生成一個 token 需要從記憶體讀取模型權重與鍵值快取,而快取會隨上下文長度成長,因此一段長對話對每位使用者的記憶體成本高於短對話。分析師估計 AI 使用者消耗的 token 大約是一般服務使用者的五倍,這描述的是一台必須為每個人保存遠多於以往狀態的機器。
架構產業的解答是分解式(disaggregation):把處理提示詞的預填充(prefill)與生成 token 的解碼(decode)拆開,讓各自跑在符合其特性的硬體上。據報導,AMD 與 Cerebras 正合作推出一種搭配方案,結合高吞吐量的處理與低延遲的生成。這在機櫃層級有幫助,但對兩半都需要的記憶體晶片供給毫無助益。除非三家供應商的封裝良率都能改善,否則任何架構上的巧思都只能換來效率,無法鬆綁這個限制。
AMD 靠硬體訂單跨越一兆美元
商業面的消息在同一個時間窗內出現。AMD 在 10 月 2 日以創紀錄的 633.91 美元收盤,市值突破一兆美元,今年以來漲幅超過 180%。這波漲勢有明確的成因,而非出於市場情緒。OpenAI 承諾以 MI450 為核心、分多個世代建置 6 GW 的算力,2026 年下半年開始部署,並附帶一項可依里程碑購買最多 1.6 億股 AMD 股票的權證。甲骨文則以首發合作夥伴身分加入,從第三季起以 5 萬顆 MI450 GPU 建置一座超級叢集。
細看這個結構,它與其說是一筆晶片訂單,不如說是一種融資安排。與部署里程碑掛鉤的權證,讓買方在供應商的成功中取得股權,這是當規模大到雙方都必須審慎時,用來對齊誘因的一種方式。Nvidia 也在進行類似的布局,規劃為 OpenAI 提供至少 10 GW 的自有系統,潛在投資金額最高達 1,000 億美元。這種雙供應商的格局已不再只是採購策略,而是一種合資架構。
美光的財報與超級循環論
記憶體廠的財報從另一側傳達了相同訊號。美光季度業績遠超預期,動能來自 AI 帶動的 HBM 與 DRAM 需求,多家機構形容這一刻是記憶體超級循環的開端,而非短暫的急漲。其中一個支持論點是消耗量。追蹤推論工作負載的分析師估計,每位 AI 使用者的 token 消耗量約為瀏覽一般服務的人類使用者的五倍,這讓記憶體從一項零組件成本,重新定位為每位使用者的營運成本。
這對短缺如何化解很重要。邏輯晶片的產能可以靠興建新廠來擴充,大約需要幾年。HBM 產能更難,因為它取決於先進封裝,以及少數供應商才學會掌控的堆疊良率。三星的良率困境與其說是管理失敗,不如說證明了具備這項技能的人才基礎有多窄。要再培養出第三家有資格的供應商,是耗時數年的工程,而需求曲線不會等人。
同樣的故事,桌邊版本
這個限制在更小的機型上也看得見。Nvidia 的 GB300 Blackwell Ultra 在桌邊測試中,搭配 800 Gbps 網路,展現每天超過 22 億個 token 的表現,對一台擺在桌下的機器來說是驚人的數字。而這台機器的價格,也部分取決於能塞進多少記憶體。限制資料中心機櫃的同一套物理定律,同樣限制一台工作站。
供應商押注的長期解方是架構層面的。Nvidia 在 CES 發表的 Vera Rubin 平台,將 Rubin GPU 與 Vera CPU、NVLink 擴展式網路以及完整軟體堆疊搭配,並朝每瓦每秒 token 數這類指標推進,而非單純的 FLOPS。該公司也透過 NVLink Fusion 開放其互連技術,讓合作夥伴整合自家的 CPU 與晶片。據報導,Nvidia 也在推動客製化記憶體控制器的計畫,這顯示該公司預期記憶體供應將持續是一項策略變數,而非可採購的標準商品。
值得觀察的重點
有三件事將決定記憶體限制在 2027 年前是趨緩還是更加緊縮。第一是三星 HBM4 對 AMD 與 Nvidia 的雙線認證時程,因為真正取得資格的第三家供應商,對價格結構的影響勝過任何單一產品發表。第二是美光能否縮小差距、成為替代選項,這將減輕兩家韓國供應商的壓力。第三是分解式推論——也就是提示詞處理與 token 生成跑在不同類型加速器上——能否普及到足以降低任何單一晶片的記憶體壓力。
這些都不會很快有答案。在此同時,對任何採購或建構 AI 算力的人來說,實際的結論是:會左右你成本的是記憶體,而不是運算。邏輯晶片的藍圖公開且可預測。記憶體藍圖則受制於封裝良率、需要多年累積的人才基礎,以及三家公司的資本支出計畫,而正是它一直在決定究竟有多少顆加速器能真正出貨。