← 返回部落格
News預計閱讀 9 分鐘

AI 晶片的怪異經濟學:新機櫃壓低成本,舊晶片卻變得更貴

發布於 2026年10月2日
AI 晶片的怪異經濟學:新機櫃壓低成本,舊晶片卻變得更貴

AI 硬體界在 9 月發生了兩件事,而且看似指向相反方向。Nvidia 開始向大型雲端服務供應商出貨其最新的機櫃級系統,承諾大幅降低推論成本。與此同時,租用其已推出三年的 H100 晶片價格卻上漲了。兩者都是事實,而它們合在一起,說明了 AI 經濟實際上如何運作。

新機櫃

Nvidia 確認其 Vera Rubin NVL144 機櫃系統正在大量出貨,首批主要部署將在 Microsoft、Google、Amazon 和 Oracle 上線,而 CoreWeave 表示其首批 Rubin 叢集將在 9 月底前提供給客戶。這是業界嘗試過最大規模的硬體轉換,取代過去兩年支撐多數前沿模型訓練的 Blackwell 世代。

這套架構不是單一晶片。Vera Rubin 在每個節點上將一顆 Vera CPU 與兩顆 Rubin GPU 配對,並將它們連結起來,讓整個機櫃像一顆大型處理器般運作。NVL144 配置在一個機櫃中橫跨 72 個節點連接 144 顆 Rubin GPU,首次在正式生產系統中採用 HBM4 記憶體,每顆 GPU 的記憶體頻寬約為每秒 13 TB。Nvidia 宣稱每座機櫃的 FP4 推論效能約為 3.6 exaflops,約為同等級 Blackwell NVL72 機櫃的三倍。這些是理想條件下的數字,而保守的獨立估計認為實際增益較接近二到二點五倍。

對資料中心以外所有人來說,真正重要的數字是每 token 成本。早期雲端定價顯示,採用 Rubin 的執行個體在推出時,推論成本可能比 Blackwell 低 30% 到 40%,而且隨著產能提升,價格通常會進一步下降。這個數字會向下游傳導,影響 API 呼叫的價格、訂閱方案的規模,以及一項影片生成功能能否存在於二十美元的方案中。

變得更貴的舊晶片

這裡有個反直覺的部分。9 月,帶動第一波 AI 產品的 H100 晶片,每小時租金上漲 22%,達到每小時 3.28 美元。Nvidia 執行長指出,這波上漲證明運算力是持久、能產生收入的資產,而不是會按表定時程折舊的東西。

原因是供應。新的 Blackwell 和 Rubin 晶片被保留給最大買家,這使得較舊的 H100 叢集負責日常推論工作負載。資料中心整體電力與記憶體供應吃緊,讓舊硬體持續忙碌,也讓租金居高不下。H100 仍比剛推出時便宜許多,當時大型雲端公司以每小時七到八美元租用,但最近這波上漲與標準會計作法相牴觸,因為標準會計會在五到六年內折舊晶片價值。

這個落差引起了關注。做空者主張,晶片的實際壽命比官方時程假設的更短,這意味著雲端供應商帳上的折舊速度太慢。Nvidia 在 8 月公布創紀錄的 962 億美元季度營收,而租金上漲為該公司提供了新論據:其晶片在推出後很久仍能持續賺錢。

擴大新機櫃規模的競賽

部署速度與規格本身同樣說明了一切。CoreWeave 成為第一家以多機櫃規模運行新硬體的雲端供應商,在 9 月 16 日將七座 Vera Rubin NVL72 機櫃、總計 504 顆 GPU,啟動為一個橫跨兩個區域的正式生產叢集。從單一驗證機櫃躍升到多機櫃互連架構至關重要,因為代理式 AI 工作負載會進行大量小型、對延遲敏感的呼叫,而延遲會在反覆的模型與工具互動中累積。每座 NVL72 機櫃將 72 顆 GPU 與 36 顆 Vera CPU 配對,而該互連架構設計支援每條 rail 約 128,000 顆 GPU,無需重新設計,這意味著增加容量只是配置變更,而不是重建。

這次的供應模式看起來也不同。在 Blackwell 世代,需求遠遠超過供應,導致較小的雲端供應商和國家級 AI 計畫得等上六個月甚至更久。Nvidia 更早提高 Rubin 產量,而歐洲和中東的幾個主權 AI 專案據報導位於第一批出貨行列,而非第三批。Nvidia 也宣布與澳洲雲端和資料中心營運商合作,要在 2027 年前建置最多兩吉瓦的 AI 工廠容量。如果此事成真,租用 GPU 時間將明顯變得更容易,這會拉低整體成本曲線,讓下游所有人都受益。

為什麼兩件事都是真的

一旦把訓練與推論分開,表面上的矛盾就化解了。訓練需要最新、最大的叢集,而這股需求正是建置 Vera Rubin 這類機櫃的理由。推論是模型訓練完成後所做的一切:每一次聊天機器人回覆、每一張生成的圖片、每一個程式編寫建議。隨著使用量成長,服務這些請求的經常性成本可能變得比最初的訓練費用更高。

這就是為什麼 Nvidia 選擇開放其生態系的一部分,而不是死守每一個插槽。9 月 10 日,該公司宣布與 d-Matrix 合作,這是一家專門打造推論晶片的新創公司。根據協議,d-Matrix 的下一代 Raptor 晶片將透過 NVLink Fusion 連接至 Nvidia 的機櫃架構。Raptor 專為 AI 推論打造,尤其是聊天機器人、程式助理和語音代理等低延遲工作,並採用記憶體為中心的設計,旨在降低延遲與成本。Nvidia 並沒有放棄任何原本完全擁有的東西,因為它仍供應機櫃周圍的 CPU、網路、交換器和軟體,同時在推論市場取得一席之地,即使它無法贏得每一顆加速器。

在所有這一切底下,還有更嚴苛的限制。單一座 Vera Rubin NVL144 機櫃耗電約 600 千瓦,大致相當於 500 戶一般家庭的用電量。電力,而非晶片,正成為 AI 成長的硬性限制,這就是為什麼 Microsoft、Google 和 Amazon 在過去一年都簽署了核能和地熱電力協議,來餵養這類叢集。如果你想知道 AI 容量將往哪裡去,要看購電協議,而不是基準測試分數。

這對 AI 價格意味著什麼

對使用者來說,實際的解讀是:即使最新硬體的成本仍居高不下,運行模型的成本應該會持續下降。更便宜的推論讓去年還太昂貴的功能,今年得以成為標準配備。冗長而謹慎的聊天機器人回答、能讀完整個程式碼庫的程式助理,以及隨選影片生成,全都取決於這條成本曲線向下彎折。

投資人不斷問的問題是:龐大的資料中心支出究竟能否回本。Rubin 是答案的一部分。如果同一個模型每 18 個月左右的運行成本大約減半,那麼這些支出看起來就不再那麼像泡沫,而更像基礎建設。如果這條曲線停滯,懷疑論者就會迎來他們的時刻。接下來兩季的雲端定價會說明走勢,而這個數字會遠早於任何基準測試,以你的 AI 工具費用形式來到你面前。

相關文章