← ブログに戻る
News読了目安 14 分

AIチップの奇妙な経済学:新しいラックはコストを削減するが、旧チップは値上がりする

公開日 2026年10月2日
AIチップの奇妙な経済学:新しいラックはコストを削減するが、旧チップは値上がりする

9月、AIハードウェアの世界で2つの出来事が起きた。一見、逆方向を指しているように思える。Nvidiaは最新のラックスケールシステムを大手クラウドプロバイダーへの出荷を開始し、推論コストの大幅な削減を約束した。同時に、3年前のH100チップのレンタル価格は上昇した。どちらも事実であり、両方を合わせるとAI経済の実際の仕組みが説明できる。

新しいラック

Nvidiaは、Vera Rubin NVL144ラックシステムが大量出荷されていることを確認した。最初の主要な導入はMicrosoft、Google、Amazon、Oracleで稼働し、CoreWeaveは最初のRubinクラスターを9月末までに顧客に提供すると述べている。これは業界が試みた中で最大のハードウェア移行であり、過去2年間にわたりほとんどのフロンティアモデルのトレーニングを支えてきたBlackwell世代を置き換えるものである。

このアーキテクチャは単一のチップではない。Vera Rubinは、ノードごとにVera CPUと2つのRubin GPUを組み合わせ、それらをリンクしてラック全体が1つの大型プロセッサのように動作する。NVL144構成では、1つのラック内の72ノードにわたって144個のRubin GPUを接続し、実運用システムとしては初めてHBM4メモリを搭載し、GPUあたり毎秒約13テラバイトのメモリ帯域幅を持つ。Nvidiaは、ラックあたり約3.6エクサフロップスのFP4推論性能を主張しており、これは同等のBlackwell NVL72ラックの約3倍である。これらは理想的な条件下での数値であり、保守的な独立系の推定では実世界での向上は2倍から2.5倍程度とされている。

データセンターの外にいる誰もにとって重要な数値は、トークンあたりのコストである。初期のクラウド価格では、Rubinベースのインスタンスはリリース時にBlackwell推論よりも30~40%安くなる可能性があり、容量が増えるにつれて価格は通常さらに下がる。この数値は、API呼び出しの価格、サブスクリプションの規模、そして20ドルのプラン内で動画生成機能が存在できるかどうかにまで波及する。

値上がりした旧チップ

ここが直感に反する部分だ。9月、AI製品の第一波を支えたチップであるH100の1時間あたりのレンタル価格は22%上昇し、1時間3.28ドルとなった。Nvidiaの最高経営責任者は、この上昇を、コンピュートが予定通りに減価償却されるものではなく、耐久性があり収益を生み出す資産であることの証拠だと指摘した。

理由は供給だ。新しいBlackwellとRubinチップは最大手の購入者向けに確保されており、古いH100クラスターが日常的な推論ワークロードを処理している。データセンター全体で電力とメモリの供給が逼迫しているため、旧ハードウェアは稼働し続け、レンタル価格は高止まりしている。H100は、大手クラウド企業が1時間7~8ドルでレンタルしていた発売時よりも依然としてはるかに安いが、最近の上昇は、チップの価値を5~6年で減価償却する標準的な会計処理に反している。

このギャップは注目を集めている。空売り筋は、実際のチップ寿命は公式スケジュールが想定するよりも短く、つまりクラウドプロバイダーの帳簿上の減価償却が遅すぎると主張してきた。Nvidiaは8月に962億ドルの四半期売上高を記録し、レンタル価格の上昇は、同社のチップが新品でなくなった後も長く収益を生み続けるという新たな主張の根拠となっている。

新しいラックのスケール競争

展開の速さは仕様と同じくらい雄弁だ。CoreWeaveは、新しいハードウェアをマルチラックスケールで稼働させた最初のクラウドプロバイダーとなり、9月16日に2つのリージョンにまたがる1つの本番クラスターとして、7台のVera Rubin NVL72ラック、合計504個のGPUを立ち上げた。単一の検証済みラックからマルチラックファブリックへの飛躍は重要である。なぜなら、エージェント型AIワークロードは多数の小さなレイテンシに敏感な呼び出しを行い、モデルとツールの反復的な相互作用を通じて遅延が累積するからだ。各NVL72ラックは72個のGPUと36個のVera CPUを組み合わせており、ファブリック設計は再設計なしでレールあたり約128,000個のGPUをサポートする。つまり、容量の追加は再構築ではなく構成変更である。

供給パターンも今回は異なって見える。Blackwell世代では、需要が供給を大きく上回り、小規模なクラウドプロバイダーや国家AIプログラムは6か月以上待たされた。NvidiaはRubinの生産を早めに立ち上げ、欧州と中東のいくつかのソブリンAIプロジェクトは、第3波ではなく第1波の出荷に含まれていると報じられている。Nvidiaはまた、オーストラリアのクラウドおよびデータセンター事業者と提携し、2027年までに最大2ギガワットのAIファクトリー容量を構築すると発表した。これが実現すれば、GPU時間のレンタルは大幅に容易になり、下流のすべてにとってコスト曲線全体が押し下げられる。

なぜ両方が真実なのか

一見矛盾するように見えるが、トレーニングと推論を分けて考えれば解決する。トレーニングには最新かつ最大のクラスターが必要であり、その需要がVera Rubinのようなラックの構築を正当化する。推論とは、モデルがトレーニングされた後に行うすべてのことである。チャットボットの返答、生成された画像、コーディングの提案のすべて。使用量が増えるにつれ、それらのリクエストを処理するための継続的なコストは、当初のトレーニング費用よりも大きくなる可能性がある。

だからこそNvidiaは、すべてのソケットを守るのではなく、エコシステムの一部を開放している。9月10日、同社は推論専用チップを開発するスタートアップd-Matrixとの協業を発表した。この契約により、d-Matrixの次世代RaptorチップはNVLink Fusionを通じてNvidiaのラックアーキテクチャに接続される。RaptorはAI推論、特にチャットボット、コーディングアシスタント、音声エージェントなどの低レイテンシ作業向けに構築されており、レイテンシとコストを削減することを目的としたメモリ中心の設計となっている。Nvidiaは完全に所有していたものを何も手放していない。ラック周辺のCPU、ネットワーク、スイッチ、ソフトウェアを依然として供給しつつ、すべてのアクセラレーターを勝ち取らなくても推論市場での地位を獲得するからだ。

このすべての根底には、より厳しい制約がある。Vera Rubin NVL144ラック1台は約600キロワットを消費し、これは平均的な家庭500世帯分の電力にほぼ相当する。AIの成長を縛る制約はチップではなく電力になりつつあり、だからこそMicrosoft、Google、Amazonは過去1年間に、このようなクラスターに電力を供給するための原子力および地熱発電契約を結んだ。AI容量がどこへ向かうかを知りたいなら、ベンチマークスコアではなく電力購入契約を注視すべきだ。

AIの価格にとって何を意味するか

ユーザーにとっての実際の見通しは、最新ハードウェアのコストが高止まりしても、モデルを実行するコストは下がり続けるはずだということだ。推論が安くなれば、昨年は高すぎた機能が今年は標準になる。長く丁寧なチャットボットの回答、コードベース全体を読むコーディングアシスタント、オンデマンドの動画生成はすべて、このコスト曲線が下向きに曲がることに依存している。

投資家が繰り返し問うのは、莫大なデータセンター支出がいつか元を取れるのかということだ。Rubinはその答えの一部である。同じモデルの実行コストがおよそ18か月ごとに約2分の1になれば、その支出はバブルというよりインフラに見え始める。もしその曲線が止まれば、懐疑派の出番となる。次の2四半期のクラウド価格がどちらに向かうかを示すだろう。そしてその数字は、あらゆるベンチマークよりもずっと早く、AIツールのコストという形であなたの元に届く。

関連記事