← ブログに戻る
News読了目安 15 分

メモリチップが今やAIコンピューティングのボトルネックになっている

公開日 2026年10月7日
メモリチップが今やAIコンピューティングのボトルネックになっている

今月のAIハードウェアで最も示唆に富む出来事は、製品発表ではなく会談だった。AMDの最高経営責任者リサ・スーが、サムスンの半導体部門のトップと直接会って話し合ったのだ。このレベルの両CEOが会うとき、議題に上るのがマーケティング提携であることはほとんどない。供給だ。

ブルームバーグの報道によれば、両者が話し合っていたのは広帯域メモリ(HBM)だ。HBMはAIアクセラレータの隣に配置される積層メモリで、シリコンを稼働させ続けられるだけの速さでデータを供給する。製造しているのはSKハイニックス、サムスン、マイクロンの3社で、現在Nvidiaが使うHBM3Eの供給で支配的なシェアを握っているのはSKハイニックスだ。AIコンピューティングがなぜ不足しているのかを理解したいなら、その答えはますますロジックチップとは関係が薄くなり、誰が大量に安定してメモリを積層できるかという問題に集約される。

なぜHBMが出荷台数を決めるのか

AIアクセラレータの有用性は、それに接続されたメモリ帯域幅によって決まる。トークン生成はメモリ集約的だ。システムはモデルの重みとキーバリューキャッシュを繰り返し読み出すため、オンチップSRAMとメモリの局所性は、生の演算密度よりも重要になる。だからこそ、チップの公称FLOPS値は、推論コストについてメモリ構成ほど多くを語らないのであり、Nvidia自身のロードマップがメモリ容量と熱との戦いへと向かっているのだ。

サムスンの問題は、その利害の大きさを物語っている。同社はHBMの歩留まりに苦しみ、Nvidiaのサプライチェーンへの認定が遅れた。AMDにとって、関係を深めることはヘッジである。サムスンからのHBM優先割り当てを確保できれば、MIシリーズのロードマップは、競合がすでに押さえてしまった同じサプライヤーに依存しない競争力の根拠を得ることになる。

スペックを見れば、今やメモリがいかに本質であるかが分かる。AMDのMI450はTSMCの2nmプロセスでCDNA 5アーキテクチャを採用し、1チップあたり最大432ギガバイトのHBM4を搭載する。この数字には実際の重みがある。大規模なMixture-of-Expertsモデルを1基のアクセラレータで動かすか、複数に分割せざるを得ないかの違いであり、後者ではハードウェア費用もネットワークの複雑さも倍増する。

なぜトレーニングではなく推論が逼迫を生むのか

注目を集めるのはトレーニングだが、メモリ需要を決めるのは推論だ。トレーニングは完了する有限のプロジェクトだが、推論は永遠に走り続け、ユーザー数とともに拡大する。1トークンを生成するには、モデルの重みとキーバリューキャッシュをメモリから読み出す必要があり、キャッシュはコンテキスト長とともに増大する。つまり、長い会話は短い会話よりもユーザー1人あたりのメモリ消費が大きい。AIユーザーは通常のサービスユーザーの約5倍のトークンを消費するというアナリストの推計は、1人あたりはるかに多くの状態を保持しなければならないマシンを描写しているのだ。

アーキテクチャ業界の答えはディスアグリゲーション(分離)だ。プロンプトを処理するプリフィルと、トークンを生成するデコードを分離し、それぞれをその特性に合ったハードウェアで動かす。AMDとCerebrasは、高スループット処理と低遅延生成を組み合わせたペアリングに取り組んでいると報じられている。これはラックレベルでは役立つが、両者が必要とするメモリチップの供給には何の効果もない。3社全体でパッケージング歩留まりが改善しない限り、あらゆるアーキテクチャ上の工夫は効率を買うだけで、制約を緩和することはない。

AMDはハードウェア受注で時価総額1兆ドルを突破

商業面のニュースも同じ時期に届いた。AMDは10月2日に記録的な633.91ドルで取引を終え、時価総額は1兆ドルを超え、年間で180%超の上昇となった。この上昇にはセンチメントではなく具体的な原因がある。OpenAIはMI450を中心とした6ギガワット、複数世代にわたる構築を約束し、展開は2026年下半期に始まる。またマイルストーンに連動して最大1億6000万株のAMD株を購入できるワラントも付く。Oracleは第3四半期から5万基のMI450 GPUを使うスーパークラスタのローンチパートナーとして加わった。

その構造を読み解くと、チップの注文というより資金調達の取り決めに見える。展開のマイルストーンに連動したワラントは、買い手にサプライヤーの成功に対する持分を与えるもので、両者にとって不安になるほど量が大きいときにインセンティブを一致させる手法だ。Nvidiaも同様の策を進めており、OpenAI向けに少なくとも10ギガワットの自社システムを計画し、最大1000億ドルの投資可能性がある。2社サプライヤーの力学はもはや調達戦略ではない。合弁事業の構造なのだ。

マイクロンの四半期とスーパーサイクル論

メモリの決算は、逆側から同じシグナルを発した。マイクロンの四半期決算はAI主導のHBMとDRAM需要により予想を大きく上回り、複数の機関がこの瞬間を一時的な急騰ではなくメモリのスーパーサイクルの始まりだと評した。根拠の一つは消費量だ。推論ワークロードを追跡するアナリストは、AIユーザー1人あたりのトークン消費量を、通常のサービスを閲覧する人間の約5倍と見積もっており、これはメモリを部品コストからユーザー1人あたりの運営コストへと位置づけ直すものだ。

これは不足がどう解消されるかに影響する。ロジックの生産能力は工場を建てることで増やせるが、それには数年かかる。HBMの生産能力はより難しく、高度なパッケージングと、ごく少数のサプライヤーだけが制御法を習得した積層歩留まりに依存する。サムスンの歩留まり問題は経営の失敗というより、熟練した基盤がいかに狭いかの証拠だ。3社目の認定サプライヤーを加えるのは数年がかりのプロジェクトであり、需要曲線は待ってはくれない。

同じ話のデスクサイド版

この制約はより小さなフォームファクタにも現れる。NvidiaのGB300 Blackwell Ultraは、800Gbpsネットワーキングを備えたデスクサイド試験で1日あたり22億トークン超を示した。机の下に置かれるマシンとしては驚異的な数字だ。またそれは、どれだけメモリを詰め込めるかによって価格の一部が決まるマシンでもある。データセンターのラックの上限を決めるのと同じ物理が、ワークステーションの上限も決めるのだ。

ベンダーが賭ける長期的な答えはアーキテクチャにある。CESで発表されたNvidiaのVera Rubinプラットフォームは、Rubin GPUとVera CPU、NVLinkスケールアップネットワーキング、そして完全なソフトウェアスタックを組み合わせたもので、同社は生のFLOPSではなくワットあたり毎秒トークンといった指標を目指して進んでいる。またNVLink Fusionを通じてインターコネクトを開放し、パートナーが自社のCPUやシリコンを統合できるようにした。カスタムメモリコントローラの取り組みも報じられており、これは同社がメモリ供給を購入するコモディティではなく戦略的変数であり続けると見ているシグナルだ。

注目すべき点

2027年にかけてメモリ制約が緩むか厳しくなるかを決めるのは3つの点だ。第一は、AMDとNvidia双方に対するサムスンのHBM4認定のタイムラインである。真に認定された3社目のサプライヤーは、単一の製品発表よりも価格力学を大きく変えるからだ。第二は、マイクロンが代替として差を縮められるかどうかで、それがかなえば韓国2社への圧力が和らぐ。第三は、プロンプト処理とトークン生成を異なる種類のアクセラレータで動かすディスアグリゲーション推論が、単一チップにかかるメモリ圧力を減らすほど一般化するかどうかだ。

これらのいずれもすぐに解決はしない。当面、AIコンピューティングを購入または構築するすべての人にとっての実用的な結論は、コストを動かす数字はコンピュートではなくメモリだということである。ロジックのロードマップは公開されており予測可能だ。メモリのロードマップは、パッケージング歩留まり、何年もかけて培われる人材基盤、そして3社の設備投資計画によって制約されており、実際に何基のアクセラレータが出荷されるかを決めてきたのはこちらなのだ。

関連記事