NVIDIAの4,999ドルDGX Spark 64GB、常時稼働エージェント向けにデスク上へペタフロップスを届ける

NVIDIAはデスクトップAIコンピューター「DGX Spark」の64GB版を確認した。価格は4,999ドルからで、10月23日にAcer、Asus、Dell、Gigabyte、HP、MSI、H3Cから出荷される。128GBモデルは6,950ドルで販売が続く。どちらもGB10 Grace Blackwellスーパーチップを搭載し、Blackwell GPUと20コアArm CPUを1パッケージに組み合わせ、両者で単一のLPDDR5Xメモリプールを共有する。

売りはアーキテクチャだ。コヒーレント統合メモリとはCPUとGPUが同じアドレス空間を見ることを意味し、システムRAMとVRAM間でデータをコピーする必要がなくなる。64GBの筐体では約8GBがオペレーティングシステムに割かれ、約56GBがモデルの重みと、コンテキスト長に応じて増大するKVキャッシュに残される。NVIDIAはこのチップをFP4形式で最大1ペタフロップスのAI演算性能と評価している。
64GBで実際に動くもの
NVIDIAは64GB構成を30B~35Bクラスのモデル向けに位置づけている:Qwen3.8-27B、Gemma 4 26B、Meta Muse Glimmer、Nemotron 3.5 Lightning。NVIDIAによれば精度を維持するNVFP4量子化を使えば、1台で最大約100Bパラメータのモデルを扱える。それこそがこのマシンの狙いだ。1年前なら、そのレベルのモデルにはサーバーラックが必要だった。今では大きめの弁当箱ほどの筐体に収まる。
トレードオフはメモリ帯域幅だ。273GB/sでは、Sparkは100人の同時ユーザーにチャット製品を提供するようには作られていない。長い入力と短い出力、つまりリポジトリやログダンプ、書類の山を読んで短い結果を書くために作られている。この形はエージェントによく合う。エージェントはほとんどの時間をコンテキストの読み取りに費やし、ときどき答えを生成するだけだからだ。
この筐体の系譜
Sparkは、本格的な計算能力を机の下に置くNVIDIAの初の試みではない。128GB版はすでにより高い価格で存在しており、64GBモデルは意図的に低価格帯へ移行したものだ。同じGB10チップと同じ統合メモリ設計を保ちながらメモリを半分にすることで、マシンの用途を変えずに導入コストを下げている。これは重要だ。以前のモデルはワークステーション価格で、ワークステーション価格では購入できる人が限られるからだ。
64GB構成が1年前ではなく今なら理にかなう理由はもう1つある。56GBに収まるオープンモデルは、実行する価値があるほど十分に優れている。量子化された重みと長いコンテキストウィンドウを備えた27Bモデルは、おもちゃのようなプロンプトではなく、実際のコーディングやリサーチのタスクを扱える。6か月前、同等の能力をローカルで動かすには、より大きな筐体とより大きな請求額が必要だった。ハードウェアとモデルが同じしきい値に到達した。だからこそ、この値下げは見せかけではなく意味を持つ。
クラスタリングは一級機能
すべてのDGX Sparkには最大200GbEで動作するConnectX-7ネットワークカードが付属し、無料のNVIDIA Syncアプリがセットアップを担う。そのCluster Assistantがネットワークを構成するため、ネットワーク管理者でなくても最大4台を接続できる。64GBのSpark 2台をプールすると128GBになり、NVIDIAによればそのペアは単一の128GBモデルに比べて最大1.7倍の性能を発揮する。演算能力と帯域幅がほぼ2倍になるからだ。2台なら直接ケーブルで接続でき、4台にはスイッチが必要だ。
実用的な効果は段階的な拡張性だ。1台で実験を始め、実際のワークロードには2台目を追加し、ワークロードがローカルハードウェアを超えるまで拡張し続けられる。スケールさせると最初のトークンまでの時間が最も改善する。これは、行動する前に長い入力を読むエージェントにとって重要なことだ。
エージェントの物語はソフトウェア層にある
SparkにはDGX OS、CUDAスタック、そして通常のツール群が付属する:PyTorch、Jupyter、Ollama、さらにvLLMとllama.cpp向けのチューニング済みサポート。NVIDIAは自社の最適化により、ローカルエージェント推論が最大1.9倍高速になると主張している。また、NVIDIA Agent Toolkitの一部であるOpenShellも同梱され、エージェントができることに対してポリシーベースの境界を設定する。
この最後の部分は、より広いトレンドにつながる。エージェントがデモから日常利用へ移るにつれ、ボトルネックはモデルではなく信頼性になる。一晩中エージェントを動かすローカルマシンは、ツール呼び出しを正しく行い、障害から回復し、範囲外へ逸れない必要がある。NVIDIAはまさにこの点に賭けている。Sparkは単発のプロンプトではなく、常時稼働エージェントを狙っている。
Perplexityはすでにこのハードウェアに適応し、デバイス上で118Bモデルをローカル実行できる最適化済みポータブルコンピューターエージェントを提供している。これは注目すべきシグナルだ。Perplexityはクラウドファーストの企業だからだ。もしローカルハードウェア向けに構築しているなら、モデルを自分のマシン上で動かしたいユーザー市場を期待していることになる。
誰に向いているか、向いていないか
4,999ドルという価格はSparkを消費者向けではなくプロ向けの領域に置く。恩恵を受けるのは、トークン単位のAPI料金が積み上がるほど頻繁にエージェントを動かす研究者、個人開発者、小規模チーム、あるいは自社ハードウェアから出せないデータを扱う人々だ。プライベートリポジトリでコーディングモデルをファインチューニングする、新しいオープンモデルを初日評価する、複数のモデルを同時に常駐させる、といった仕事はすべて統合メモリ設計に合っている。
それ以外の人々にとって、その損得計算はそれほど明確ではない。1日に数回AIを使うなら、クラウドAPIのほうが安くて簡単だ。Sparkが理にかなうのは、利用量が多く、データが機密性を持ち、ワークロードが継続的に動く場合だ。64GBモデルは参入価格を下げるが、その論理を変えるものではない。
予算を立てる人にとって注目すべき細部が1つある。使用可能な56GBのメモリは、重みとKVキャッシュの両方をまかなわなければならない。長いコンテキストはキャッシュを食い、エージェントのワークロードは本質的に長い。技術的には収まる量子化モデルでも、コンテキストが大きくなると壁にぶつかることがある。NVIDIAが、より大きなモデルの55GBのフル精度版ではなく17GBの量子化ビルドを実用的な選択肢として挙げているのはそのためだ。モデルを収めることと、長いタスクでうまく動かすことは、2つの異なるテストだ。
より大きなシグナル
このリリースで興味深いのは値下げではない。27Bや30Bモデルがデスクトップで動くことが、数か月前のフロンティアの挙動に十分近づき、このマシンを中心に製品を作る価値があるということだ。ハードウェアとオープンモデルは同じ地点に収束した。机の下の筐体で、眠っている間も働くエージェントを動かし、データは建物から一切出ない。NVIDIAは、それだけの開発者がそれを求め、製品ラインを正当化すると賭けている。Sparkを出荷するOEMのリストは、NVIDIAが答えをイエスと考えていることを示しており、今後数年間のAI作業がすべてデータセンターで起きるわけではないと考えていることを示している。