Fei-Fei Li氏のAtlas、1枚の写真を歩き回れる部屋に変える

World Labsは9月1日、Atlasをアーリーアクセスで提供開始した。Fei-Fei Li氏が共同創業した同社は、これを空間知能のためのオムニ世界モデルと呼び、デモは、部屋を撮った普通のスマホ写真を数枚入力すると、インタラクティブな3Dシーンが出てくるというものだ。その中では仮想カメラをどこへでも動かせる。奥行きを読み取れる。そのジオメトリをロボットに渡し、練習の場として使うこともできる。
Li氏は何年も前から、AIの次のフロンティアは言語ではなく物理世界だと主張してきた。彼女の用語は空間知能であり、テキストと平面的な画像だけで訓練されたモデルには根本的な何かが欠けているという主張だ。言語モデルは、自ら見ることのできない世界を記述する。Atlasは、それを見ることができるモデルを構築するための、これまでで最も明確な試みである。
Atlasができること
World LabsはAtlasをマルチモーダル自己回帰拡散トランスフォーマーと説明する。テキスト、画像、動画、3Dデータを一つの空間フレームワーク内で取り込み、同じ集合全体にわたって生成する単一アーキテクチャだ。出力は動画生成モデルより広範で、カメラ制御された画像と、約1分のクリップ向けの最大1440p動画に加え、新規視点、深度マップ、点群、3Dガウススプラットを生成する。
このモデルをテキスト・トゥ・ビデオモデルから分かつのは、ボリューメトリックな出力だ。動画生成モデルは次のフレームを予測する。空間内で何がどこにあるか、カメラが一度も占めなかった角度からシーンがどう見えるかを必ずしも知っているわけではない。Atlasは内部に3D表現を保持するため、視聴者がその中を移動しても環境は一体性を保つ。もっともらしいクリップと、移動可能な空間との違いこそが、これをワールドモデルと呼ぶ所以だ。
疎な入力から、デモによってはスマホ映像の数フレームだけで、このモデルは仮想カメラを内部に置けるほどシーンを再構成する。World Labsは、疎視点再構成誤差が25.3で、最良の専門モデルの28.7を下回ると報告している。同社が委託したブラインド評価では、人間の評価者は、要求されたカメラ移動へのAtlasの忠実さを、MiniMax H3より75%、Gemini Omni Flashより81%、Seedance 2.5より94%の割合で好んだ。
これらは同社が実施した評価による同社自身の数値であり、この点は率直に言っておく価値がある。Atlasはアーリーアクセス中で、パートナー群の外部の誰もまだこれらを再現できない。
Real-to-simと、ロボットが注目する理由
明らかな商用用途は、視覚効果、ゲーム、バーチャルプロダクションだ。映画製作者は撮影後にショットを組み立て直せる。しかしWorld Labsが前面に押し出す枠組みはロボティクスである。
そのワークフローはreal-to-simと呼ばれる。実空間の動画を撮影すると、Atlasがそれを3Dシミュレーションに変換し、実物を運用するコストとリスクなしにロボットを訓練またはテストできる。倉庫の通路の1,000種類のバリエーションが欲しいロボティクスチームは、通路を一度スキャンし、それぞれを撮影する代わりにバリエーションを生成できる。
これは狭いが本物のペインポイントだ。ロボット向け訓練データは、収集するにはロボットを動かす必要があるため高価だ。シミュレーションは安価だが、通常は誰かが手作業で環境を構築する必要があり、遅く、しばしば実地とは似ても似つかない。実在する部屋をシミュレーションファイルに変えるモデルは、二つの高価な工程を一つに畳み込む。NvidiaとAMDが投資家である理由もそこにある。両社は、訓練とシミュレーションが動作するコンピュートを販売している。
情報開示の問題
野望と証拠の記録の間には隔たりがある。World LabsはAtlasとともに、研究論文もモデルカードも、パラメータ数も訓練コンピュートの数値も公表していない。価格も一般提供日も開示していない。十分に文書化された競合他社に対して比較上の主張を行うシステムにしては、この欠落は異例であり、ブラインド評価の結果を検証不能にしている。
懐疑派はより鋭い問いを投げかけている。Atlasは本当に世界をシミュレートしているのか、それとも説得力のある見え方をレンダリングしているだけなのか。これらは異なる能力であり、その区別は物理に依存するあらゆるユースケースで重要だ。新しい角度から部屋をレンダリングするモデルは、映画には役立つ。ロボットが歩くことを学ぶモデルでは、内部の物体が物体として振る舞う必要がある。さもなければ、ポリシーはモデル内でしか通用しない何かを学んでしまう。
World Labsは、Atlasが既存製品Marbleの将来バージョンを支えると述べている。それにより商業的な居場所が与えられ、これはほとんどの研究発表が持つ以上のものだ。幾何がキュレーションされたデモを超えて持ちこたえるかどうかは、アーリーアクセスのパートナーが最初に知ることになる。
中国の対応製品
都市規模の野望を持つワールドモデルはAtlasだけではない。9月10日、中国の地図会社AmapはABot-Earth 0.7を公開した。同社はこれを世界初の3Dネイティブ都市ワールドモデルと呼ぶ。衛星画像またはテキスト記述を取り込み、歩き回れるインタラクティブな3Dシーンに変える。一つのモデル内で、惑星規模から街路レベルのランドマークまで複数のスケールで生成する。Amapによれば、消費者向けGPU上で約10分でキロメートル規模の3D都市シーンを3Dガウススプラッティング形式で生成でき、その機能はすでに同社のFlight Street View製品で動作しているという。
両者は同じアイデアを反対の端から指し示している。Atlasは数枚の写真から上方へと働き、部屋を高忠実度で再構成する。ABot-Earthは衛星データから下方へと働き、都市を規模に応じて生成する。二つを合わせると、空間モデルがカバーしうる範囲が素描され、同時に二つの市場がどれほど違う形で出荷されるかも示している。一方は公開ベンチマークのないパートナー制度を通じて、もう一方は誰もが出力を見られる消費者製品に組み込まれて出荷される。
空間モデルがまだ証明すべきこと
この分野には勢いがある。MetaのV-JEPA 2は100万時間を超える動画で訓練された。GoogleのGenie 2はインタラクティブな3D環境を生成し、Gemini Roboticsは物理空間における推論と操作に取り組んでいる。幾何と遠近法はテキストから推論されるのではなくモデルにネイティブでなければならないというLi氏の主張は、研究上の立場から製品カテゴリへと移った。
そのどれもが決着させていないのは、首尾一貫した幾何を生成するモデルが、物理空間を理解するモデルと同じものなのかという点だ。再構成は測定可能である。シミュレーションはより難しく、ロボティクスが実際に必要としているのは後者だ。Atlasは前者について強い主張を示している。後者がどれほど伴ってくるかは、今後1年のパートナー成果が決めるだろう。
デザイナーや開発者にとって、短期的な影響はローンチ時の言葉遣いが示唆するより控えめだ。3枚の写真から部屋を再構成し、その中をカメラで飛び回れるツールは本当に有用であり、ロボットに搭載されるより先にクリエイティブソフトウェア内に現れるだろう。空間モデルがほとんどの人に最初に届くのはそういう形だ。シーンをナビゲートする作業ではなく、シーンを作る作業を通じてである。
関連記事
言語と視覚のための一つのフレームワーク:Horizonの16億パラメータオープンモデル
言語と視覚の間の橋はそもそも不要だったという賭け。
フォトニクスでメモリの壁を破る——Volantisが賭けた8800万ドル
誰もが受け入れて生きてきたトレードオフこそ、Volantisが消し去ろうとしているものだ。
アリババ、30Bマルチモーダルをオープンソース化:30億アクティブパラメータでGPT-5-Miniに真っ向勝負
30億アクティブパラメータで、フラッグシップに迫るマルチモーダル能力を実現。
AI商品画像がぶつかる、誰も価格に織り込んでいなかったコンプライアンスの壁
コストは常に生成1回あたりで見積もられてきた。本当のコストは、レビューを通過したアセット1点あたりで決まる。