← ブログに戻る
Ai読了目安 14 分

1枚の写真から歩き回れる世界へ:InSpatio-World 1.5が画像を空間に変える

公開日 2026年10月3日
1枚の写真から歩き回れる世界へ:InSpatio-World 1.5が画像を空間に変える

ほとんどの画像・動画モデルが返すのは、固定されたフレームか固定されたクリップだ。見る側は、モデルが見せると決めたものを見ることになる。中国の企業InSpatioは今月、1枚の写真、パノラマ、あるいは既存の動画を、移動して回れる空間に変えるモデルを公開した。

InSpatio-World 1.5は9月下旬、上海国際映像芸術カーニバルで公開され、同社はコードをApache 2.0の下でオープンソース化した。何が違うのかを最も明確に説明しているのはデモ動画だ。それは中国の宮殿の回廊の内部から始まる。カメラは前方へ進み、手すりと階段を通過し、中庭へと抜ける。柱の陰に隠れていた建物が、視点の移動とともに姿を現す。このモデルが生み出したのは、選ばれたカメラ経路を持つクリップではなく、探索を続ける限りレンダリングされ続ける空間である。

明るい光の扉へと遠ざかる、霧のかかった石柱の回廊

このバージョンで変わった3つのこと

第一は、モデルが入力として受け取るものだ。以前のワールドモデルは主に単一の画像を求めた。バージョン1.5は、単一画像、画像セット、パノラマ、動画を受け取る。これが重要なのは、入口を左右するからだ。1枚の写真はコンシューマー向けの出発点だ。複数画像のセットや既存の動画は、映画や広告のチームがすでに手元に持っているものであり、それらを受け入れることで使える人の幅が広がる。

第二はリアルタイムの探索だ。生成された空間に入ったあと、視点を動かし続け、遮蔽物の周りを回り込み、最初のフレームにはなかった領域にまで到達できる。視点が変わるたびに、モデルはそれまで見えなかった部分を補い、すでに見たものと矛盾しない形で描き出す必要がある。これは気持ちのよいクリップを生成するより難しい問題だ。モデルには、一連の画像ではなく、ある場所についての心的モデルを維持することが求められるからだ。

第三は時空間的一貫性であり、これこそがワールドモデルと動画生成器を分ける本当の境界線だ。カメラが部屋を出て戻ってきたとき、部屋の配置が変わっていてはならない。InSpatioは、より長い探索経路とより複雑なシーンを支えるために1.5でこれを強化したと述べており、デモは新たな角度から同じ領域を繰り返し訪れることでその主張を裏付けている。

デモを支える数字

InSpatioはモデルをコンパクトと表現し、パラメータ数は13億、WorldScore-Dynamicで68.72のスコアを記録し、評価されたリアルタイム対話型手法の中で首位だとしている。最大毎秒24フレームだ。これらは同社自身の数値であり、独立した再現はまだ乏しいため、確定した結果ではなく出発点として受け止めるべきだ。

技術的なアプローチには、名前を挙げておく価値のある要素がいくつかある。動画入力に対しては、パイプラインがDepth Anything 3を使って欠落した深度とフレームごとのカメラ内部・外部パラメータを推定する。これにより、3Dキャプチャとして撮影されていない映像からシーンを再構成できる。時空間自己回帰プロセスが、視点が変わっても世界の状態を持続させ、毎回シーンをゼロから再生成しないようにしている。

歩き回れるシーンが価値を生む場面

最も直接的な用途はデモが示しているものだ。映画や広告では、通常カメラ位置は撮影した瞬間に固定される。別のアングルが欲しければ撮り直しになり、撮り直しは高くつく。ワールドモデルがあれば、チームは事後にカメラ位置を探し続け、すでに存在する映像からカバレッジを引き出せる。InSpatioは広告のバレットタイムを直接的な例として挙げている。被写体の周囲にカメラリグを同期させる代わりに、一連の画像を入力し、同じ被写体の周りに新しいカメラ経路を設計するのだ。

第二の用途はロボット向けの学習データだ。身体性AIの課題のひとつは、インターネット上にある動画のほとんどが三人称で撮影されている一方、ロボットは世界を一人称で見るという点にある。InSpatioによれば、このモデルは作業の三人称映像から、ロボットが知覚するものに近い一人称視点を予測でき、遮蔽関係を変えながら同じプロセスを異なる方向から再観察できる。これが大規模に機能すれば、環境ごとに新たな映像を撮ることなく、入手可能な動画をロボットの学習素材に変える手段になる。

さらに同社は、観光や文化体験、デジタルツインや産業シミュレーションを挙げている。空間のように振る舞う空間が、写真のように見える画像より役立つ領域だ。

勝ち方の定義が異なる、混戦のレース

InSpatioだけがこれを追っているわけではなく、競合するアプローチはワールドモデルが何のためのものかという点でも一致していない。あるラボは映画的な出力を最適化し、単一の物語的なカメラ移動で美しく一貫した1分間の映像を生成する。別のラボは対話性を追求し、自由に動けてシーンが固定経路なしに応答する能力を優先する。第三の陣営はゲームに近く、世界をナビゲート可能な場所としてメモリ上に保持するリアルタイムエンジンを求める。

これらの目標は異なる方向に引っ張り合う。映画的な品質に調整されたワールドモデルは、あらかじめ決められたシーケンスに計算資源を費やし、すべてのフレームを正しく見せることができる。対話性に調整されたものは、ユーザーが次に見るものを何であれレンダリングしなければならず、速度と、任意の移動に耐えるシーンの記憶へと押し出される。InSpatio-World 1.5は明らかに対話型の陣営にあり、13億パラメータという小さなモデルを選んだことは、リアルタイム性を保つことが静止画の美しさ競争に勝つより重要だという賭けである。

購入検討者にとって重要な比較は、他のナビゲート可能なシステムとの比較だが、この分野はまだ初期段階で、ほとんどの主張は自己申告だ。WorldScore-Dynamicのようなベンチマークは、動き回っても世界が一貫しているかという捉えどころのない部分を数値化しようとするが、ベンチマークは設計者が測ろうと選んだものしか測らない。長い探索を通じた一貫性、元の写真への忠実さ、フレームレートは互いに相反し、どのシステムも異なるトレードオフを選ぶだろう。

だからこそオープンリリースを注視する価値がある。数十人の研究者が自分たちの入力でモデルをストレステストすれば、どこで持ちこたえどこで壊れるかの全体像は、ローンチデモよりはるかに有用であり、競合するハイライトリールではなく共通の土台で、残りの分野がアプローチを比較できるようになる。

オープンソース化が戦略であり、ただの配布ではない理由

InSpatioはモデルとともにコードを公開し、招待テスト向けに新しいTopos-Pro 1.0を予告している。その理由は空間知能分野で共通して見られるものだ。有用な用途は映画、観光、ロボティクス、デジタルツインに散らばっており、一社ですべてをカバーすることはできない。基盤能力を公開することで、研究者は限界を検証でき、パートナーはその上に垂直レイヤーを築ける。建物全体ではなく、土台になるという戦略だ。

リスクは初期のオープンリリースにつきものだ。デモは印象的で、ベンチマークは自己申告であり、管理されたデモと、乱雑な実世界の入力で耐えるツールとの間の差はしばしば大きい。今後数か月、独立した研究者やクリエイターがコードを手にすることで、約束のどの部分が他人のデータとの接触に耐えるかが明らかになるだろう。

関連記事