七大学が共同でOpenWAMをオープンソース化:ロボットに必要なのは「見る」ことだけでなく「次の一秒を予測する」こと

10月初、シンガポール国立大学、清華大学、北京大学など七つの大学の研究者からなるチームが、OpenWAMをGitHubとHugging Faceで公開した。プロジェクトの位置づけは明確で、World Action Model(WAM、世界行動モデル)に向けたオープンソースの研究フルスタックと、そのベースモデルだ。論文はすでにarXivに掲載されており、番号は2609.07398、リポジトリは10月1日時点で約940スターを集めている。
このニュースの国内での広がりは決して遅くはないが、本当に注目すべきは、それが解決しようとしている古くからの問題だ。ロボットが目の前にあるものを認識するだけでは足りない、ということである。
従来のシミュレータは物理と視覚を別々に計算する
これまでロボット戦略を構築する際には、よく二つの道があった。一つはロボットのデモンストレーションから視覚的規則性と制御信号を同時に直接学ぶ方法、もう一つは画像・テキストの事前学習を先に行い、意味論と言語知識を持ち込む方法で、これがVLA路線だ。
世界行動モデルは第三の道を進む。まず動画生成の事前学習から「世界がどう変わるか」という事前分布を受け継ぎ、次に身体性の経験を通じて「この世界で何をすべきか」を学ぶ。遠回りに見えるが、シミュレーションと実機の間にあるあの古い亀裂を回避している。従来のシミュレータでは物理と視覚がそれぞれ別々に計算されがちで、動作の効果と映像の見え方が一致しない。OpenWAMのアプローチは、モデルにデータから直接「動作が世界をどう変えるか」を学ばせ、それに基づいて物体の位置、シーンの意味、タスクの状態を予測する。
三層に分解し、実験を再現可能にする
チームは問題を三つの層に分解し、各層に一つのコンポーネントを対応させた。
OpenWAM-Infraはモジュール式の基盤で、組み合わせ可能なモデル、学習ランタイム、デプロイランタイム、評価プロトコルの四層を分離している。この層の役割は、世界行動モデルを密結合した単一実装から、部品を差し替えられる実験台に変えることだ。
OpenWAM-Studyは設計上の法則の蓄積を担う。モデルを作るのではなく、対照実験を行い、「どんな設計が有効か」を一連の比較によって再現可能な結論に変える。
OpenWAM-αはベースモデルそのもので、大規模な一人称視点の人間動画とロボットデータで一連の手法を検証する。
三つの設計原則、いずれにも比較数値がある
こうした論文で最も避けたいのは、スローガンだけが並ぶことだ。OpenWAMが示した三つの結論には、いずれも対照実験が付いている。
第一に、十分に強力な生成的世界の事前分布が必要だ。14Bの動画バックボーンは93.79%を記録し、1.3Bは90.14%にとどまった。デフォルト構成では5Bを選び、14Bと比べてわずか1.4ポイント低いだけだ。DINOv3とS-VAEで圧縮したコンパクトな視覚潜在空間を組み合わせると、効果はWan2.2標準搭載のVAEに近づく。
第二に、学習時には明確な世界から行動への情報フローを確立する必要がある。「行動ストリームが世界ストリームを見る」ようにすると、精度は92.39%、孤立マスクに変えると87.41%しかなく、ちょうど5ポイントの差がつく。推論時は同期した共同デノイズが最も良い結果となる。
第三に、データは出所ごとに使い分ける必要がある。ロボットデータは行動のグラウンディングを保つ役割を担い、一人称視点の人間動画は世界のカバレッジを広げる役割を担い、単一ステージの協調学習が両者を統合する。興味深いのは、事前学習ドメイン内での向上は限定的だが、分布外(OOD)の成功率は14.50%から26.62%へと上がったことだ。
ベースモデルの実際の仕様
OpenWAM-αは二つの部分から成る。Wan2.2-TI2V-5Bを動画ストリームとして、さらに1Bの行動DiTを接続する。行動空間は80次元に統一され、17の物理プラットフォームに対応する。事前学習データは14,300時間で、うち一人称視点の人間動画が30%、合成データが30%、実データが40%を占める。

推論速度では、RTX 5090上で単一の行動ブロックが170ミリ秒。評価はLIBERO、RoboTwin2.0、RoboDojoなど8つのシミュレーションベンチマークをカバーし、形態は単腕、双腕から移動操作、器用な手まで及ぶ。EBenchの移動双腕項目では現在最高で、2位に約4ポイント差をつけている。実機検証ではFranka単腕で6つのタスクを実行し、平均成功率は82.5%で、LingBot-VAの77.5%とπ0.5の55.0%を上回り、うち2つは100%を達成した。学習時に見たことのない器用な手に変えても、微調整後はπ0.5を全面的に上回る。
それはVLAの敗北を宣言していない
論文には単独で取り上げる価値のある結論がある。WAMは未来の動画潜在変数を監督に用いるため分布内でより適合し、VLAは分布外の撹乱に対してより堅牢だ。両者の勝敗はまだついていない。
この一文は「あるパラダイムは死んだ」というよりはるかに誠実だ。論文を読む人はスコアだけを覚えがちだが、本当に覚えるべきなのはこの一文だ。二つの路線は今それぞれに長所があり、決着をつけられる段階にはまだ至っていない。
ハードルが一段下がった
より大きな文脈で見ると、世界モデルという路線では、GoogleのGemini Robotics 2が「一つの脳で、あらゆるロボットに」と唱え、NVIDIAのJim Fanが「VLAは死んだ、世界行動モデルの時代だ」と投げかけた。10月3日、NVIDIAはさらにオープン物理AIスタックを拡張し、Cosmos世界モデル、Isaac Lab Arena、自動運転向けのAlpamayo、オーケストレーションツールのOSMO、OpenUSDライブラリをまとめて公開し、Caterpillar、LEM Surgical、Neura Roboticsが最初の利用者となった。10月4日には、浙江省杭州市のDEEP Robotics(雲深処科技)の複数の人型ロボットが街頭に出て、交差点の交通整理と観光客への案内をテストし、雨天でも稼働した。
これほどの密度の中で、大学がフルスタックの基盤をオープンソース化したことは、この方向のハードルを一段下げることに等しく、「動画で世界を学び、軌跡で行動を学ぶ」ことをよりオープンな路線にした。
そのままデプロイするためのものではない
はっきりさせておくべきは、OpenWAMは研究基盤として位置づけられており、すぐに使える製品ではないということだ。公式READMEでは約640GBの学習データを用意することが推奨されており、環境のサイズは約6.5GB、リポジトリは今も活発に変更が続いている。すでにGPUとデータがあり、それを基に世界行動モデルの研究をしたいチームに適しており、小規模な実運用のために使う場面には向かない。
今後注目すべき観察ポイントも具体的だ。この再現率がどれほど高いのか、半年後にどれだけの人がこれに改良をコミットしているのか、そして本当に製品ラインに組み込むために微調整したチームがあるのか。公開当日の熱気はやがて消えるが、残るのは今も使われているコードだ。
関連記事
連邦判事、Flockのナンバープレートネットワークを「無差別な大量監視」と評す
車の1回の目撃から分かることはほとんどない。多くの機関から集約された1か月分の目撃情報は、人生を明らかにする。
米連邦検察、3億ドル相当のNvidiaサーバーがマレーシア経由で中国に渡ったと主張
執行事件は流れを止めるというより測っている。政策が解決していないのは通過ルートの部分だ。
SupabaseがTursoを買収、エージェントはタスクごとにデータベースを必要とするため
エージェントごとに1つのデータベースは、最小のストレージ単位がセッショントークンのように配布できるほど安価になって初めて意味を持つ。
俳優たちはデジタル複製を規制する契約を手に入れた。難しいのは執行の部分だ。
契約はデジタル複製とは何かを定義できる。それが同意なく作られたと証明することは、また別の問題だ。