← ブログに戻る
Ai読了目安 15 分

RunwayのPraxis-1への賭け——ロボットの頭脳への近道としての動画事前学習

公開日 2026年10月2日
RunwayのPraxis-1への賭け——ロボットの頭脳への近道としての動画事前学習

本格的な実用化を目指すあらゆるロボティクスプログラムが、同じ壁にぶつかる。それはハードウェアの壁ではない。実世界のデータは乏しく、汎用ポリシーが必要とする量を収集しようとすればコストがかさむ。自動運転、家庭用ロボティクス、雑然とした環境での倉庫作業など、エッジケースだらけの領域では、実際に起きることを扱えるモデルを訓練するのに必要なデモンストレーションを集める現実的な方法が存在しない。

Runwayは9月30日にPraxis-1を発表した。その主張はこの壁から始まる。Praxis-1は、Runwayの大規模な動画事前学習を実機ロボット向けの制御ポリシーに変換するオープンウェイトのワールドアクションモデルだ。同社は初期パートナーのNoble Machines、Standard Bots、Ultraとともに検証を進めており、各社が自社ハードウェアでモデルを動かしている。今後数カ月のうちにオープンウェイトでの一般公開が予定されている。

テレオペレーションの代替としての動画

前提は口にしてみれば明快だ。動画は事実上無限にあり、生成モデルが品質と速度で実写に並びつつあることで、その量はさらに増えている。ロボティクス研究室が遠隔操作のデモンストレーションで集められる量よりも、人々が日々撮影してアップロードする日常生活の映像のほうが多い。モデルがその映像から物理世界の構造を学習できるなら、ボトルネックは乏しいロボットデータから、潤沢な一般動画へと移る。

この主張に重みを与えるのは実証データだ。Runwayによれば、自社のワールドモデル内でロボットポリシーをシミュレーションすると、実世界の結果を0.95の相関で予測でき、より高コストな3D再構成ベースの手法と比べても見劣りしない。忠実なテスト環境として使えるワールドモデルは、ポリシー開発の経済性を変える。なぜなら、反復のたびに実機ハードウェアを用意しなくても評価ができるようになるからだ。

同社はまた、三人称視点の動画の規模が大きくなるにつれてポリシーの性能が向上することも見出し、有能なポリシーのボトルネックはモデルが学習できる一般動画の量であるという結論を導いている。これは言語モデルを駆動したのと同じスケーリングの議論を、運動制御に当てはめたものだ。動画事前学習によって物理的なもっともらしさや物体の振る舞いをすでに理解しているポリシーは、行動データのみから構築されたものよりはるかに有利な地点からスタートする。

賭けを支えるアーキテクチャ

Praxis-1は、Runwayの汎用ワールドモデルや、SolarisやGWM Worldsシリーズといったインタラクティブなリアルタイム作品を生み出したのと同じ動画事前学習の上に構築されている。この系譜の論理は重要だ。物体がどう振る舞うか、手がどう動くか、タスクが途中でどんな見え方をするかをモデルに教えることで、デジタルと物理の両方の環境でエージェントを訓練するための動的な環境が生まれる。

Runwayはこれを複利的な優位性として位置づける。モデルが動画から世界の仕組みを理解すればするほど、訓練で見たことのない環境でもロボットをうまく制御できるようになる。掲げられた目標は、特定のアームやグリッパーにチューニングされたポリシーではなく、あらゆる身体性や環境で機能する、ロボティクス開発者・研究者向けの汎用ポリシーモデルだ。

その野心こそが、懐疑的な読み方の入り口になる。「あらゆる身体性で機能する」は強い主張であり、現時点で示されているエビデンスは、広範なローンチを前に、名前の挙がった3社のパートナーが自社ハードウェアでモデルを動かしているというものにとどまる。0.95という相関値は、Runwayのワールドモデル内のシミュレーションと実世界の結果の間で測定されたものであり、ポリシーと同程度にシミュレータの妥当性を証明するものでもある。どちらも有用だが、どちらもこの段階ではRunway自身の数字だ。

なぜオープンウェイトなのか、そしてそれがなぜ戦略的議論なのか

RunwayはPraxis-1をクローズドモデルではなくオープンウェイトで提供する。ほとんどのモデルをプロプライエタリに保ってきた企業としては珍しく、その理由は異例なほど明示されている。発表ではこれをフィジカルAIにおける米国の競争力の問題として位置づけている。製造業でのリーダーシップを取り戻し、生産性を加速し、同盟国を確保するには、Runwayの言葉を借りれば、米国のモデルに、フィジカルなユースケース向けには現在存在しないレベルの相互運用性とオープン性が必要だというのだ。

これは政策色の強い主張であり、AIスタックのどこまでをオープンにすべきかという活発な議論のまっただ中に飛び込んでくる。特にロボティクスにおいては、オープンウェイトを支持する根拠は最先端の言語モデルよりも強い。ハードウェア開発者は自社のセンサーとアクチュエータを備えた自社マシン上でポリシーを動かす必要があり、それらの信号を外部に送ることを前提とするクラウドAPIは適合しにくい。オープンなワールドモデルは、ホスト型モデルでは得られない柔軟性と制御をハードウェアメーカーに与える。

発表が明言していない競争上の側面もある。オープンウェイトの動画・ワールドモデルの勢いの多くは中国のラボから生まれている。同じカテゴリーでオープンウェイトを提供する著名な米国企業の動きは、他の誰かがそうする前にエコシステムの重心を定義しようとする試みとして、部分的に読める。

0.95という相関は強い数字であり、それを言い換える価値がある。つまり、Runwayが候補となるポリシーをワールドモデル内で実行し、その性能を測定したとき、実機ロボットもほぼ同じように動作するということだ。これがタスクをまたいで成り立つなら、実務上の帰結は、ロボティクスチームが実験の大部分をシミュレーションで回し、実機ハードウェアは最終確認のために取っておけるということになる。実機での試行がどれほど高コストで遅いかを考えれば、これは1週間で100回の反復を回すことと、1カ月で数回しか回せないことの違いに等しい。

より難しい問いは汎化だ。動画はモデルに世界がどう見えるか、物体がどう振る舞う傾向があるかを教えるが、ロボットは特定のアームで、特定のタスクを、特定の失敗許容度でどう遂行するかも知る必要がある。Runwayの主張は、動画で訓練された事前分布が、そこに到達するために必要なタスク固有データの量を減らすというものだ。もっともらしいが、スケールでの証明はまだない。

より広いロボティクス競争の中での位置づけ

Praxis-1が登場したのは、ヒューマノイドと製造業向けロボティクスがデモから実装へと移行した年だ。Figureは引退したヒューマノイドを極限タスク向けに訓練してきた。ヒューマノイドメーカーは自動車メーカーと工場でのパイロット導入を締結し、Boston DynamicsはHyundaiの施設内でAtlasロボットの試験を始め、2030年までの大規模展開を計画している。共通するのは、能力がそれを支えるデータパイプラインよりも速く向上しているという点だ。

Runwayの貢献は、データパイプラインの問題には近道があり、その近道は動画を通ると主張することにある。シミュレーションと実機の結果の相関がパートナーやタスクをまたいで維持されるなら、実務上の効果は、ロボティクスチームがワールドモデル内で反復し、物理テストは最終検証のために取っておき、それ自体が増え続けるカテゴリーのデータから学べるようになることだ。

それは意味のある主張であり、同時に証明されていない主張でもある。同社は選定されたパートナーにローンチ前のアクセスを提供し、研究者には自社ハードウェアで試すよう呼びかけている。重要なエビデンスは、Runwayの社内作業から出た相関値ではない。独立したラボがその結果を再現できるか、そして主に三人称のインターネット動画で訓練されたポリシーが、一度も行ったことのない部屋で、一度も見たことのないタスクを扱えるかどうかだ。それこそが、動画事前学習がロボットの頭脳のデフォルトの基盤になるのか、それとも興味深い研究テーマにとどまるのかを決めるテストである。

関連記事