Agora-2が示す、ワールドモデルはマルチプレイヤー・マシンであるという主張

Odysseyは9月25日にAgora-2を公開し、しばらく噛みしめる価値のある一言でそれを説明した。学習型ゲームエンジン。たまたま入力を受け付ける動画生成器ではない。共有空間にいる全員の行動が、その空間の状態をどう変えるかを予測するエンジンだ。
遊べる研究プレビューが小規模なのは意図的だ。4人の人間対16体のエージェント、合計最大20の参加者を収容する共有環境。これは製品の規模ではない。興味深い問題が現れる最小構成なのだ。
クリップは世界ではない
ほとんどの動画モデルは1つの問いに答える。次のフレームはどう見えるべきか? プロンプトか最初のフレームを与えて待てば、鑑賞できる結果が返ってくる。視聴者が何をしても何も変わらないため、維持すべき状態は存在しない。
ワールドモデルはもっと難しい問いに答えなければならない。現在の状態と、その中にいる全員の行動を踏まえると、状態はどうなるのか? つまり、時間を通じて環境の一貫した表現を保持し、入力が届くたびにリアルタイムで更新する必要がある。シーンを動くのが1人だけなら、この多くを偽装できる。カメラはカメラの行く先へ進み、モデルは1本の経路上で世界を信じられるものに保てばよい。
人を加えると、その幻想は有益な形で崩れる。2人の参加者が相容れないことを望むことがある。片方が、もう片方に必要なドアをふさぐ。片方が投げた物が、3人目の行動を変える場所に落ちる。状態はもはやシーンを通る経路ではない。複数の行為者が同時に書き込む共有オブジェクトであり、モデルは物理エンジンがするようにそれらの書き込みを解決しなければならない。ただしエンジンはない。次の状態を予測するニューラルネットワークがある。

だからこそOdysseyは16体のエージェント対4人の人間という特定のテストを選んだ。エージェントは安価に生成でき、継続的に行動し、人間のテスターなら試そうと思わないことをする。モデルが人間の速度で動く1つの視点からもっともらしく見えるだけなら、小さな群れが数分で継ぎ目を見つけ出す。
学習型エンジンこそが面白い賭け
ビデオゲームは何十年も共有状態をシミュレートしてきた。違いは、その状態がどう生成されるかだ。従来のエンジンには、2つのオブジェクトが衝突したときに何が起きるか、発射物がどう飛ぶか、足元の表面がどう振る舞うかを定義するコードがある。ルールは書かれているため、結果は決定論的で計算も安い。作業の大半は、何が真実かを決めることではなく、コンテンツに注がれる。
学習型エンジンは、ルールを、事例から結果を予測するモデルに置き換える。これによりコスト構造が逆転する。ドアがふさがれたときに何が起きるかを書く必要はもうない。モデルはふさがれたドアを十分に見てきたので推論できる。その代わりに失うのは確実性だ。書かれたエンジンは、存在しない壁を幻覚しない。学習型はそれがあり得るし、共有セッションではその誤りは一人の視聴者の画面にとどまらない。全員が同じ誤った壁を見る。それが共有世界なのか共有バグなのかは、モデルがあなたの望みを推測したかどうかによる。
その上でリアルタイム動作を実現するのが、もう一つの難しい部分だ。次の状態を一度予測するのは研究問題である。コントローラーを持つ4人が推論を待っていると気づかないほど速く予測するのはシステム問題であり、このようなものが製品になるかどうかを決めるのはこれだ。
このプレビューは実際何のためか
デモ動画ではなく遊べるプレビューを出すのは意図的な動きだ。デモは、制作者が選んだ経路上でモデルの最良の姿を見せる。実際の参加者、それもエージェントの群れを含むプレビューは、チームが必要とし、簡単には想像できない失敗事例を生み出す。
また、ベンチマークでは測れないものも試す。ワールドモデルは通常、生成された1分間がどれほど説得力を持って見えるかで評価される。その指標は、誰かが予想外のことをしたときに環境が一貫性を保つか、あるいは状態について意見が食い違う2人の参加者が同じ答えを得るかについては、ほとんど何も語らない。
実験のうちエージェント側の半分は、より多くを明らかにする選択だ。ロボットやソフトウェアエージェントを訓練する機関は、多くの行為者が同時に相互作用する環境を必要としており、その多くを手作業で構築するか、固定されたルールセットを備えたゲームエンジンを再利用している。学習型ワールドモデルはそれを置き換えると約束したが、その約束が意味を持つのは、20人同時の書き込みに耐える場合だけだ。4人の人間が16体のエージェントを導くのは、その問題を実際に観察できるものへと圧縮したものだ。
これがどこに着地するか
学習型ゲームエンジンを、自らを生成するゲームへの一歩と読むのは簡単だ。より近い将来の用途は、華やかさはないが可能性が高い。エージェントの訓練と評価のための環境である。共有状態を保持し、多くの行為者に同時に応答できるワールドモデルは、100体のエージェントを入れてその行動を観察できる環境であり、これはエージェントソフトウェアを構築するチームがまさに必要とし、現在はほとんど手作業で作っているものだ。
Agora-2がインフラになるのか、研究的好奇心にとどまるのかは、このプレビューでは決着しない地味な数値にかかっている。長時間セッションを通じた状態の一貫性、参加者1人あたり1時間のコスト、そして参加者がモデルの見たことのないことをした場合にどれだけ優雅に対処できるか。共有された学習型環境という概念は、今月、論文から遊べるビルドへと移った。それを20人同時の書き込みに耐えるものにするのが、これから1年を要する部分だ。
注意深く見る理由は、動く版が何を置き換えるかにある。今日、豊かな環境に対してエージェントを訓練しようとする人は、遅くて狭いシミュレーターを手作業で作るか、エージェントが驚かせられない固定ルールセットを課すゲームエンジンを借りるかのどちらかだ。学習型エンジンは両方の制約を一度に取り除く。書くべきルールはなく、生じ得る状況に上限もない。状況が作者によって書かれるのではなく生成されるからだ。4対16のプレビューは、それでも意味のある衝突を生み出す、このアイデアの最小のテストであり、始めるのに適した場所だ。
プレビューが露呈するコストもある。20人の参加者に対するリアルタイム予測は、その全員のために推論を継続的に走らせることを意味し、これは今日の動画モデルを手頃にしているバッチ生成とは正反対だ。世界を提供することは、それが生きている限り毎秒コストがかかるが、動画を提供するのは一度だけコストがかかる。学習型環境が何日も続く訓練実行に使われるようになるなら、経済性は桁違いに改善されなければならない。それはモデリングの問題であると同時に、ハードウェアと効率の問題だ。