← 返回部落格
Ai預計閱讀 10 分鐘

Agora-2 力證世界模型就是一台多人機器

發布於 2026年10月3日
Agora-2 力證世界模型就是一台多人機器

Odyssey 於 9 月 25 日發布 Agora-2,並用一個值得細細咀嚼的說法描述它:學習而成的遊戲引擎。不是那種剛好能接受輸入的影片生成器,而是一套能預測共享空間中每個人的動作如何改變該空間狀態的引擎。

這個可遊玩的研究預覽刻意做得小。四名人類對上十六個代理,共用一個最多容納二十名參與者的環境。這不是產品規模,而是那個有趣問題會浮現出來的最小配置。

一段影片不等於一個世界

大多數影片模型只回答一個問題:接下來幾格畫面該長什麼樣子?餵給它一段提示或一張首格畫面,等一會兒,就得到一段能觀看的結果。這裡沒有需要維護的狀態,因為觀眾做什麼都不會改變任何事。

世界模型則必須回答一個更難的問題:給定當前狀態以及其中每個人的動作,狀態會變成什麼?這意味著要隨時間維持環境的一致表徵,並在輸入抵達時即時更新。當只有一個人在場景中移動時,這一切有很多可以作假。攝影機走到哪就是哪,模型只需沿著單一路徑維持世界的可信度。

加入更多人會以有用的方式打破這層假象。兩名參與者可能想要互相衝突的東西。一個人擋住另一個人需要的門。一個人丟出東西,落在某個位置,改變了第三個人能做的事。狀態不再是一條穿越場景的路徑,而是多個行為者同時寫入的共享物件;模型必須像物理引擎那樣解決這些寫入衝突,只不過這裡沒有引擎,只有一個預測下一個狀態的神經網路。

A dark round table seen from a low angle, dozens of small glowing pieces caught mid-motion with thin lines of light tracing their paths

這正是 Odyssey 選擇十六個代理對四名人類這項特定測試的原因。代理的生成成本低廉,會持續行動,而且會做出人類測試者想都想不到要嘗試的事。如果模型只從單一視角、以人類步調移動時看起來還算合理,一小群代理幾分鐘內就會找到破綻。

學習而成的引擎才是有意思的賭注

電子遊戲模擬共享狀態已有數十年歷史,差別在於狀態是如何產生的。傳統引擎用程式碼定義兩個物件碰撞時會發生什麼、拋射物如何行進、腳下的表面有什麼反應。規則是被寫死的,所以結果具確定性、運算成本低廉。大部分功夫都花在內容上,而不是花在判定什麼為真。

學習而成的引擎則以一個從範例預測結果的模型取代規則,這翻轉了成本結構。你不再需要寫下門被擋住時會怎樣,因為模型看過足夠多被擋住的門,足以推斷出來。你放棄的是確定性。寫死的引擎不會幻想出一道不存在的牆;學習而成的引擎卻可能如此,而且在共享的場次裡,這個錯誤不會只留在某個觀眾的螢幕上。每個人都會看到同一道錯誤的牆——這究竟是一個共享世界,還是一個共享的 bug,取決於模型有沒有猜中你想要的東西。

在此之上還要做到即時,是另一個難題。預測一次下一個狀態是研究問題;要預測得夠快,快到四名拿著控制器的人察覺不出自己正在等推論完成,則是系統問題,而正是這個問題決定了這類東西能否變成產品。

這個預覽真正的用途

推出可遊玩的預覽而非示範影片,是刻意的選擇。示範影片展示的是模型在創作者選定的路徑上最亮眼的表現;而一個有真實參與者(包括一群代理)的預覽,則會產生團隊需要、卻不易憑空想像的失敗案例。

它同時也測試了基準測試無法衡量的東西。世界模型通常以生成的一分鐘畫面有多逼真來評判,但這項指標幾乎無法說明:當有人做出意料之外的事時,環境是否仍保持一致;或者當兩名參與者對狀態的認知不一致時,是否會得到相同的答案。

實驗中代理的那一半,是更具揭示性的選擇。訓練機器人與軟體代理的機構需要能讓眾多行為者同時互動的環境,而他們多半是手工打造,或沿用規則固定的一套遊戲引擎。學習而成的世界模型承諾要取代這一切,而這個承諾只有在能承受二十個同時寫入者時才算數。四名人類指揮十六個代理,就是把那個問題壓縮成某種你真的可以觀看的東西。

這一切會落在哪裡

很容易把學習而成的遊戲引擎解讀成邁向自我生成遊戲的一步。但更近期的用途沒那麼光鮮,也更可能成真:用來訓練與評估代理的環境。一個能維持共享狀態、同時回應眾多行為者的世界模型,就是一個你可以放進上百個代理、觀察它們行為的環境——這正是打造代理軟體的團隊所需、而目前多半靠手工打造的玩意。

Agora-2 會成為基礎設施還是研究上的新奇玩意,取決於這個預覽並未解答的無聊數字:長時間場次中的狀態一致性、每位參與者每小時的成本,以及當參與者做出模型從未見過的事時,它處理得有多優雅。共享、學習而成的環境這個概念,在這個月從論文走到了可遊玩的版本。讓它承受得住二十個同時寫入者,才是接下來一年要處理的部分。

值得密切關注它的原因,在於一個能運作的版本將會取代什麼。今天,任何想讓代理在豐富環境中訓練的人,不是手工打造一個緩慢又狹隘的模擬器,就是借用一套遊戲引擎,而後者強加了固定的規則集,代理無法帶來意外。學習而成的引擎一次解除了這兩項限制:沒有規則要寫,能出現的情境也沒有上限,因為情境是生成出來的,而不是撰寫出來的。四對十六的預覽,是這個想法仍能產生有意義衝突的最小測試,也正是起步的正確位置。

這個預覽也暴露了一項成本。為二十名參與者做即時預測,意味著要為每一個人持續不斷地跑推論,而這與讓今日影片模型得以負擔的批次生成恰恰相反。運行一個世界,每存活一秒都在花錢;而生成一段影片只需付一次錢。如果學習而成的環境要用於為期數天的訓練,經濟效益必須改善好幾個數量級,而這既是建模問題,也同樣是硬體與效率問題。

相關文章