← 返回博客
Ai预计阅读 10 分钟

Agora-2 力证:世界模型是一台多人机器

发布于 2026年10月3日
Agora-2 力证:世界模型是一台多人机器

Odyssey 于 9 月 25 日发布了 Agora-2,并用一个值得细细琢磨的说法来描述它:一个学习型游戏引擎。它不是一个恰好能接受输入的视频生成器,而是一个能够预测共享空间中每个人的动作如何改变该空间状态的引擎。

这个可玩的研究预览刻意做得很小:四个真人对十六个智能体,处在一个总共最多容纳二十名参与者的共享环境中。这不是产品级的规模,而是让那个真正有趣的问题浮现出来的最小配置。

一段视频片段不等于一个世界

大多数视频模型只回答一个问题:接下来几帧应该长什么样?给它一个提示词或一帧起始画面,然后等待,就能得到一段可供观看的结果。这里没有需要维护的状态,因为观众无论做什么都不会改变任何东西。

世界模型则必须回答一个更难的问题:给定当前状态以及身处其中每个人的动作,状态会变成什么样?这意味着要在时间维度上维持对环境的一致表征,并在输入不断到达时实时更新它。当只有一个人在一个场景中移动时,很多环节都可以糊弄过去:镜头往哪走,模型就只需沿着这一条路径让世界保持可信。

加入更多人后,这种幻觉会以很有用的方式被打破。两个参与者可能想要互相冲突的东西。一个人堵住了另一个人需要的门。一个人扔出的东西落在某处,改变了第三个人能做的事。此时状态不再是一条穿过场景的路径,而是一个被多个行动者同时写入的共享对象,模型必须像物理引擎那样去裁决这些写入——只不过这里并没有引擎,只有一个神经网络在预测下一个状态。

低角度拍摄的一张深色圆桌,数十个发光的小物件定格在运动之中,细细的光线勾勒出它们的轨迹

这就是 Odyssey 选择「四个真人对十六个智能体」这一特定测试的原因。智能体的生成成本很低,它们持续行动,而且会做出人类测试者想不到去尝试的事情。如果模型只在某个以人类速度移动的单一视角下看起来合理,那么一小群智能体会在几分钟内找到那道裂缝。

学习型引擎才是真正值得下注的方向

电子游戏模拟共享状态已有几十年历史,区别在于状态是如何产生的。传统引擎用代码定义两个物体相撞时会发生什么、抛射物如何飞行、脚下的表面是什么质感。规则是写死的,因此结果是确定的,计算成本也很低。大部分工作量花在内容上,而不是花在判定什么是真的上面。

学习型引擎则用从示例中预测结果的模型取代规则,这颠覆了成本结构。你不再需要写下一扇门被堵住时会发生什么,因为模型已经见过足够多被堵住的门,能自己推断出来。你付出的是确定性。写死的引擎不会凭空幻觉出一堵并不存在的墙,学习型引擎却可能,而在共享会话中,这个错误不会只停留在某一个观众的屏幕上。所有人看到的是同一堵错误的墙——它究竟是一个共享的世界,还是一个共享的 bug,取决于模型猜的恰好是不是你想要的。

在此之上还要实现实时行为,是另一个难点。预测一次下一个状态是研究问题;要预测得足够快,让四个拿着手柄的人察觉不到自己在等推理结果,则是系统工程问题——而正是这个问题决定了这类东西能否成为产品。

这个预览究竟是用来做什么的

发布一个可玩的预览版而不是一段演示视频,是刻意的选择。演示视频展示的是模型在创作者选定路径上的最佳表现。而带着真实参与者(包括一群智能体)的预览,会产生团队需要却难以凭空想象的失败案例。

它同时也在检验基准测试无法衡量的东西。世界模型通常按生成的一分钟画面有多逼真来评判,而这个指标几乎说明不了当有人做出意外举动时环境是否仍然连贯,也说明不了两个对状态各执一词的参与者是否会得到同一个答案。

实验中的智能体那一半是更具揭示性的选择。训练机器人和软件智能体的机构需要能让众多行动者同时交互的环境,而它们大多靠手工搭建,或者复用规则集固定的游戏引擎。学习型世界模型承诺取代这一切,而只有当它能在二十个同时写入者面前站得住脚,这个承诺才算数。四个真人指挥十六个智能体,就是把这个问题压缩成一件你真的可以围观的事情。

这件事最终会落在哪里

把学习型游戏引擎解读为通往自我生成游戏的一步,是很容易的。但更近期的用途没那么光鲜,却更有可能:用于训练和评估智能体的环境。一个能维持共享状态并同时对众多行动者做出响应的世界模型,就是一个可以放进去一百个智能体并观察它们行为的环境——这正是构建智能体软件的团队所需要的,而目前他们大多只能手工搭建。

Agora-2 会成为基础设施还是研究趣闻,取决于那些预览版无法解答的无聊数字:长会话中的状态一致性、每位参与者每小时的成本,以及当参与者做出模型从未见过的事情时它处理得有多从容。「共享的、可学习的环境」这个概念,这个月从论文变成了可玩的构建版本。而让它能在二十个同时写入者面前站得住脚,才是接下来一年要做的事。

值得密切关注它的理由,在于一个可用的版本会取代什么。如今,任何要针对丰富环境训练智能体的人,要么手工搭建模拟器——缓慢且狭窄,要么借用游戏引擎——它强加一套固定规则,使智能体无法带来意外。学习型引擎一举移除这两重约束:没有规则要写,也没有情境的上限,因为情境是生成出来的,而不是编写出来的。四对十六的预览,是这个想法仍能产生有意义冲突的最小测试,也正是合适的起点。

这个预览还暴露出一个代价。为二十名参与者做实时预测,意味着要为每一个人持续不断地运行推理,而这与当今让视频模型变得可负担的批量生成正好相反。运行一个世界,每存活一秒都在花钱;而生成一段视频,只需付一次钱。如果学习型环境要被用于持续数天的训练任务,其经济性必须改善若干个数量级——而这既是建模问题,同样也是硬件与效率问题。

相关文章