七所高校联合开源 OpenWAM:机器人要的不只是「看见」,还要「预判下一秒」

十月初,一个由新加坡国立大学、清华大学、北京大学等七所高校研究人员组成的团队,把 OpenWAM 放上了 GitHub 和 Hugging Face。项目定位很明确:面向世界动作模型(World Action Model,WAM)的开源研究全栈,外加一个基座模型。论文已经上 arXiv,编号 2609.07398,仓库到十月一日大约 940 星。
这条消息在国内的传播不算慢,但真正值得多看一眼的地方,是它想解决的那个老问题:机器人光识别出眼前是什么,不够用。
传统仿真器把物理和视觉分开算
过去做机器人策略,常见两条路。一条是直接从机器人示范里同时学视觉规律和控制信号,另一条是先吃图像文本预训练,把语义和语言知识带进来,这就是 VLA 路线。
世界动作模型走了第三条路:先从视频生成预训练里继承「世界会怎么变」的先验,再通过具身经验学「在这个世界里该做什么」。听上去像绕远,但它回避了仿真与真机之间那道老裂缝。传统仿真器的物理和视觉往往各算各的,动作效果和画面观感对不上;OpenWAM 的做法是让模型直接从数据里学「动作如何改变世界」,再据此预测物体位置、场景语义和任务状态。
拆成三层,让实验可复现
团队把问题拆成三层,每一层对应一个组件。
OpenWAM-Infra 是模块化基础设施,把可组合模型、训练运行时、部署运行时和评测协议四层解耦。这一层的作用是把世界动作模型从紧耦合的单一实现,变成可以替换零件的实验台。
OpenWAM-Study 负责沉淀设计规律。它不做模型,做的是受控实验,用一组组对照把「什么样的设计有效」变成可复现的结论。
OpenWAM-α 是基座模型本身,在大规模人类第一视角视频和机器人数据上验证整套方案。
三条设计原则,每条都有对照数字
这类论文最怕全是口号。OpenWAM 给的三条结论都带了对照实验。
第一条,需要足够强的生成式世界先验。14B 视频骨干拿到 93.79%,1.3B 只有 90.14%;默认配置选了 5B,比 14B 只低 1.4 个百分点。配上 DINOv3 与 S-VAE 压缩出的紧凑视觉潜空间,效果接近 Wan2.2 自带的 VAE。
第二条,训练时必须建立明确的世界到动作信息流。让「动作流看见世界流」,准确率 92.39%;改成孤立掩码只有 87.41%,差了整整 5 个百分点。推理时同步联合去噪效果最好。
第三条,数据要分来源用。机器人数据负责保住动作的 grounding,人类第一视角视频负责扩大世界的覆盖面,单阶段协同训练把两者整合。有意思的是,预训练域内提升有限,分布外(OOD)成功率却从 14.50% 提到 26.62%。
基座模型的实际规格
OpenWAM-α 由两部分拼成:Wan2.2-TI2V-5B 当视频流,再挂一个 1B 的动作 DiT。动作空间统一成 80 维,兼容 17 个物理平台。预训练数据 14300 小时,其中人类第一视角占 30%,合成数据 30%,真实数据 40%。

推理速度上,RTX 5090 上单个动作块 170 毫秒。评测覆盖 LIBERO、RoboTwin2.0、RoboDojo 等 8 个仿真基准,形态从单臂、双臂到移动操作和灵巧手。EBench 的移动双臂项目上,它目前是最佳,领先第二名约 4 个百分点。真机验证用 Franka 单臂跑了六个任务,平均成功率 82.5%,高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%,其中两项做到 100%。换成训练时没见过的灵巧手,微调后也全面超过 π0.5。
它没有宣告 VLA 出局
论文里有一段结论值得单独拎出来:WAM 靠未来视频潜变量做监督,在分布内更贴合;VLA 在分布外扰动下更稳健。两者胜负未分。
这句话比「某个范式已死」要诚实得多。读论文的人容易只记住分数,其实更该记住的是这句:两条路线现在各有所长,还没有到可以一锤定音的时候。
门槛被压低了一档
放在更大的背景里看,世界模型这条线上,谷歌的 Gemini Robotics 2 喊出「一个大脑,适用于任何机器人」,英伟达的 Jim Fan 抛出「VLA 已死,世界动作模型当立」。十月三日,英伟达又扩展了开放物理 AI 栈,把 Cosmos 世界模型、Isaac Lab Arena、自动驾驶的 Alpamayo、编排工具 OSMO 和 OpenUSD 库一起放出,Caterpillar、LEM Surgical、Neura Robotics 都成了首批使用者。十月四日,浙江杭州云深处科技的多台人形机器人走上街头,测试路口交通指挥和游客咨询,雨天也在跑。
在这样的密度下,高校把全栈底座开源,等于把方向的门槛压低了一档,也让「用视频学世界、用轨迹学动作」成为更公开的路线。
它不是拿来直接部署的
需要说清楚的是,OpenWAM 定位是研究基础设施,不是开箱即用的产品。官方 README 建议准备约 640GB 训练数据,环境体量约 6.5GB,仓库仍在活跃改动。它适合已有 GPU 和数据、想在此基础上做世界动作模型研究的团队,不适合拿来做小规模落地的场景。
后续值得盯的观察点也很具体:这批复现率有多高,半年之后还有多少人在上面提交改进,以及有没有团队真的把它微调进产品线。发布当天的热度会散去,能留下的是还在被用的那些代码。