← 返回博客
Ai预计阅读 10 分钟

Runway 的 Praxis-1 押注:视频预训练是通往机器人大脑的捷径

发布于 2026年10月2日
Runway 的 Praxis-1 押注:视频预训练是通往机器人大脑的捷径

每一个有认真部署抱负的机器人项目都会撞上同一堵墙,而这并不是硬件之墙。现实世界数据稀缺,且要以通用策略所需的规模来收集,成本高昂。对于充满边缘情况的领域,包括自动驾驶、家用机器人以及混乱环境中的仓库作业,都没有切实可行的办法来收集训练模型所需的演示数据,使模型能够应对实际会发生的情况。

Runway 于 9 月 30 日发布了 Praxis-1,其论点正是从这堵墙开始。Praxis-1 是一个开放权重世界动作模型,将 Runway 的大规模视频预训练转化为真实机器人的控制策略。该公司正与早期合作伙伴 Noble Machines、Standard Bots 和 Ultra 进行测试,每家都在自己的硬件上运行该模型,并计划在未来几个月以开放权重形式公开发布。

视频作为遥操作的替代品

这个前提一旦说出来就很直接。视频实际上是无限的,而且随着生成模型在质量和速度上达到真实素材的水平,它正变得更加无限。人们每天拍摄并上传的日常生活内容,比任何机器人实验室能通过遥操作演示采集到的都要多。如果模型能从这些素材中学习物理世界的结构,那么瓶颈就从稀缺的机器人数据转移到了丰富的通用视频上。

让这一论点有分量的,是实证。Runway 报告称,在其世界模型中模拟机器人策略,能以 0.95 的相关性预测真实世界结果,优于更昂贵的基于 3D 重建的技术。一个可作为可靠测试环境使用的世界模型,改变了策略开发的经济账,因为评估不再需要每一次迭代都用物理硬件。

该公司还发现,随着第三人称视频规模增加,策略性能会提升,并由此得出结论:一个有能力策略的瓶颈,变成了模型能训练多少通用视频。这与推动语言模型的扩展论证相同,只是应用到了运动控制上。一个通过视频预训练已经理解物理合理性和物体行为的策略,其起点远比仅从动作数据构建的策略要强。

押注背后的架构

Praxis-1 建立在与 Runway 的通用世界模型以及 Solaris 和 GWM Worlds 系列等交互式实时作品相同的视频预训练之上。这种传承的逻辑很重要。教模型物体如何运动、手如何移动,以及任务进行到一半时是什么样子,会为在数字和物理环境中训练智能体创造动态环境。

Runway 将此描述为一种复利式优势。模型从视频中越了解世界如何运作,就越能在与训练中所见不同的环境中控制机器人。其既定目标是为机器人开发者和研究人员提供一个通用策略模型,能跨任何具身形态或环境工作,而不是针对某一条机械臂或某一个夹爪调优的策略。

这种雄心也正是怀疑论解读的切入点。“跨任何具身形态工作”是一个很强的断言,而迄今为止的证据来自三个具名合作伙伴在各自硬件上运行该模型,且尚在更广泛发布之前。0.95 的相关性数字衡量的是 Runway 世界模型内部的模拟与真实世界结果之间的一致性,这既是对模拟器的验证,也是对策略的验证。两者都有用,但在现阶段两者都是 Runway 自己的数字。

为什么开放权重,以及为什么这是一种战略论证

Runway 以开放权重而非闭源模型的形式发布 Praxis-1,而对于一家大多数模型都保持专有的公司来说,其理由异常明确。公告将此框定为美国在物理 AI 领域竞争力的问题:要重夺制造业领导地位、加速生产力并巩固盟友,用 Runway 的话说,将需要美国模型达到一种目前在物理用例中尚不存在的互操作性和开放程度。

这是一个带有政策色彩的论证,而且正好落在关于 AI 技术栈应有多大程度开放的激烈辩论之中。具体到机器人领域,开放权重的理由比前沿语言模型更充分。硬件开发者需要在自己的机器上、用自己的传感器和执行器运行策略,而要求把这些信号发送出去的云端 API 并不合适。开放的世界模型赋予硬件制造商无法从托管模型获得的灵活性和控制力。

公告没有明说的还有一个竞争维度。开放权重视频和世界模型的许多势头来自中国的实验室。一家知名的美国公司发布同类别的开放权重,部分读起来像是在他人之前先定义生态系统的重心。

0.95 的相关性是一个很强的数字,值得翻译一下。它意味着,当 Runway 在其世界模型内部运行一个候选策略并测量其表现时,真实机器人的表现几乎相同。如果这一点在各类任务中都成立,实际后果就是机器人团队可以在仿真中完成大部分实验,而把物理硬件留到最终检查。考虑到物理试验既昂贵又缓慢,这相当于一周跑一百次迭代与一个月跑少数几次之间的差别。

更难的问题是泛化。视频教会模型世界看起来是什么样,以及物体倾向于如何表现,但机器人还需要知道在特定机械臂上、针对特定任务、在特定失败容忍度下该做什么。Runway 的论点是,视频训练出的先验减少了达到这一目标所需的特定任务数据量。这听起来合理,但尚未在大规模上得到证明。

这在更广泛的机器人竞赛中处于什么位置

Praxis-1 问世的这一年,人形机器人和制造业机器人正从演示走向部署。Figure 一直在训练退役人形机器人执行极端任务。人形机器人制造商一直在与汽车制造商签署工厂试点,波士顿动力已开始在现代汽车的一家工厂内测试其 Atlas 机器人,并计划到 2030 年实现大规模部署。共同点是,能力的提升速度快于为其提供数据的数据管线。

Runway 的贡献在于主张,数据管线问题有一条捷径,而这条捷径经过视频。如果模拟与真实结果之间的相关性在合作伙伴和任务中都成立,实际效果就是机器人团队可以在世界模型中进行迭代,把物理测试留到最终验证,并从一种自身持续增长的数据类别中学习。

这是一个有意义的断言,也是一个未经证实的断言。该公司正在向部分合作伙伴提供发布前访问权限,并邀请研究人员在自己的硬件上测试。真正重要的证据不会是 Runway 内部工作中的相关性数字。而是独立实验室能否复现这一结果,以及一个主要用第三人称互联网视频训练出来的策略,能否在一个从未去过的房间里处理一个从未见过的任务。这一测试将决定视频预训练会成为机器人大脑的默认基础,还是仍停留在有趣的研究方向。

相关文章