← 返回博客
Ai预计阅读 10 分钟

宇树与紫东太初竞逐机器人的空间大脑

发布于 2026年10月2日
宇树与紫东太初竞逐机器人的空间大脑

机器人早就擅长“身体”了。人形机器人能走路、保持平衡、抓取物体。它一直不擅长的,是决定下一步做什么的那部分——尤其是当房间并不是它受训时见过的那个房间。挪动一只杯子、换个工作台,或者在任务进行到一半时把活交给它,演示就会崩掉。

9 月发布的两个中国成果,瞄准的正是这一部分。宇树展示了 UnifoLM-WLA-1.0,一个拥有 60 亿参数的人形机器人基础模型,基于约 2,500 小时真实机器人数据训练,宣称在具身推理上取得七项开源最优结果。由中国科学院和武汉人工智能研究院孵化的紫东太初,于 9 月 15 日开源了紫东太初5.0-9B——一个 90 亿参数的多模态模型,在其参数规模内,于九项国际空间理解基准中拿下八项第一。

两者都不是机器人。它们都是为机器人构建“大脑”的尝试,而且都是直接发布,而非藏在演示墙后面展示。

宇树押注通用性

宇树这次发布中最显眼的数字是 64。一个模型声称能协调 64 项不同任务,从叠毛巾、收碗碟到铺床、倒垃圾、往洗衣机里装衣物。这份清单的重点不在任何单项任务,而在于同一套权重就能处理全部任务。

多年来,这一直是机器人领域的核心难题。大多数演示都针对单一任务、单一场景,并经过大量调参。它们看起来很惊艳,却无法迁移。一个能在某种光照条件下叠毛巾的策略,换到另一张桌子上、换一条颜色不同的毛巾就不行了。按这种模式扩张机器人队伍,意味着要把每一种变化都教一遍——那不叫规模化。

宇树的方法依托一个名为 UnifoLM-ER-1-4B 的具身推理基座,它构建在 Qwen3-VL-4B 之上,用超过 500 万个具身推理样本训练而成。在 16 项多模态感知与理解基准中,它在其中七项上领先。在 Where2Place 和 EmbSpatial 两项空间测试中,它分别取得 82.0 和 88.9 分,而 GPT-6 Astra 为 69.0 和 83.3。这些是针对某个闭源模型的具体对比,比起笼统宣称“更优”,更容易被检验和争论。

宇树表示将开放模型、代码和数据集。最后一项才是关键。一个权重开源但数据集闭源的机器人策略无法被复现,只能被使用。把数据放出来,别的研究室才能核验其说法,或在此基础上继续推进。

紫东太初押注空间推理

紫东太初5.0-9B 从感知一侧切入这一问题。该模型可处理文本、单图、多图、长视频以及任意分辨率,卖点是空间推理:理解物体在哪里、彼此如何关联,以及当视角移动时场景如何变化。

它着重展示的基准差距出现在 MindCube-tiny 上:得分 78.27,领先 Qwen3.5-9B 超过 20 分,领先 STEP3-VL-10B 超过 15 分。在一项演示中,当被要求找出从左数第二个银色盒子时,它输出了正确坐标,而其他同等规模的开源模型全都指错了位置。在一项跨视角测试中,只有这个模型在相机角度变化时仍能保持参照系不乱。

正是这些失误让真实机器人崩塌。识别出杯子的模型,回答的是“这是什么物体”。而知道杯把朝向哪边、旁边有没有放下的空间的模型,才开始回答“能用它做什么”。当任务变长,这些判断必须串联起来:拿起物体、记住它的身份、打开容器、更新状态。漏掉一步,后面的任务就会跑偏。

紫东太初的工程技巧是自适应循环推理。简单问题分配更少算力;像空间变换和物体关系这样的难题,则在不调用外部工具的情况下进行多轮内部推理,从而避免在占多数的简单输入上 token 开销膨胀。

这次发布中可能最重要的部分,是它没有设门槛的东西。除权重之外,紫东太初还公开了完整的空间多模态数据生产流水线,覆盖预训练、监督微调和强化学习。机构和公司可以复用它,把自家车间或实验室的数据转成训练样本。这回应了两年来一直伴随开源模型发布的一句抱怨:权重是给了,但配方依然保密,你没法把它适配到自己的数据上。该模型已在北京、佛山和青岛的具身训练场运行。

通向同一道缺口的两条路径

把这两个发布并排来看,差异很有启发性。宇树从动作一侧向外推:拿一个必须执行任务的策略,用 2,500 小时真实机器人运动数据训练它,再衡量它能否在 64 项工作之间泛化。紫东太初从感知一侧向内收:拿一个必须理解场景的多模态模型,用空间基准训练它,再衡量当视角移动时它能否保持几何关系不乱。

机器人两者都需要。它得知道杯子在哪,也得知道怎么把它拿起来。两个实验室从相反的两端攻打同一道缺口,而两者在同一个月发布,说明这个领域已经就缺口是什么达成了共识:那是感知转化为行动的中间层,也是让一个只跑八秒的任务变成一个能跑八分钟的任务的地方。

数据问题又一次把两者区分开来。宇树用真实机器人运动数据训练,这类数据采集昂贵且稀缺。紫东太初则依靠其数据流水线和合成的空间任务,它们的扩展方式不同,也带来另一种风险:模型在测试场景里表现优异,然后止步于此。哪条路线能产出真正经受住真实仓库考验的策略,就将定论哪种数据源才是押对了。

行业背景

这两次发布都落在一个近期重新整理了自身假设的领域里。谷歌的 Gemini Robotics 2 打出“一个大脑适配任何机器人”的口号。英伟达的 Jim Fan 认为视觉-语言-动作模型已死,世界动作模型才是继任者。Gartner 9 月关于中国 AI 趋势的报告,把物理 AI 和世界模型列为已从实验变成结构性要求的几大方向之一。

正是这种重新定义,让空间基准比聊天分数更重要。具身 AI 的竞争已从“模型多会谈论物理世界”,转向“它能否在物理世界中行动”,评价指标也随之改变。坐标准确度、视角一致性,以及跨场景的任务完成度,构成了新的记分牌。

值得关注什么

对这两次发布都该有的诚实提醒是:在空间推理上领先基准,并不等于有一台能在仓库里干活的机器人。模型可以在测试集里把物体摆放正确,但遇到夹爪卡住或光线糟糕的真实机械臂照样失灵。推理与行动之间的落差,正是大多数机器人承诺折戟之处。

这两个发布值得追踪的原因,在于开放权重与开放数据流水线的组合。如果宇树或紫东太初之外的实验室能拿去任一模型,在自己的硬件上重新训练并公布结果,这些说法就会在公众面前接受检验。如果这些发布停留在基准和演示层面,而竞争对手继续闭守数据,这个领域就会停在原地:大量惊艳的视频,和极少数在某个周二真正干着有用活的机器人。

相关文章