← 返回博客
News预计阅读 7 分钟

宇树把 6B 人形基座开源了:一个模型同时管手管脚,具身智能开始按岗位算账

发布于 2026年10月6日
宇树把 6B 人形基座开源了:一个模型同时管手管脚,具身智能开始按岗位算账

十月三日,宇树科技在 GitHub 和 Hugging Face 上放出了新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,参数规模 60 亿,基于约 2500 小时真实机器人数据微调。这条消息在国内机器人圈传得不算慢,但最容易被略过的一点,是它把「动手」和「走路」塞进了同一个模型。

过去一年,人形机器人的高光时刻大多停在演示短片里:能翻跟头、能跳舞、能端一杯水。可真正要进厂、进店、进家庭,考题会换一道。单个动作够不够惊艳是一回事,一个模型能不能同时应付桌面的精细操作和全身的移动任务,是另一回事。宇树这次给出的数字是 64 个任务,其中 10 项全身任务、54 项桌面任务,并且同时适配平行夹爪和两种不同构型的灵巧手。

技术栈的路线也值得看一眼。它以基于 Qwen3-VL 的具身推理器作起点,叠加光流与 VQ-VAE 的未来动态区域预测、残差 VQ 动作离散化,最后接一个 MMDiT 动作专家。翻成不拗口的话:先让模型看懂画面里接下来会发生什么,再把「要做的动作」拆成一段段可复用的积木,最后交给负责执行的模块拼起来。

工作台上散落的金属关节模块与一张空白便签,柔和侧光

为什么「一个模型管手脚」是个分水岭

在具身智能的工程实践里,手和脚长期是两套班子。抓取、插装、拧螺丝属于高频小幅动作,对精度和力控要求高;行走、转身、上下坡属于低频大幅动作,要处理平衡和地形。把两者拆给不同模型,好处是每一路都能调到极致,代价是切换时得做状态传递,而每一次传递都可能丢信息、加延迟。

宇树把 64 个任务压进一个 6B 模型,本质上是在赌「统一表征」的收益大过分头优化的收益。这个赌注放在通用 GPU 上并不便宜,但放在机器人身上有意义:真机部署时,显存、算力、功耗都有硬约束,少一套模型就少一份开销。

不只是宇树在推

把十月前后几件事连起来看,会发现这不是孤立的一次发布。

智源研究院在九月二十九日开源了 RoboBrain-X0,把大模型能力往机器人的感知与动作控制上延伸。具身智能的开源项目此前多停在仿真环境和数据集层面,能直接面向动作策略的模型出现,说明这条路线正从论文走向可复现的工程资产。

十月四日,浙江杭州云深处科技的多台人形机器人走上街头,测试路口交通指挥、秩序维护和游客咨询。测试场景选在真实路口而不是展台,雨天也在跑。这类测试的价值不在于动作多流畅,而在于把人形机器人放进一个不会为它让路的真实环境。

再往前,新加坡国立大学、清华大学、北京大学等七所高校联合开源了世界-动作模型底座 OpenWAM。它要解决的是仿真与真机之间那道老裂缝:传统仿真器的物理与视觉往往各算各的,OpenWAM 让模型直接从数据里学「动作如何改变世界」,再据此预测物体位置、场景语义和任务状态。官方 README 给出约 640GB 的训练数据建议,定位是研究基础设施,不是开箱即用的产品。

从「能不能动」到「能不能上岗」

具身智能的叙事正在换轨。前两年大家比的是本体能不能走、动作够不够酷,现在比的是一台机器人能不能连着干几个小时不出岔子。

这个转变有一个很实在的指标:两次人工干预之间的平均时长。有厂商公开过一段「可靠性算术」:一个洗衣循环大约串起 79 个子任务,按每步 95% 的成功率算,整轮无人干预跑完的概率只有约 1.7%。单看每个子任务的 95% 已经很高,乘起来就塌了。所以行业开始把优化目标从单任务成功率,改成完整工作流能撑多久。

宇树这次开源的 6B 基座,价值也在这里。它的意义在于提供一个可以复现的共同起点。后续开发者可以在这个底座上做微调、换硬件、加任务,而不用从零开始攒数据。具身智能的竞争,正从「造出能动的本体」转向「大脑能不能跨硬件、跨任务复用」。

写在最后

开源一个 60 亿参数的人形基座,短期看不出商业回报,数据成本也压在那里。但它解决的是一件更基础的事:让研究者和开发者有一个能对表的地方。

机器人这件事,最终要过的关在工厂和门店里那几千个小时,发布会那一关只是开场。谁把「持续可用」这件事做实了,谁才算真的进了场。

留给行业的观察点很具体:这批复现率有多高,真实项目里的迭代速度有多快,以及半年之后还有多少人在上面提交改进。发布当天的热闹会散去,能留下的只有还在被用的那些代码。

相关文章