← 返回博客
Ai预计阅读 10 分钟

一台轮式半人形机器人独立完成了一小时洗衣工作

发布于 2026年10月4日
一台轮式半人形机器人独立完成了一小时洗衣工作

Dyna Robotics 发布了一款新机器人及其驱动系统,而这次的演示刻意选择了毫不起眼的场景:连续一个长镜头拍摄的一小时酒店洗衣作业。

这款机器人名为 Taku,源自日语词 takumi,意为“匠人”。它由人形上半身和两条七自由度机械臂组成,下身可折叠,整体安装在四个可转向的轮子上。其软件是 Dyna-2.1,公司称之为“物理智能体(physical agent)”,专为完整工作流而非单一操作任务而打造。

在视频中,Taku 在洗衣机、烘干机、折叠台和货架之间移动。它装填并启动机器、取出衣物、取回毛巾、折叠并分类,再把成品叠放整齐。当抓取失败、一次拿起两条毛巾,或从机器控制面板上滑脱时,它能自行恢复,无需向人求助。Dyna 估计,一个洗衣流程大约包含 79 个不同的步骤。

拉丝钢架上高高摞着叠得整整齐齐的白色毛巾

底层的三层架构

该架构将任务拆分为三个部分,而这种分工正是其中有意思的工程设计。

顶层是一个视觉-语言编排器,负责观察工作流、以文本形式记录已发生的事件,并决定下一步做什么。中间层是 Dyna 世界-动作模型的改进版,负责生成全身运动目标。底层是一个全身控制器,它在 NVIDIA Isaac Sim 中通过强化学习在数千个模拟机器人上训练而成,以 100 赫兹的频率将这些目标转换为关节和轮子的控制指令。

这种分层之所以重要,是因为它将“决策”与“执行”分开。编排器用语言对任务进行推理,这种方式灵活且易于修改。控制器则以任何推理模型都无法企及的速度处理底层的物理现实。两者都不必擅长对方的工作。

一百万小时的视频

训练数据是最能说明其雄心壮志的部分。Dyna 表示,它用一百万小时的人类和机器人数据对策略进行了预训练,这些数据来自人类视频和其自有的机器人机队,并通过一种共享表征来描述——该表征以相同格式表达人类和机器人的动作。据报道,该数据集包含 4300 万个片段,其存储容器让存储占用远小于朴素的逐帧方案,样本读取速度也快了好几倍。

把人类视频作为训练信号的主体,是在押注通用物理能力可以通过“观看”而非仅仅通过“动手”来学习。仅靠机器人机队,要积累一百万小时多样化的真实世界经验需要太久。人类视频资源丰富,而共享表征正是让模型把从人身上看到的模式迁移到一台身体结构不同的机器上的关键。

Dyna 还选择了轮子而非双腿,其理由务实得令人耳目一新。它所针对的工作流需要在工位之间移动,并把手伸进机器里、在桌面上操作、够到低处的货架以及头顶上方。像人一样行走并不在需求清单上。腿会为一项工作并不需要的能力增加成本和复杂性。

被改变的指标

这次发布中最能说明问题的细节,是 Dyna 决定衡量什么。公司没有报告单个任务的成功率,而是优化“平均干预间隔时间”(MTBI),即机器人能自主运行多久才需要人介入。

这是一个更难、也更诚实的目标。单个任务可以有很高的成功率,但整个工作流仍可能失败,因为当你把许多步骤串联起来时,失败会不断累积。一个抓取成功率为 95% 的机器人,在 79 个步骤中很快就会遇到麻烦。MTBI 衡量的正是运营者真正关心的事:这台机器能无人看管多久。

目标客户不是研究实验室。Dyna 采用“机器人即服务”模式,按每台机器人收取月费,打包硬件、软件、维护和模型更新。这把一大笔资本支出变成了运营支出,对于该公司正在争取的小企业来说意义重大。这也让 Dyna 能从真实部署中持续获得训练数据。创始人强调,硬件是刻意做得便宜的——价格在数万美元级别,而非数十万美元。

为什么从洗衣入手是明智的

把洗衣选作旗舰演示,比表面上看起来更聪明。酒店洗衣重复性高、量大,而且足够令人不快,以至于人员流动本身就是一项实打实的成本。它还在一个固定的房间里进行,机器配合、物体种类有限、流程可预测。相比杂乱无章的厨房或公共街道,这是一个友好得多的环境。

这种“窄”正是关键所在。在今天,一台能在某个受控环境中可靠完成一件枯燥工作的机器人,远比一个到处都可能不可预测地失败的通用型机器人更有价值。如果洗衣能跑通,同一套架构就可以指向其他具有类似特性的、边界明确的工作流:洗碗、布草处理、简单的仓库分拣。每一个都是独立的生意,每一个都能为同一个数据引擎提供养料。

宣传的边界与现实的起点

这次演示是公司自己拍的视频,而非独立评估,其部署方面的说法值得仔细推敲。新闻稿称 Dyna-2.1 正在酒店、自助洗衣店和餐厅中部署。而更详细的研究文章则把将系统带入真实客户现场表述为下一个里程碑。没有任何使用 Taku 的客户被公开点名,也没有发布任何来自商业部署的干预数据。

发布稿与技术报告之间的这种落差在机器人领域很常见,而真相通常就藏在这里。一段一小时未剪辑的视频确实是一项真实的成就。但它同样是一个经过精心布置的环境,而酒店洗衣比大多数场景都要友好。

Dyna 此前曾为更窄的工作部署过机器人,包括与连锁餐厅鼎泰丰合作开展的餐巾折叠落地项目,并在 2025 年融资 1.2 亿美元,投资方包括 NVIDIA 的风险投资部门和亚马逊的工业创新基金。按该公司自己的说法,其下一个里程碑是把新系统带入客户现场,并利用在那里发生的情况来改进它。

为什么这次值得关注

机器人演示很容易做,却很难让人信任。真正把严肃系统与精修视频区分开来的,通常是些不起眼的东西:它失败得有多体面、它有多不常需要帮助,以及经济账在客户现场而不是实验室里是否算得过来。

Dyna 选择衡量平均干预间隔时间、大规模使用人类视频,以及决定为真实工作打造廉价的轮式机身,这些都表明这个团队优化的是部署,而不是演示集锦。这些都无法证实其说法。但它确实说明,这家公司知道难点在哪里。

能替你跑完所有杂事的机器人仍然遥不可及。而一台能在一小时内无人监督地跑完某个特定、枯燥、多步骤工作流的机器人,则是一个小得多的主张;如果 Taku 能在客户现场可靠地做到这一点,那就是一个有意义的主张。洗衣房是一场测试。真正有意思的问题是:当它走出洗衣房之后会发生什么。

相关文章