輪式半人形機器人獨力完成一小時洗衣作業

Dyna Robotics 發布了一款新機器人以及驅動它的系統,而這次的示範刻意不炫目:一小時的飯店洗衣作業,以一鏡到底的方式拍攝。
這款機器人名叫 Taku,源自日文「匠」(takumi),意為大師級工匠。它結合了人形上半身與兩隻七自由度手臂,下半身則可折疊,整體安裝在四個可轉向的輪子上。軟體是 Dyna-2.1,公司稱之為「物理代理」(physical agent),專為完整工作流程而非單一操作任務而打造。
在影片中,Taku 在洗衣機、烘衣機、摺衣桌與層架之間移動。它裝載並啟動機器、取出衣物、拿取毛巾、摺疊並分類,最後把成品堆疊起來。當抓取失敗、一次抓起兩條毛巾,或抓握被機器控制裝置拉開時,它都能自行恢復,不需向人求助。Dyna 估計一輪洗衣流程包含約 79 個不同的步驟。

底下有三層架構
這套架構把工作拆成三個部分,而這種分層正是有趣的工程所在。
最上層是視覺語言協調器(vision-language orchestrator),負責監看工作流程、以文字形式記錄發生過的事,並決定下一步該做什麼。中層是 Dyna 世界-動作模型的改良版,負責產生全身動作目標。最下層是全身控制器,透過強化學習在 NVIDIA Isaac Sim 中數千具模擬機器人上訓練而成,將這些目標以 100 赫茲的頻率轉換為關節與輪子指令。
這種分層之所以重要,在於它把「決策」與「執行」分開。協調器以語言對任務進行推理,這種方式靈活且容易修改。控制器則以推理模型無法企及的速度處理底層的物理現實。兩者都不必擅長對方的工作。
一百萬小時的影片
訓練資料正是說明其野心所在的部分。Dyna 表示,它在一百萬小時的人類與機器人資料上預訓練策略,資料來源包括人類影片與自家機器人隊群,並透過一套共用表徵來描述,讓人類與機器人的動作以相同格式呈現。該資料集據稱包含 4,300 萬個 episode,儲存於特定容器格式中,使儲存空間遠小於、樣本讀取速度也比逐格處理的樸素做法快上數倍。
以人類影片作為訓練訊號的主體,是一場賭注:通用的物理能力可以透過觀看學習,而不只是靠親身操作。單靠機器人隊群,要累積一百萬小時多樣化的真實世界經驗,所需時間實在太長。人類影片唾手可得,而共用表徵正是讓模型能把它在人身上看到的模式,轉移到身體構造不同的機器上的關鍵。
Dyna 也選擇了輪子而非雙腿,理由務實得令人耳目一新。它鎖定的工作流程需要在工作站之間移動,並伸手進入機器、在桌面上作業、伸向低處層架以及高舉過頭。像人一樣走路並不在需求清單上。雙腿只會為這份工作不需要的能力增添成本與複雜度。
被改變的衡量指標
這次發布中最能說明一切的細節,是 Dyna 決定衡量什麼。他們沒有報告單一任務的成功率,而是最佳化「平均介入間隔時間」(mean time between interventions),也就是機器人能持續運作多久才需要人類介入。
這是更困難、也更誠實的目標。單一任務可以有很高的成功率,工作流程卻依然失敗,因為當你把許多步驟串在一起時,失誤會累積。一具抓取成功率 95% 的機器人,在 79 個步驟中很快就會遇到麻煩。MTBI 衡量的正是操作者真正在意的事:這台機器可以被放著不管多久。
目標客戶並不是研究實驗室。Dyna 採用「機器人即服務」(robots-as-a-service)模式,對每台機器人收取月費,內容包含硬體、軟體、維護與模型更新。這把一大筆資本支出轉為營運支出,對該公司積極爭取的小型企業來說格外重要。這也讓 Dyna 能從真實部署中持續取得訓練資料。創辦人強調,硬體刻意壓低價格,是數萬美元等級,而非數十萬美元。
為什麼從洗衣著手很合理
選擇洗衣作為旗艦示範,比表面上看來更聰明。飯店洗衣重複性高、量大,而且辛苦到人力流動本身就是一項實質成本。這項工作還發生在固定房間裡,機器願意配合,物件種類有限,流程也可預測。相較於雜亂的廚房或公共街道,這是友善得多的環境。
範圍狹窄正是重點。在今天,一具能在單一受控環境中穩定做好一件枯燥工作的機器人,遠比一個到處都可能無預警失敗的通才更有價值。如果洗衣可行,同一套架構就能指向其他性質類似的封閉式工作流程:洗碗、布巾處理、簡單的倉儲分揀。每一項本身都是一門生意,而且每一項都會餵養同一套資料引擎。
宣稱到哪裡為止,現實從哪裡開始
這場示範是公司自製影片,並非獨立評估,而關於部署的種種說法值得仔細推敲。新聞稿稱 Dyna-2.1 正在飯店、自助洗衣店與餐廳部署。但更詳細的研究貼文則把「將系統帶到真實客戶場域」描述為下一個里程碑。目前沒有任何正在運行 Taku 的客戶被公開指名,也沒有釋出任何商業部署的介入數據。
發表新聞稿與技術報告之間的落差,在機器人領域很常見,而真相通常就藏在那裡。一小時一刀未剪的影片確實是實實在在的成就。但它同時也是經過精心安排的環境,而飯店洗衣本來就比大多數場域來得友善。
Dyna 先前曾部署機器人從事範圍更窄的工作,包括與餐飲連鎖品牌鼎泰豐合作的折餐巾專案,並於 2025 年募得 1.2 億美元,投資方包括 NVIDIA 的創投部門與 Amazon 的產業創新基金。依該公司自己的說法,下一個里程碑是把這套新系統帶進客戶場域,並以現場發生的情況來改進它。
為什麼這個案例值得關注
機器人示範容易製作,卻難以信任。真正區別一套嚴肅系統與一支精美影片的,通常是不怎麼光鮮的東西:它失敗時有多優雅、多不常需要求助,以及經濟效益是在客戶場域還是只在實驗室裡成立。
Dyna 選擇衡量平均介入間隔時間、大規模運用人類影片,以及決定打造廉價的輪式機體來做真實工作,這些都顯示這支團隊最佳化的目標是部署,而不是展示影片。這些都不能證實它的說法,但確實顯示這家公司知道難處在哪裡。
能替你跑腿辦事的機器人仍遙不可及。一具能在一小時內無人監督地完成某個特定、枯燥、多步驟工作流程的機器人,是範圍小得多的宣稱;而如果 Taku 能在客戶場域穩定做到,那就是個有意義的宣稱。洗衣房是一場測試。真正有趣的問題是:當它走出洗衣房之後會發生什麼。