車輪付きセミヒューマノイド、人手なしで1時間のランドリー作業を完了

Dyna Roboticsは新しいロボットとそれを動かすシステムを公開した。そのデモはあえて地味で、ホテルのランドリー作業1時間をワンカットで撮影したものだ。
ロボットの名前はTaku(タク)で、名工を意味する日本語の「匠(たくみ)」に由来する。人型の上半身と7自由度のアーム2本、折りたたみ式の下半身を組み合わせ、全体は4つの操舵可能な車輪に搭載されている。ソフトウェアはDyna-2.1で、同社はこれをフィジカルエージェントと呼び、単一のマニピュレーション作業ではなくワークフロー全体のために作られたとしている。
動画の中でTakuは洗濯機、乾燥機、折りたたみ台、棚の間を移動する。機械に洗濯物を入れ、起動し、取り出し、タオルを取り出し、折りたたみ、仕分けし、その結果を積み重ねる。把持に失敗したとき、タオルを一度に2枚拾ってしまったとき、機械の操作部から引き離されたときでも、人に助けを求めずに復帰する。Dynaは洗濯1サイクルが約79の個別ステップに及ぶと見積もっている。

その下にある3つの層
アーキテクチャは仕事を3つの部分に分割しており、この分け方こそが興味深いエンジニアリングだ。
最上位では、視覚言語オーケストレーターがワークフローを監視し、起きたことをテキストベースのメモリとして保持し、次に何をするかを判断する。中間では、Dynaのワールドアクションモデルの改良版が全身の動作目標を生成する。最下位では、NVIDIAのIsaac Sim上で数千体のシミュレーションロボットを対象に強化学習で訓練された全身コントローラーが、それらの目標を100ヘルツで関節と車輪の指令に変換する。
この階層化が重要なのは、決定と実行を分離しているからだ。オーケストレーターは言語でタスクを推論し、それは柔軟で変更しやすい。コントローラーは推論モデルには到底真似できない速度で、低レベルの物理的現実を処理する。どちらも相手の仕事が得意である必要はない。
100万時間分の動画
その野心を説明するのが訓練データだ。Dynaによれば、人間とロボットの100万時間分のデータでポリシーを事前訓練した。データは人間の動画と自社のロボット群から集められ、人間とロボットの動きを同じ形式で表現する共有表現を通じて記述されている。データセットは4300万エピソードに上るとされ、単純なフレーム単位のアプローチよりもストレージをはるかに小さくし、サンプル読み出しを数倍高速化するコンテナに保存されている。
訓練シグナルの大部分に人間の動画を使うのは、一般的な身体能力は実行するだけでなく、見ることでも学習できるという賭けだ。ロボット群だけでは、多様な実世界経験を100万時間分蓄積するのにあまりにも時間がかかる。人間の動画は豊富にあり、共有表現によって、モデルは人間に見られるパターンを異なる身体を持つ機械に転移できる。
Dynaは脚ではなく車輪を選んだが、その理由は清々しいほど実用的だ。同社が狙うワークフローでは、作業ステーション間を移動し、機械の中に手を伸ばし、テーブル上、低い棚の下、頭上にまで届く必要がある。人間のような歩行はそのリストにない。脚は、仕事に必要ない能力のためにコストと複雑さを増やすだけだ。
変わった指標
今回の発表で最も雄弁なのは、Dynaが何を測定することにしたかだ。個々のタスクの成功率を報告する代わりに、同社は介入間平均時間(MTBI)、つまり人間が介入しなければならなくなるまでロボットが稼働する時間を最適化した。
これはより難しく、より正直な目標だ。個々のタスクが高い成功率でもワークフローは失敗し得る。なぜなら、多くのステップをつなげると失敗が積み重なるからだ。把持の95%に成功するロボットでも、79ステップにわたればすぐに問題に突き当たる。MTBIは、オペレーターが実際に気にする事柄、つまり機械をどれだけ放置できるかを測定する。
ターゲット顧客は研究ラボではない。DynaはRaaS(Robots-as-a-Service)モデルを展開し、ハードウェア、ソフトウェア、保守、モデル更新をまとめたロボット1台あたりの月額料金を課す。これにより大きな設備投資が運用費に変わり、同社が狙う小規模事業者にとって重要になる。またDynaには実際の導入先から継続的な訓練データの流れをもたらす。創業者らは、ハードウェアは意図的に安価で、数十万ドルではなく数万ドルだと強調している。
なぜランドリーが妥当な出発点なのか
ランドリーを旗艦デモに選んだのは見た目以上に賢い。ホテルのランドリーは反復的で量が多く、不快さゆえに人手の離職が実際のコストになる。また固定された部屋で、協力的な機械、限られた対象物、予測可能な手順の中で行われる。散らかったキッチンや公共の街路よりもはるかに優しい環境だ。
狭さこそが要点だ。1つの管理された環境で1つの退屈な作業を確実にこなせるロボットは、どこでも予測不能に失敗する汎用ロボットよりも、今日でははるかに価値がある。ランドリーがうまくいけば、同じアーキテクチャを類似した性質を持つ他の限定的ワークフロー、たとえば食器洗い、リネン処理、単純な倉庫仕分けに向けられる。それぞれが単独のビジネスであり、それぞれが同じデータエンジンにデータを供給する。
主張が終わり、現実が始まるところ
このデモは企業の動画であり、独立した評価ではない。導入に関する主張は注意深く読む価値がある。プレスリリースは、Dyna-2.1がホテル、コインランドリー、レストランに導入されていると述べている。より詳細な研究投稿では、システムを実際の顧客現場に持ち込むことを次のマイルストーンと位置づけている。Takuを稼働させている顧客は公表されておらず、商用導入からの介入データも公開されていない。
発表リリースと技術レポートの間のこのギャップはロボティクスではよくあることで、真実はたいていそこにある。1時間のノーカット動画は確かな成果だ。だがそれは選び抜かれた環境でもあり、ホテルのランドリーは大半の現場より優しい環境だ。
Dynaは以前、レストランチェーン鼎泰豊(ディンタイフォン)とのナプキン折りたたみ導入など、より狭い作業向けにロボットを展開した。また2025年には、NVIDIAのベンチャー部門やAmazonの産業イノベーション基金を含む支援を受けて1億2000万ドルを調達した。同社自身の説明によれば、次のマイルストーンは新しいシステムを顧客現場に持ち込み、そこで起きることを使って改良することだ。
これに注目する価値がある理由
ロボティクスのデモは作りやすく、信頼しにくい。本気のシステムと磨かれた動画を分けるのは、たいてい地味な点だ。どれだけ優雅に失敗するか、どれだけめったに助けを必要としないか、そして経済性がラボではなく顧客現場で成り立つかどうか。
Dynaが介入間平均時間を測ることを選び、人間の動画を大規模に使い、実際の仕事のために安価な車輪式ボディを作る決断はすべて、デモリールではなく導入のために最適化しているチームの兆候だ。それだけでは主張を裏付けるものではない。だが、難しい部分が何かを同社が分かっていることは示唆する。
あなたの用事を片付けてくれるロボットはまだ遠い。1つの特定の、退屈な、多段階のワークフローを監督なしで1時間実行できるロボットという主張はずっと小さく、もしTakuが顧客現場でそれを確実にできるなら、意味のある主張だ。ランドリールームはテストだ。興味深い問いは、そこを出たときに何が起きるかだ。