← ブログに戻る
News読了目安 11 分

宇樹が6Bヒューマノイド基盤モデルをオープンソース化:1つのモデルが手も脚も制御、身体性AIが職務単位で採算を計算し始める

公開日 2026年10月6日
宇樹が6Bヒューマノイド基盤モデルをオープンソース化:1つのモデルが手も脚も制御、身体性AIが職務単位で採算を計算し始める

10月3日、宇樹科技はGitHubとHugging Faceで、次世代汎用ヒューマノイドロボット基盤モデル UnifoLM-WLA-1.0 を公開した。パラメータ規模は60億で、約2,500時間の実機ロボットデータでファインチューニングされている。このニュースは中国国内のロボット業界でそれほど遅れずに広まったが、最も見落とされやすい点は、「手を動かすこと」と「歩くこと」を同じモデルに詰め込んだことだ。

この1年、ヒューマノイドロボットのハイライトはほとんどデモ動画の中に留まっていた。宙返りができ、踊れ、コップ一杯の水を運べる。しかし実際に工場や店舗、家庭に入るとなると、試験問題は別物になる。単一の動作がどれだけ驚きを与えるかは別として、1つのモデルが卓上の精密操作と全身の移動タスクを同時にこなせるかどうかは、また別の話だ。宇樹が今回示した数字は64タスクで、うち10が全身タスク、54が卓上タスク。さらに平行グリッパと、異なる構成の2種類の器用なハンドに対応する。

技術スタックの路線も一見の価値がある。Qwen3-VLをベースにした身体性推論器を起点に、オプティカルフローとVQ-VAEによる未来の動的領域予測、残差VQによる動作離散化を重ね、最後にMMDiT動作エキスパートをつなぐ。噛み砕いて言えば、まずモデルに画面内で次に何が起きるかを理解させ、次に「行うべき動作」を再利用可能なブロックに分解し、最後に実行を担うモジュールに組み立てさせる。

作業台に散らばった金属製の関節モジュールと白紙の付箋、柔らかなサイドライト

なぜ「1つのモデルが手と脚を制御する」ことが分水嶺なのか

身体性AIのエンジニアリング実践では、手と脚は長らく別々のチームだった。把持、挿入、ネジ締めは高頻度・小振幅の動作で、精度と力制御への要求が高い。歩行、旋回、坂の上り下りは低頻度・大振幅の動作で、バランスと地形を扱う必要がある。両者を別々のモデルに分ける利点は、それぞれを極限まで調整できること。代償は、切り替え時に状態を受け渡す必要があり、そのたびに情報が失われたり遅延が増えたりしうることだ。

宇樹が64タスクを1つの6Bモデルに押し込んだのは、本質的に「統一表現」の利得が個別最適化の利得を上回る方に賭けている。この賭けは汎用GPU上では安くないが、ロボットにおいては意味がある。実機展開ではVRAM、演算能力、消費電力に厳しい制約があり、モデルを1セット減らせばコストも1つ減る。

押しているのは宇樹だけではない

10月前後のいくつかの出来事をつなげて見ると、これが孤立したリリースではないことがわかる。

智源研究院は9月29日にRoboBrain-X0をオープンソース化し、大規模モデルの能力をロボットの知覚と動作制御へ拡張した。身体性AIのオープンソースプロジェクトはこれまで、シミュレーション環境やデータセットの層で止まることが多かった。動作ポリシーに直接向き合うモデルの登場は、この路線が論文から再現可能なエンジニアリング資産へ移りつつあることを示す。

10月4日、浙江省杭州市の雲深処科技(DEEP Robotics)の複数のヒューマノイドロボットが街頭に出て、交差点での交通整理、秩序維持、観光客への案内をテストした。テストの場は展示ブースではなく実際の交差点で、雨天でも走らせた。この種のテストの価値は動作がいかに滑らかかではなく、ヒューマノイドロボットを、自分に道を譲ってくれない現実環境に置くことにある。

さらにさかのぼると、シンガポール国立大学、清華大学、北京大学など7大学が共同で、世界-動作モデルの基盤 OpenWAM をオープンソース化した。これが解決しようとしているのは、シミュレーションと実機の間にある古くからの亀裂だ。従来のシミュレータでは物理と視覚が別々に計算されることが多く、OpenWAMはモデルに「動作が世界をどう変えるか」をデータから直接学ばせ、それに基づいて物体位置、シーン意味論、タスク状態を予測する。公式READMEでは約640GBの学習データ推奨が示されており、位置づけは研究インフラであって、すぐ使える製品ではない。

「動けるかどうか」から「業務に就けるかどうか」へ

身体性AIの物語は転換点にある。ここ2年は、本体が歩けるか、動作が十分クールかが競われていた。今は、1台のロボットが何時間も連続でトラブルなく働けるかが競われている。

この転換には非常に現実的な指標がある。2回の人的介入の間の平均時間だ。あるメーカーは「信頼性の算数」を公開した。1回の洗濯サイクルは約79のサブタスクをつなぐ。各ステップの成功率が95%だとすると、全体を無介入で走り切れる確率は約1.7%しかない。個々のサブタスクの95%だけ見れば十分高いが、掛け合わせると崩れる。だから業界は最適化目標を、単一タスクの成功率から、完全なワークフローがどれだけ持続するかに変え始めている。

宇樹が今回オープンソース化した6B基盤の価値もそこにある。その意味は、再現可能な共通の出発点を提供することだ。後続の開発者はこの基盤上でファインチューニングし、ハードウェアを替え、タスクを追加できる。ゼロからデータを集める必要はない。身体性AIの競争は、「動く本体を作る」から「脳をハードウェアやタスクをまたいで再利用できるか」へ移りつつある。

最後に

60億パラメータのヒューマノイド基盤をオープンソース化しても、短期的には商業的リターンは見えにくく、データコストものしかかる。しかしそれが解決するのは、より基礎的なことだ。研究者と開発者が基準を突き合わせる場所を持つこと。

ロボットという仕事で最終的に乗り越えるべき関門は、工場や店舗での数千時間にある。発表会という関門は序章にすぎない。「継続的に使える」を現実にした者だけが、本当に参入したと言える。

業界に残された観察ポイントは具体的だ。この基盤の再現率がどれほど高いか、実際のプロジェクトでのイテレーション速度がどれほど速いか、そして半年後にどれだけの人がそこに改良をコミットしているか。発表当日の盛り上がりは去り、残るのは今も使われているコードだけだ。

関連記事