← ブログに戻る
Ai読了目安 15 分

UnitreeとZDTaichu、ロボットの「空間脳」の座を争う

公開日 2026年10月2日
UnitreeとZDTaichu、ロボットの「空間脳」の座を争う

ロボットは以前から「身体」のほうは得意だった。ヒューマノイドは歩き、バランスを取り、物をつかむことができる。苦手だったのは、次に何をするかを決める部分だ。とりわけ、置かれた部屋が訓練時の部屋とは違うときにそれが露呈する。カップの位置を変え、作業台を入れ替え、タスクの途中でロボットに指示を渡す——それだけでデモは崩壊する。

その部分に挑んだ中国発のリリースが9月に2件あった。UnitreeはUnifoLM-WLA-1.0を披露した。約2,500時間の実機ロボットデータで訓練された60億パラメータのヒューマノイド基盤モデルで、身体性推論においてオープンソースの最先端結果を7件達成したと主張している。中国科学院と武汉人工智能研究院からスピンアウトしたZDTaichuは、9月15日にZDTaichu5.0-9Bをオープンソース化した。90億パラメータのマルチモーダルモデルで、同一パラメータクラスの国際的な空間理解ベンチマーク9件のうち8件で首位を取った。

どちらもロボットそのものではない。どちらもロボットが動くための「脳」を作ろうとする試みであり、そしてどちらもデモの壁の向こうに隠されるのではなく、公開された。

Unitreeが賭ける「汎用性」

Unitreeのリリースで目を引く数字は64だ。単一のモデルが64種類の異なるタスクを統括すると主張している。タオルを畳む、食器を片付ける、ベッドを整える、ゴミを出す、洗濯機に洗濯物を入れる——そのリストの要点は個々のタスクにあるのではない。同じ重みがそのすべてを扱えるという点にある。

これは長年、ロボティクスにおける中心的課題だった。ほとんどのデモは単一タスク・単一シーンで、徹底的にチューニングされている。見た目は印象的だが、転移しない。ある照明条件でタオルを畳むポリシーは、別の色のタオルを別のテーブルの上で畳むことはできない。そのモデルの上でロボットの稼働台数を増やすということは、あらゆるバリエーションを教え込むことを意味し、それはスケーリングではない。

Unitreeのアプローチは、UnifoLM-ER-1-4Bと呼ばれる身体性推論の基盤に依拠している。Qwen3-VL-4Bの上に構築され、500万件を超える身体性推論サンプルで訓練された。16件のマルチモーダル知覚・理解ベンチマークのうち7件で分野をリードしている。空間に関する2つのテスト、Where2PlaceとEmbSpatialでは、82.0と88.9を記録し、GPT-6 Astraの69.0と83.3を上回る。これはクローズドモデルとの具体的な比較であり、一般的な優位性の主張よりも論じやすい。

Unitreeはモデル、コード、データセットを公開すると述べている。重要なのは最後の項目だ。重みは公開されているがデータセットが非公開のロボットポリシーは、再現することはできず、使うことしかできない。データを公開することで初めて、別の研究室がその主張を検証したり、その上に積み上げたりできる。

ZDTaichuが賭ける「空間推論」

ZDTaichu5.0-9Bは知覚の側から問題に切り込む。このモデルはテキスト、単一画像、複数画像、長尺動画、任意の解像度を扱い、その売りは空間推論にある。物体がどこにあり、どう関係し合い、視点が動いたときにシーンがどう変化するかを理解することだ。

同社が強調するベンチマークの差はMindCube-tinyに現れている。ここで78.27を記録し、Qwen3.5-9Bを20ポイント以上、STEP3-VL-10Bを15ポイント以上上回った。あるデモでは、左から2番目の銀色の箱を探すよう求められ、正しい座標を出力した。同程度のサイズの他のオープンモデルはいずれも誤った場所を指し示した。視点をまたぐテストでは、カメラアングルが変わっても基準座標系を維持できたのはこのモデルだけだった。

これらは実機のロボットを壊す失敗だ。カップを認識するモデルは「物体が何か」に答えたことになる。取っ手がどちらを向いているか、その横に置くスペースがあるかを知るモデルは、「それで何ができるか」に答え始めている。タスクが長時間に及ぶと、そうした判断は連鎖しなければならない。物体を掴む、その正体を記憶する、容器を開ける、状態を更新する。1ステップでも抜ければ、残りのタスクはずれていく。

ZDTaichuのエンジニアリング上の工夫は適応的ループ推論だ。簡単な質問には計算量を割かない。空間変換や物体関係のような難しい質問には、外部ツールを呼び出さずに内部で複数回の推論パスを回し、大多数を占める単純な入力でトークンコストが膨らむのを防ぐ。

このリリースで最も重要なのは、門戸を閉ざしていない部分かもしれない。重みとともに、ZDTaichuは空間マルチモーダルデータの生産パイプライン全体を公開した。事前学習、教師ありファインチューニング、強化学習までを含む。研究機関や企業はこれを再利用し、自社の工場フロアやラボのデータを訓練サンプルに変換できる。これは2年間オープンモデルのリリースにつきまとってきた不満に応えるものだ。重みは手に入るが、レシピが非公開なので自社データに適応させられない、という不満である。このモデルは北京、佛山、青島の身体性トレーニング拠点で稼働している。

同じギャップへの2つの道

2つのリリースを並べると、その違いは示唆に富む。Unitreeは行動の側から外へ向かって進む。タスクを実行しなければならないポリシーを取り、2,500時間の実機ロボット動作で訓練し、64種類の作業をまたいで汎化するかを測る。ZDTaichuは知覚の側から内へ向かって進む。シーンを理解しなければならないマルチモーダルモデルを取り、空間ベンチマークで訓練し、視点が動いても幾何を正しく保てるかを測る。

ロボットにはどちらも必要だ。カップがどこにあるかを知り、それをどう掴むかを知らなければならない。2つのラボは同じギャップを両端から攻めており、両者が同じ月に公開されたという事実は、この分野がギャップの正体について合意したことを示唆している。すなわち、知覚が行動に変わる中間層であり、8秒間走るタスクが8分間走るタスクに変わる場所だ。

データの問題が再び両者を分ける。Unitreeは実機ロボットの動作で訓練した。収集コストが高く、希少だ。ZDTaichuは自社のデータパイプラインと合成的な空間タスクに依拠した。これはスケールの仕方が異なり、リスクも異なる。モデルがテストシーンで優れた成績を出し、そこに留まってしまうというリスクだ。実際の倉庫との接触に耐えるポリシーを生み出すのはどちらの道か——それがどちらのデータ源が正しい賭けだったかを決めるだろう。

業界の文脈

どちらのリリースも、最近前提を組み替えた分野に登場した。GoogleのGemini Robotics 2は「あらゆるロボットのための1つの脳」を打ち出している。NvidiaのJim Fanは、視覚-言語-行動モデルは死に、world action modelが後継だと論じてきた。Gartnerの9月の中国AI動向レポートは、フィジカルAIとワールドモデルを、実験ではなく構造的要件になった方向性の一つに挙げている。

こうした捉え直しがあるからこそ、空間ベンチマークはチャットのスコアよりも重要なのだ。身体性AIの競争は、モデルが物理世界についてどれだけうまく語れるかから、その中で行動できるかへと移り、指標もそれに追随した。座標精度、視点一貫性、シーンをまたいだタスク完了率が新しいスコアボードだ。

注目すべき点

両リリースについて正直に言うべき但し書きは、空間推論のベンチマーク首位は、倉庫で機能するロボットと同じではないということだ。モデルはテストセットで物体を正しく配置できても、グリッパーが詰まった実機や悪い照明の下では失敗しうる。推論と行動の間のギャップこそ、これまで多くのロボティクスの約束が消えていった場所だ。

この2つを追う価値があるのは、オープンな重みとオープンなデータパイプラインの組み合わせだ。UnitreeやZDTaichuの外にいる研究室がどちらかのモデルを取り、自社のハードウェアで再訓練し、その結果を公開できるなら、主張は公の場で検証される。もしリリースがベンチマークとデモのままに留まり、競合他社がデータを非公開にし続けるなら、この分野はこれまでと同じ場所に留まるだろう。印象的な動画は大量にあり、火曜日に役立つ仕事をしているロボットはごくわずか、という場所に。

関連記事