← 返回部落格
Ai預計閱讀 10 分鐘

Unitree 與紫東太初競逐機器人的空間大腦

發布於 2026年10月2日
Unitree 與紫東太初競逐機器人的空間大腦

機器人擅長「身體」這件事已經有一段時間了。人形機器人能行走、平衡、抓握。它一直做不好的,是決定下一步該做什麼的那個部分,尤其是當眼前的房間不是它受訓時的那個房間。移動一個杯子、換一張工作檯、在任務進行到一半才把工作交給機器人,展示就會當場崩掉。

九月有兩項中國發表的成果,正是衝著這個部分而來。Unitree(宇樹)展示了 UnifoLM-WLA-1.0,一個 60 億參數的人形基礎模型,以約 2,500 小時的真實機器人資料訓練而成,並宣稱在具身推理上取得七項開源最佳成績。紫東太初源自中國科學院與武漢人工智慧研究院,於 9 月 15 日開源 ZDTaichu5.0-9B,這是一個 90 億參數的多模態模型,在同參數量級的九項國際空間理解基準中拿下八項第一。

兩者都不是機器人。它們都是為了打造機器人所依賴的那顆大腦,而且都是公開發表,而不是藏在展示牆後面給人看。

Unitree 押注通用性

Unitree 這次發表中最顯眼的數字是 64。單一模型宣稱能協調 64 種不同的任務,從摺毛巾、收拾碗盤,到鋪床、倒垃圾、把衣物放進洗衣機。這份清單的重點不在任何一個單獨任務,而在於同一組權重就能處理全部。

多年來,這一直是機器人學的核心問題。大多數展示都是單一任務、單一場景,而且經過大量調校。它們看起來很厲害,卻無法遷移。一個能在某種光照條件下摺毛巾的策略,換到另一張桌子、另一種顏色的毛巾就不管用。以這種模式擴張機器人勞動力,等於要教會它每一種變化,那根本不是擴張。

Unitree 的做法建構在一個名為 UnifoLM-ER-1-4B 的具身推理基礎之上,該模型以 Qwen3-VL-4B 為底座,用超過五百萬筆具身推理樣本訓練。在 16 項多模態感知與理解基準中,它有七項領先。在 Where2Place 與 EmbSpatial 兩項空間測試中,它分別拿下 82.0 與 88.9,對比 GPT-6 Astra 的 69.0 與 83.3。這些是針對特定閉源模型所做的具體比較,比空泛宣稱「更優越」更容易被檢驗。

Unitree 表示將開放模型、程式碼與資料集。最後一項才是關鍵。權重開放但資料集封閉的機器人策略無法被重現,只能被使用。開放資料,才能讓其他實驗室查核這項說法,或在此基礎上繼續發展。

紫東太初押注空間推理

ZDTaichu5.0-9B 從感知端切入這個問題。該模型能處理文字、單張影像、多張影像、長影片與任意解析度,賣點是空間推理:理解物體在哪裡、彼此如何關聯,以及當視角移動時場景如何變化。

它特別強調的基準差距出現在 MindCube-tiny,得分 78.27,領先 Qwen3.5-9B 超過 20 分、領先 STEP3-VL-10B 超過 15 分。在一項示範中,被要求找出從左邊數來第二個銀色盒子時,它輸出正確座標,而其他同級開源模型全都指錯位置。在一項跨視角測試中,唯有這個模型在攝影機角度改變時仍能維持參考框架不亂。

這些正是讓真實機器人失靈的失誤。辨識出一個杯子,只回答了「這是什麼物體」;知道杯柄朝哪個方向、旁邊有沒有空間可以放下,才開始回答「能拿它做什麼」。當任務拉長,這些判斷必須串接起來:拿起物體、記住身分、打開容器、更新狀態。只要漏掉一步,後面的任務就會一路走偏。

紫東太初的工程巧思是自適應迴圈推理。簡單的問題分配較少算力。困難的問題,例如空間變換與物體關係,則在模型內部進行多輪推理,不需呼叫外部工具,這讓占多數的簡單輸入不致於把 token 成本推高。

這次發表中最重要的一環,或許是它沒有鎖起來的部分。除了權重之外,紫東太初也公開了整套空間多模態資料生產流程,涵蓋預訓練、監督式微調與強化學習。機構與企業可以沿用這套流程,把自家產線或實驗室的資料轉成訓練樣本。這回應了兩年來伴隨開源模型發布的抱怨:你拿到權重,卻無法用自己的資料調適它,因為配方始終保密。該模型已在北京、佛山與青島的具身訓練場實際運行。

通往同一道缺口的兩條路

把這兩項發表並排來看,差異很具啟發性。Unitree 是由動作端向外推:拿一個必須執行任務的策略,用 2,500 小時的真實機器人動作訓練它,再衡量它能否在 64 種工作中通用。紫東太初則由感知端向內收:拿一個必須理解場景的多模態模型,用空間基準訓練它,再衡量它在視角移動時能否維持幾何關係不亂。

機器人兩者都需要。它必須知道杯子在哪裡,也必須知道怎麼把它拿起來。兩個實驗室從相反的兩端攻打同一道缺口,而兩者選在同一個月發布,說明這個領域對「缺口在哪」已有共識:那層介於中間、把感知轉為行動的環節,也是把八秒的任務變成八分鐘任務的地方。

資料問題又把兩者分開。Unitree 以真實機器人動作訓練,這種資料蒐集昂貴且稀少。紫東太初倚重資料流程與合成的空間任務,這種資料的規模化方式不同,也帶來另一種風險:模型可能在測試場景表現優異,然後就停在那裡。哪條路線能產出真正經得起真實倉庫考驗的策略,就會決定哪一種資料來源才是對的賭注。

產業脈絡

這兩項發表都落在一個近期重新調整了前提假設的領域。Google 的 Gemini Robotics 2 主打「一顆大腦適用任何機器人」。Nvidia 的 Jim Fan 主張視覺—語言—動作模型已死,世界動作模型(world action models)才是接班人。Gartner 九月份關於中國 AI 趨勢的報告,把實體 AI 與世界模型列為已從實驗變成結構性必要條件的方向之一。

正因為這種框架轉變,空間基準才比聊天分數更重要。具身 AI 的競賽,已經從「模型多會談論物理世界」轉向「它能否在其中行動」,衡量指標也隨之改變。座標準確度、視角一致性,以及跨場景的任務完成率,才是新的計分板。

值得觀察的重點

對這兩項發表,誠實的但書是:空間推理的基準領先,並不等於一台能在倉庫裡幹活的機器人。模型可以在測試集裡把物體位置擺對,卻仍在夾爪卡住或光線不良的真實機械臂上失敗。推理與行動之間的落差,正是大多數機器人承諾葬身之處。

這兩者值得追蹤的原因,在於開放權重與開放資料流程的組合。如果 Unitree 或紫東太初以外的實驗室能取用其中任一模型,在自己的硬體上重新訓練並發表結果,這些說法就會在公開場合被檢驗。如果這些發表終究只是基準與展示,而競爭者繼續封閉自家資料,這個領域就會停留在原處:一堆令人驚豔的影片,以及極少數在週二真正做著有用工作的機器人。

相關文章