← 返回部落格
News預計閱讀 7 分鐘

宇樹把 6B 人形基座開源了:一個模型同時管手管腳,具身智慧開始按崗位算帳

發布於 2026年10月6日
宇樹把 6B 人形基座開源了:一個模型同時管手管腳,具身智慧開始按崗位算帳

十月三日,宇樹科技在 GitHub 和 Hugging Face 上釋出了新一代通用人形機器人基礎模型 UnifoLM-WLA-1.0,參數規模 60 億,基於約 2500 小時真實機器人資料微調。這則消息在國內機器人圈傳得不算慢,但最容易被略過的一點,是它把「動手」和「走路」塞進了同一個模型。

過去一年,人形機器人的高光時刻大多停在演示短片裡:能翻跟斗、能跳舞、能端一杯水。可真正要進廠、進店、進家庭,考題會換一道。單個動作夠不夠驚豔是一回事,一個模型能不能同時應付桌面的精細操作和全身的移動任務,是另一回事。宇樹這次給出的數字是 64 個任務,其中 10 項全身任務、54 項桌面任務,並且同時適配平行夾爪和兩種不同構型的靈巧手。

技術棧的路線也值得看一眼。它以基於 Qwen3-VL 的具身推理器作起點,疊加光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,最後接一個 MMDiT 動作專家。翻成不拗口的話:先讓模型看懂畫面裡接下來會發生什麼,再把「要做的動作」拆成一段段可重複使用的積木,最後交給負責執行的模組拼起來。

工作臺上散落的金屬關節模組與一張空白便條紙,柔和側光

為什麼「一個模型管手腳」是個分水嶺

在具身智慧的工程實踐裡,手和腳長期是兩套人馬。抓取、插裝、擰螺絲屬於高頻小幅動作,對精度和力控要求高;行走、轉身、上下坡屬於低頻大幅動作,要處理平衡和地形。把兩者拆給不同模型,好處是每一路都能調到極致,代價是切換時得做狀態傳遞,而每一次傳遞都可能丟資訊、加延遲。

宇樹把 64 個任務壓進一個 6B 模型,本質上是在賭「統一表徵」的收益大過分頭最佳化的收益。這個賭注放在通用 GPU 上並不便宜,但放在機器人身上有意義:真機部署時,顯示記憶體、算力、功耗都有硬約束,少一套模型就少一份開銷。

不只是宇樹在推

把十月前後幾件事連起來看,會發現這不是孤立的一次發布。

智源研究院在九月二十九日開源了 RoboBrain-X0,把大模型能力往機器人的感知與動作控制上延伸。具身智慧的開源專案此前多停在模擬環境和資料集層面,能直接面向動作策略的模型出現,說明這條路線正從論文走向可重現的工程資產。

十月四日,浙江杭州雲深處科技的多台人形機器人走上街頭,測試路口交通指揮、秩序維護和遊客諮詢。測試場景選在真實路口而不是展臺,雨天也在跑。這類測試的價值不在於動作多流暢,而在於把人形機器人放進一個不會為它讓路的真實環境。

再往前,新加坡國立大學、清華大學、北京大學等七所大學聯合開源了世界-動作模型底座 OpenWAM。它要解決的是模擬與真機之間那道老裂縫:傳統模擬器的物理與視覺往往各算各的,OpenWAM 讓模型直接從資料裡學「動作如何改變世界」,再據此預測物體位置、場景語義和任務狀態。官方 README 給出約 640GB 的訓練資料建議,定位是研究基礎設施,不是開箱即用的產品。

從「能不能動」到「能不能上崗」

具身智慧的敘事正在換軌。前兩年大家比的是本體能不能走、動作夠不夠酷,現在比的是一台機器人能不能連續運作幾個小時不出岔子。

這個轉變有一個很實在的指標:兩次人工干預之間的平均時長。有廠商公開過一段「可靠性算術」:一個洗衣循環大約串起 79 個子任務,按每步 95% 的成功率算,整輪無人干預跑完的機率只有約 1.7%。單看每個子任務的 95% 已經很高,乘起來就塌了。所以行業開始把最佳化目標從單任務成功率,改成完整工作流能撐多久。

宇樹這次開源的 6B 基座,價值也在這裡。它的意義在於提供一個可以重現的共同起點。後續開發者可以在這個底座上做微調、換硬體、加任務,而不用從零開始累積資料。具身智慧的競爭,正從「造出能動的本體」轉向「大腦能不能跨硬體、跨任務重複使用」。

寫在最後

開源一個 60 億參數的人形基座,短期看不出商業回報,資料成本也壓在那裡。但它解決的是一件更基礎的事:讓研究者和開發者有一個能對錶的地方。

機器人這件事,最終要過的關在工廠和門市裡那幾千個小時,發布會那一關只是開場。誰把「持續可用」這件事做實了,誰才算真的進了場。

留給行業的觀察點很具體:這批重現率有多高,真實專案裡的迭代速度有多快,以及半年之後還有多少人在上面提交改進。發布當天的熱鬧會散去,能留下的只有還在被用的那些程式碼。

相關文章