UBTech 的 UWORLD U1 想打造一台懂得察言觀色的機器人

過去兩年多數人形機器人的發表會,說穿了就是規格表。自由度、負載、電池續航,還有一個被形容為「極具侵略性」、隨後又被悄悄調整的價格。UBTech(優必選)在深圳舉行的 2026 全球發表會上亮相的 UWORLD U1,嘗試走一條不同的路:它賣的是陪伴。
官方的說法是,U1 是全球第一款為量產而打造的全尺寸超仿生人形機器人。它具備 88 個自由度,以及雙樞軸仿生頸椎;UBTech 表示這讓它能重現超過 90% 的人類基本動作。機身外覆專有的仿生皮膚。
要理解 88 個自由度代表什麼,可以先看一般工業協作手臂只有 6 到 7 個。單是一隻人手就超過 20 個。UBTech 宣稱的是一副關節密度接近人類的骨架,這與「能伸手、能抓握」的機器人屬於完全不同的工程層級。雙樞軸頸椎洩漏了設計意圖。工業作業不需要脖子有第二個樞軸,但一台必須自然維持眼神接觸的機器需要,而眼神接觸是社交需求,不是功能需求。
仿生皮膚則從另一個方向服務同一個目標。一台覆蓋著看起來、摸起來都像皮膚的材質的機器人,會誘使人觸碰;而觸碰正是「陪伴」這個敘事能否成立、還是會崩解的地方。
有趣的地方不在硬體數字。有許多機器人都有關節。有趣的是 UBTech 想讓這台機器人「注意到」什麼。
情緒辨識成了主打賣點
U1 採用該公司所稱的情緒驅動大型語言模型,設計目標是長期陪伴,而非任務執行。UBTech 聲稱該系統能辨識 20 種以上細微的情緒狀態,準確率超過 90%。
這個數字需要打個折扣。它是公司自行公布的,未經獨立評估。臉部與語音情緒辨識這個領域,長久以來一直有許多基準在離開實驗室後就崩潰,尤其是在跨文化、跨年齡與不同光照條件下。請把 90% 當成一個待驗證的說法,而不是既定事實。
這套架構被描述為「快慢雙腦」,將快速的直覺反應與較慢的推理配對。UBTech 表示反應時間約為 500 毫秒,並稱其臉部表情致動系統能在 20 毫秒內協調說話與嘴部動作。第二個數字才是決定「和機器人相處起來感覺如何」的關鍵。人類對脣形不同步極度敏感。20 毫秒的落差低於多數人能察覺的門檻,這正是該公司拿它來宣傳的原因。
此外還有 Agent Memory OS,用於持續性的長期互動、免喚醒詞溝通,以及情境化回應。其構想是讓你不再下指令,而是開始與裝置建立關係。任何用過語音助理的人都知道,這與目前的基準差得多遠。今天的系統在一段對話中就會忘記上下文,在對話之間更是完全忘記你,這就是為什麼每次跟它們說話都像從頭開始。持久的記憶,是「陪伴」這個框架能否有任何意義的技術前提。
雙腦拆分值得再看一眼,因為它承擔的任務比表面看起來更多。快速路徑處理反射級的反應——那種必須在幾百毫秒內發生、否則就會被視為延遲的反應。慢速路徑處理耗時較長但能產出更好答案的推理。把兩者拆開,能讓機器人在需要迅速反應時迅速反應、在該思考時思考,而不會讓其中一種模式拖累另一種。這與當前所有認真打造的代理系統背後的架構直覺相同,只是套用在身體上,而不是聊天視窗上。
一台會觀察你的機器人,隱私該怎麼算
一台能讀情緒的陪伴機器人,定義上就是一套對準你的臉與聲音、持續運作、而且放在你家的感測器組合。UBTech 以三層架構回應這個問題:本地優先處理、最低限度的雲端依賴,以及硬體層級的用戶控制。
紙上看來這是正確的架構。問題在於實際上界線畫在哪裡。本地優先處理仍允許部分資料離開裝置,而「最低限度」不是一個數字。在意這件事的買家會想要看到實際的資料流向被完整記載,而不是只有摘要。
三步驟路線圖
UBTech 勾勒出一條通往人機協作的路線圖:從危險與重複性任務開始,進展到陪伴與服務,最終抵達該公司所稱的人與智慧機器人之間的自然互動。
這樣的排序揭示了商業邏輯。危險與重複性工作是錢與監管保護所在,因為價值容易量化,失敗模式也清楚可辨。陪伴則是利潤與情感黏著度所在,但同時也是責任歸屬最模糊的地方。
除了 UWORLD,UBTech 也宣布了一項「人機陪伴計畫」,目標是為弱勢族群提供情緒與心理支持。該公司表示,預計在 2026 年捐贈 100 台客製化 U1,每台都具備 3D 臉部重建與聲紋身分複製、整合式情緒驅動互動模型、專屬長期記憶系統,以及多模態情境感知能力。
為弱勢族群設計的機器人,讓這項產品每一個未解的問題都變得更加沉重。年長使用者、孤立的使用者,以及有認知狀況的使用者,是最可能對一台記得他們、回應又溫暖的裝置產生真正依附的一群人。他們同時也是最沒有能力評估那台裝置拿他們的資料做了什麼、或在系統誤讀他們狀態時提出質疑的一群人。這項捐贈計畫表面上是慷慨的。但它也意味著,持久情緒記憶的首次大規模真實世界測試,將跑在對其失效模式防禦力最低的一群人身上。
真正該觀察的重點
有兩件事將決定 U1 是一個產品,還是一支展示影片。
第一,情緒辨識的準確度能否在發表會場合之外站得住腳。一台把痛苦誤讀成開心的機器人,比完全不會讀情緒的機器人更糟,因為它招來了一種它無法兌現的信任。情緒辨識的準確率數字,通常是對照帶有刻意表情的標註資料集測出來的。真實的臉是模糊的,而真實的痛苦往往看起來什麼都不像。
第二是資料問題。一台會記住你的對話、認得你的臉、還能複製聲紋的機器,儲存的是個人所產生最敏感的資料之一。聲紋是生物辨識特徵,這意味著一旦外洩,不是重設密碼就能了事。三層隱私架構是個起點,但這個產業習慣把隱私架構當成一張簡報投影片,而不是一份契約。
目前為止,U1 是一次可信的嘗試,試圖把人形機器人的討論從「它能舉起什麼」推向「它能理解什麼」。那是更難的問題,也是更有趣的問題。人形機器人的硬體時代產生了許多令人驚豔的影片,卻很少有產品能讓人持續使用。如果下一個階段是由機器能否讀懂氣氛來定義,而不是能否爬樓梯,那麼 U1 至少指向了這個產業必須前進的方向。