← 返回部落格
Ai預計閱讀 12 分鐘

TwelveLabs Pegasus 1.6 將第一人稱影片轉化為機器人訓練資料

發布於 2026年10月7日
TwelveLabs Pegasus 1.6 將第一人稱影片轉化為機器人訓練資料

教機器人折衣服,第一步是有人觀看數小時人類折衣服的影片,然後寫下每一個動作。TwelveLabs 想讓這第二項工作從此消失。

10 月 6 日,這家影片智慧公司發布 Pegasus 1.6,這是一個原生支援第一人稱視角影片的模型。這表示影片是從實際執行工作者的第一人稱視角拍攝,無論那個人是在烹飪、在工廠產線上組裝零件,還是遠端操作機器人。

為何第一人稱影片是不同的問題

與固定俯拍或第三人稱攝影機影片相比,第一人稱影片帶有不同的空間線索與動作模式。它包含動態模糊、光線變化,以及隨著穿戴者移動而出現與消失的物體。以一般影片資料訓練的模型往往處理得很差。

Pegasus 1.6 的設計目的,就是接收這種混亂的輸入,並擷取教機器人如何移動、抓取或導航時真正重要的細節。此模型直接支援五種工作流程。

動作分段與標註會從原始影片產生附時間戳的標籤,涵蓋任務、步驟、物體以及手與物體的互動,並對應到特定領域的分類體系。密集描述標註會產生描述性語言,涵蓋空間關係、場景脈絡與手物互動,目標是訓練以語言為條件的機器人策略。品質評分會在影片送交人工審查者之前,透過評估動作清晰度、取景與穩定性,過濾掉低品質片段。搜尋與策展可透過自然語言查詢,在大型影片庫中找出稀有事件與長尾情境。同意與合規標記會在影片進入下游流程之前,偵測人臉、旁觀者,以及畫面上或紙本上的敏感資料。

人力成本的數學

說明這個產品的最佳數字,就是人工標註成本。以人工標註第一人稱視角影片,每小時影片可能耗費 70 至 155 小時的人力時間。把這個數字套用到單一段兩小時的片段,一名人工標註者就得為一個檔案花上數週工作。

Pegasus 1.6 搭載 261,120 個 token 的上下文視窗,大到足以處理長達兩小時的影片。使用方式是透過 TwelveLabs API,價格為每影片小時 1.75 美元、每百萬個影像輸入 token 3 美元,以及每百萬個輸出 token 15 美元,是 Pegasus 1.5 費率的兩倍。

對於規劃大型工作的團隊來說,有一個注意事項:批次分析仍由 Pegasus 1.5 處理,因此大量批次處理尚未完全轉移到新模型。

理解與執行之間的區別

該公司執行長 Jae Lee 將眼前的機會描述為訓練基礎設施。理解一個動作,只是教會它的其中一部分。Pegasus 可以描述肢體動作,並提供對軌跡的粗略理解,但無法提供執行動作所需的全部資訊。壓力、觸覺與精確控制仍是各自獨立的問題。

這是對界線的誠實描述,值得牢牢記住。機器人團隊必須把從影片取得的資訊與其他資料結合,並打造能將這些資訊轉化為行動的系統。Pegasus 位於上游,為訓練流程提供輸入,而不是取代整個機器人技術堆疊。

一個拉絲鋁製機器人夾爪正接近淺灰色表面上一個素白陶瓷方塊

Lee 提供了一項處理規模的指標,回憶起有一次執行大約處理了相當於 17 年的第一人稱影片,耗時約 18 小時,且沒有任何影片失敗。他並未具體說明運算資源或評估條件,因此這只是軼事性的吞吐量說法,而非可重現的基準測試。該公司的技術資料描述了對動作辨識與執行操作之手部辨識的內部評估,但未提供任何數值分數或可重現的競爭對手比較。

與替代方案相比,它位於何處

競爭領域涵蓋機器人開發流程中的好幾個部分。NVIDIA 的 Cosmos Curator 在資料準備上直接重疊,透過過濾、標註與移除重複項目來處理,而其開放工具讓團隊能選擇受管理服務之外的替代方案。Encord 整合 NVIDIA Cosmos Reason 2 與 Embed,在標註與策展工作上競爭,透過行為式搜尋產生初步標籤供人工審查。Google 的 Gemini Robotics ER 2 在解讀影片與追蹤任務進度上有所重疊,但它強調規劃與協調,把馬達執行交給較低階的動作模型。Black Forest Labs 與 mimic 的 FLUX-mimic 使用影片模型基礎來產生機器人動作,處理的是執行,而非資料準備。

這些工具的計費單位與產品範圍各不相同,因此它們的費率無法斷定在特定工作負載下哪一個最便宜。Pegasus 對影片按時長計費,對文字輸出按 token 計費,這適合瓶頸在於標註、而非動作產生的團隊。

這次發布確立了什麼、又沒有確立什麼

Pegasus 1.6 為 TwelveLabs 的影片理解研究提供了具體產品,並鎖定一個真實瓶頸。從原始人類影片到可用的機器人訓練資料,這條路確實又慢又昂貴,而將其部分自動化,對任何打造具身 AI 的人來說都很重要。

仍未確定的是,這個模型是否比現有替代方案帶來明顯更好的結果。此次發布並未附上第三方基準測試、涵蓋整個領域的價格比較,或已發布的客戶成果。接下來最值得觀察的是,機器人開發者是否會發布在實際標註工作流程中使用 Pegasus 1.6 的結果。這類證據將讓討論從發布消息進展到評估,也是唯一能斷定節省人力說法的證據類型。

為何人類影片是金字塔的底層

Pegasus 1.6 背後的策略,建立在一個關於機器人行為知識從何而來的論點上,值得直白地說清楚。

人們對從事體力工作所知道的大部分事情,從未以機器能學習的形式被記錄下來。廚師不假思索地調整握法。工人透過轉移重心與伸手範圍來應對掉落的工具,而這種方式沒有人會寫下來。這些調整,正是機器人只是做出動作、與機器人真正完成任務之間的差別。

人類影片是這些調整最豐富的來源之一,而且數量極其龐大。這個賭注是:從人類影片中萃取廣泛的行為知識基礎,再透過遠端操作示範調整到特定機器人身上,會比每項任務都從零開始,更快打造出有能力的機器。

這是發展策略,而不是已經證實的保證,而執行長也這麼說。更多影片不會自動產生廣泛通用的機器人,而把一個被理解的動作轉化為實際執行,仍是涉及力量、觸覺與控制的獨立問題。

同意層面

Pegasus 1.6 支援的五種工作流程中,有一項值得特別提出,因為它指向這個領域固有的治理問題。同意與合規標記會在影片進入下游流程之前,偵測人臉、旁觀者,以及畫面上或紙本上的敏感資料。

這項功能之所以存在,是因為第一人稱視角影片是從工作中的人之視角拍攝,而這樣的取景會捕捉到任務以外的東西。它會拍到識別證、螢幕、背景中的人臉、桌上的文件。對於以工業規模收集影片的機器人團隊來說,標記步驟能防止訓練管道吸收不該吸收的素材。

將這項工作流程與標註類流程並列納入,是對資料管道具有合規層面、且該層面難以人工管理的一種低調承認。對於受監管產業的團隊而言,標記能力最終可能和標註速度一樣重要,因為無法篩選輸入的管道根本無法使用。

什麼能規模化,什麼不能

TwelveLabs 將這次發布定位為從小型、精心策劃的資料集,邁向以真實人類經驗為基礎的可規模化管道。誠實的但書是:標註步驟的規模化,不會自動帶來訓練步驟的規模化。

即使是一條快速、便宜的標註管道,所產生的資料仍必須搭配機器人所需的觸覺與控制訊號,也仍必須調整到特定機器的身體形態。Pegasus 1.6 移除了其中一個瓶頸,也就是標註人力,但對其他瓶頸毫無作用。這是有用的貢獻,而不是完整的解決方案;受益最大的團隊,會是那些標註步驟正是關鍵限制的團隊。這是否描述大多數機器人團隊,正是實際部署後發布成果才能回答的問題。

相關文章