TwelveLabs Pegasus 1.6、一人称視点映像をロボット訓練データに変える

ロボットに洗濯物を畳ませるには、まず誰かが、人間が洗濯物を畳む映像を何時間も見て、その動きをひとつずつ書き留めるところから始まる。TwelveLabsは、その2つ目の作業を不要にしようとしている。
10月6日、動画インテリジェンス企業のTwelveLabsは、一人称視点(egocentric)動画をネイティブにサポートするモデル「Pegasus 1.6」をリリースした。これは、作業を行う本人の一人称視点で撮影された映像を意味する。料理をする人、工場のラインで部品を組み立てる人、ロボットを遠隔操作する人などが該当する。
一人称視点の映像が別種の問題である理由
一人称視点の映像は、固定された俯瞰カメラや三人称視点のカメラ映像とは異なる空間的手がかりと動きのパターンを持つ。動きによるぶれ、変化する照明、装着者が動くにつれて現れたり消えたりする物体などが含まれる。一般の動画データで学習したモデルは、これをうまく扱えない傾向がある。
Pegasus 1.6は、こうした雑然とした入力を取り込み、ロボットに動き方、把持の仕方、移動の仕方を教えるうえで重要な詳細を抽出するために作られている。このモデルは5つのワークフローを直接サポートする。
行動のセグメンテーションとラベリングは、生の動画からタスク、ステップ、物体、手と物体のインタラクションにタイムスタンプ付きラベルを生成し、ドメイン固有の分類体系にマッピングする。高密度キャプションラベリングは、空間関係、シーン文脈、手と物体のインタラクションについて記述する言語を生成し、言語条件付きロボットポリシーの訓練を目的とする。品質スコアリングは、映像が人間のレビュアーに届く前に、行動の明瞭さ、構図、安定性を評価して低品質クリップを除外する。検索とキュレーションは、自然言語クエリを通じて、大規模な動画リポジトリ全体からまれなイベントやロングテールのシナリオを浮かび上がらせる。同意とコンプライアンスのフラグ付けは、映像が下流のパイプラインに入る前に、顔、傍観者、画面上または紙の機微データを検出する。
この製品を説明する数字は、手作業によるラベリングのコストだ。一人称視点の映像を手作業でラベリングすると、映像1時間あたり70〜155時間の人的工数がかかることがある。これを2時間のクリップ1本に当てはめると、人間のアノテーターは1ファイルのために数週間分の作業を抱えることになる。
Pegasus 1.6は、最大2時間の動画を処理できる十分な大きさの261,120トークンのコンテキストウィンドウを備える。利用はTwelveLabs API経由で、料金は動画1時間あたり1.75ドル、画像入力100万トークンあたり3ドル、出力100万トークンあたり15ドルで、これはPegasus 1.5の2倍の料金だ。
大規模な処理を計画しているチーム向けの注意点が1つある。バッチ分析は依然としてPegasus 1.5が担当しているため、大量の一括処理はまだ完全には新モデルへ移行していない。
工数計算
理解することと実行することの違い
同社CEOのJae Lee氏は、目先の機会を「トレーニング基盤」と表現した。行為を理解することは、それを教えることの一部にすぎない。Pegasusは四肢の動きを記述し、軌道について大まかな理解を提供できるが、それらを実行するために必要なすべての情報を提供するわけではない。圧力、触覚、精密な制御は別個の問題として残る。
これは境界を正直に描いた説明であり、心に留めておく価値がある。ロボティクスチームは、映像から得た情報を他のデータと組み合わせ、それを行動に変換するシステムを構築しなければならない。Pegasusは上流に位置し、ロボティクススタックを置き換えるのではなく、トレーニングプロセスにデータを供給する。

Lee氏は処理規模を示す一例として、約17年分の一人称視点映像を約18時間で処理し、失敗した動画がなかったランを回想した。ただし、計算リソースや評価条件を明示しておらず、これは再現可能なベンチマークではなく、体験談的なスループットの主張にとどまる。同社の技術資料は、行動識別と行為を行う手の認識に関する社内評価について述べているが、数値スコアや競合との再現可能な比較は示していない。
代替手段との位置づけ
競合領域はロボティクス開発パイプラインのいくつかの部分にまたがる。NVIDIAのCosmos Curatorは、フィルタリング、アノテーション、重複除去によるデータ準備で直接重なる。また、そのオープンツールは、チームにマネージドサービス以外の選択肢を与える。EncordによるNVIDIA Cosmos Reason 2とEmbedの統合は、アノテーションとキュレーション作業で競合し、行動ベースの検索を用いて人間のレビュー用の予備ラベルを生成する。GoogleのGemini Robotics ER 2は、動画の解釈とタスク進捗の追跡で重なるが、計画と調整を重視し、モーター実行は下位レベルの行動モデルに委ねる。Black Forest LabsとmimicのFLUX-mimicは、動画モデルの基盤を用いてロボットの行動を生成し、データ準備ではなく実行を扱う。
これらのツールでは課金単位と製品範囲が異なるため、料金だけでは特定のワークロードにとってどれが最も安いかは決まらない。Pegasusは動画を時間で、テキスト出力をトークンで課金する。これは、行動生成ではなくラベリングがボトルネックになっているチームに適している。
このリリースが証明することと、しないこと
Pegasus 1.6は、TwelveLabsの動画理解研究を具体的な製品に落とし込み、実際のボトルネックを狙っている。生の人間映像から使用可能なロボット訓練データに至る道は、本当に遅く高コストであり、その一部を自動化することは、身体性AIを構築する誰にとっても重要だろう。
未解決なのは、このモデルが既存の代替手段より有意に優れた結果を出すかどうかだ。発表に際して、第三者ベンチマーク、競合全体の価格比較、公表された顧客実績は示されなかった。次に注目すべき最も明確な点は、ロボティクス開発者が実際のラベリングワークフローでPegasus 1.6を使った結果を公表するかどうかだ。そうした証拠があれば、議論は発表から評価へと移る。そして、節約された工数に関する主張を決着させるのは、そうした証拠だけである。
人間の映像がピラミッドの基盤である理由
Pegasus 1.6の背後にある戦略は、ロボットの行動知識がどこから来るのかという議論に基づいている。これは率直に述べておく価値がある。
人が肉体労働について知っていることのほとんどは、機械が学習できる形で記録されたことがない。料理人は無意識に握り方を調整する。作業員は道具を落とした後、体重移動とリーチの仕方を変えて立て直すが、その方法は誰も書き留めない。こうした調整こそが、単に動作を行うロボットと、タスクを完了するロボットの違いである。
人間の映像は、そうした調整の最も豊かな情報源の1つであり、膨大な量が利用可能だ。そこに賭けているのは、人間の映像から抽出した広範な行動知識を、遠隔操作によるデモンストレーションを通じて特定のロボットに適応させることが、タスクごとにゼロから始めるよりも、有能な機械への速い道だという考えである。
これは実証された保証ではなく開発戦略であり、CEOもそう述べている。映像を増やせば自動的に広く有能なロボットが生まれるわけではなく、理解した行動を実行される行動に変換することは、力、触覚、制御を伴う別個の問題として残る。
同意という側面
Pegasus 1.6がサポートする5つのワークフローのうち1つは、この領域に付随するガバナンス上の問題を指し示すため、特に取り上げる価値がある。同意とコンプライアンスのフラグ付けは、映像が下流のパイプラインに入る前に、顔、傍観者、画面上または紙の機微データを検出する。
この機能が存在するのは、一人称視点映像が作業中の人物の視点から撮影され、その画角がタスク以上のものを捉えるからだ。名札、画面、背景の顔、机の上の書類などが映り込む。産業規模で映像を収集するロボティクスチームにとって、フラグ付け工程は、トレーニングパイプラインが取り込むべきでない素材を取り込まないようにする役割を果たす。
このワークフローをラベリング系のワークフローと並べて含めていることは、データパイプラインにコンプライアンス面があり、その面を手作業で管理するのは難しいという静かな認識を示している。規制産業のチームにとっては、ラベリング速度と同じくらいフラグ付け機能が重要になるかもしれない。入力をスクリーニングできないパイプラインは、そもそも使えないからだ。
スケールするもの、しないもの
TwelveLabsはこのリリースを、小規模で注意深くキュレーションされたデータセットから、実世界の人間体験に基づくスケーラブルなパイプラインへの移行として位置づけている。正直な注意点は、ラベリング工程のスケールが、トレーニング工程のスケールを自動的にもたらすわけではないということだ。
高速で安価なラベリングパイプラインであっても、生成されるデータは、ロボットが必要とする触覚信号や制御信号と組み合わせる必要があり、また特定の機械の身体性に適応させる必要がある。Pegasus 1.6は、ラベリング工数という1つのボトルネックを取り除くが、他のボトルネックには何もしない。これは完全な解決策ではなく有用な貢献であり、最も恩恵を受けるチームは、ラベリング工程が制約要因だったチームだろう。それがほとんどのロボティクスチームに当てはまるかどうかは、実際の導入から公表された結果がまさに答えるであろう問いである。
関連記事
MetaがMidjourneyの画像・動画技術をライセンス、その理由は示唆に富む
ベンチマークは四半期ごとに動く。何が見た目に良いかについてのコミュニティの判断は動かない。
AssemblyAI、リアルタイム音声のレイテンシを91ミリ秒に短縮。この数字が重要な理由
音声の制約は単語誤り率ではなかった。それはターンテイキングだった。
GoogleのNano Banana 2.1はフラッグシップではなく機能追加リリースだ
ミッドティアのリリースは、ラボが大多数のユーザーに実際に何が必要だと考えているかを教えてくれる。それはフラッグシップよりも有用なシグナルだ。
動画広告スタックは専門特化型へと分裂した——Boreal-H3が示すその理由
シネマティックな品質と反復のスループットは別の製品であり、一つの生成レイヤーが両方で先頭に立つことはできない。