TwelveLabs Pegasus 1.6 trasforma i video in prima persona in dati di addestramento per robot

Insegnare a un robot a piegare il bucato inizia con qualcuno che guarda ore di filmati di esseri umani che piegano il bucato, per poi annotare ogni movimento. TwelveLabs vuole eliminare quel secondo lavoro.
Il 6 ottobre, l'azienda di video intelligence ha rilasciato Pegasus 1.6, un modello con supporto nativo per i video egocentrici. Ciò significa filmati girati dal punto di vista in prima persona di chi svolge il lavoro, che si tratti di qualcuno che cucina, assembla pezzi su una linea di fabbrica o aziona un robot da remoto.
Perché il video in prima persona è un problema diverso
I filmati in prima persona portano con sé indizi spaziali e schemi di movimento diversi da quelli dei video con telecamera fissa dall'alto o in terza persona. Includono motion blur, illuminazione variabile e oggetti che appaiono e scompaiono mentre chi li indossa si muove. I modelli addestrati su dati video generici tendono a gestirli male.
Pegasus 1.6 è progettato per prendere quell'input disordinato ed estrarre i dettagli che contano per insegnare a un robot come muoversi, afferrare o navigare. Il modello supporta direttamente cinque flussi di lavoro.
Segmentazione ed etichettatura delle azioni genera etichette con timestamp per attività, passaggi, oggetti e interazioni mano-oggetto da video grezzo, mappate su una tassonomia specifica del dominio. L'etichettatura con didascalie dense produce linguaggio descrittivo per relazioni spaziali, contesto della scena e interazioni mano-oggetto, finalizzato all'addestramento di policy robotiche condizionate dal linguaggio. Il punteggio di qualità filtra i clip di bassa qualità valutando chiarezza dell'azione, inquadratura e stabilità prima che i filmati raggiungano i revisori umani. Ricerca e curatela fanno emergere eventi rari e scenari long-tail in un ampio archivio video tramite query in linguaggio naturale. Il flagging di consenso e conformità rileva volti, astanti e dati sensibili su schermo o su carta prima che i filmati entrino nelle pipeline a valle.
Il calcolo del lavoro
Il numero che spiega il prodotto è il costo di etichettatura manuale. Etichettare a mano filmati egocentrici può richiedere da 70 a 155 ore di lavoro umano per ogni ora di video. Applicato a un singolo clip di due ore, un annotatore umano si trova davanti a settimane di lavoro per un solo file.
Pegasus 1.6 viene fornito con una finestra di contesto di 261.120 token, abbastanza ampia da elaborare video fino a due ore. L'accesso avviene tramite l'API TwelveLabs, con un prezzo di $1,75 per ora di video, $3 per milione di token di input immagine e $15 per milione di token di output, il doppio della tariffa di Pegasus 1.5.
Un'avvertenza per i team che pianificano lavori di grandi dimensioni: l'analisi in batch è ancora gestita da Pegasus 1.5, quindi l'elaborazione in grandi volumi non è ancora passata completamente al nuovo modello.
La distinzione tra comprendere e fare
Il CEO dell'azienda, Jae Lee, ha descritto l'opportunità immediata come infrastruttura di addestramento. Comprendere un'azione è solo una parte dell'insegnarla. Pegasus può descrivere i movimenti degli arti e fornire una comprensione approssimativa delle traiettorie, ma non fornisce tutte le informazioni necessarie per eseguirle. Pressione, tatto e controllo preciso rimangono problemi separati.
Questa è un'inquadratura onesta del confine, e vale la pena tenerla a mente. I team di robotica devono combinare le informazioni derivate dal video con altri dati e costruire i sistemi che le traducono in azione. Pegasus si colloca a monte, alimentando il processo di addestramento anziché sostituire lo stack robotico.

Lee ha offerto un'indicazione della scala di elaborazione, ricordando un'esecuzione che ha gestito circa 17 anni di filmati in prima persona in circa 18 ore senza un video fallito. Non ha specificato le risorse di calcolo o le condizioni di valutazione, il che rende quella una dichiarazione aneddotica di throughput piuttosto che un benchmark riproducibile. I materiali tecnici dell'azienda descrivono valutazioni interne di identificazione delle azioni e riconoscimento della mano che le esegue, ma non forniscono punteggi numerici né confronti riproducibili con i concorrenti.
Dove si colloca rispetto alle alternative
Il campo competitivo copre diverse parti della pipeline di sviluppo robotico. Cosmos Curator di NVIDIA si sovrappone direttamente alla preparazione dei dati attraverso filtraggio, annotazione e rimozione dei duplicati, e il suo tooling aperto offre ai team un'alternativa a un servizio gestito. L'integrazione di NVIDIA Cosmos Reason 2 e Embed da parte di Encord compete per il lavoro di annotazione e curatela, generando etichette preliminari per la revisione umana con ricerca basata sul comportamento. Gemini Robotics ER 2 di Google si sovrappone nell'interpretazione dei video e nel monitoraggio del progresso delle attività, sebbene enfatizzi pianificazione e coordinamento, lasciando l'esecuzione motoria a modelli d'azione di livello inferiore. FLUX-mimic di Black Forest Labs e mimic utilizza una base di modello video per produrre azioni robotiche, affrontando l'esecuzione anziché la preparazione dei dati.
Le unità di fatturazione e gli ambiti dei prodotti differiscono tra questi strumenti, quindi le loro tariffe non stabiliscono quale sia il più economico per un dato carico di lavoro. Pegasus fattura il video in base alla durata e l'output di testo in base ai token, il che si adatta ai team il cui collo di bottiglia è l'etichettatura anziché la generazione di azioni.
Cosa stabilisce e cosa non stabilisce il rilascio
Pegasus 1.6 mette un prodotto concreto dietro la ricerca di TwelveLabs sulla comprensione video, e punta a un vero collo di bottiglia. Il percorso dai filmati umani grezzi a dati utilizzabili per l'addestramento dei robot è davvero lento e costoso, e automatizzarne una parte sarebbe importante per chiunque costruisca IA incarnata.
Ciò che rimane irrisolto è se il modello offra risultati significativamente migliori rispetto alle alternative esistenti. Nessun benchmark di terze parti, confronto di prezzi sull'intero campo o risultati pubblicati dai clienti hanno accompagnato l'annuncio. La cosa più chiara da osservare in seguito è se gli sviluppatori di robotica pubblicheranno risultati dall'uso di Pegasus 1.6 in flussi di lavoro di etichettatura reali. Tale evidenza sposterebbe la conversazione dall'annuncio alla valutazione, ed è l'unico tipo che risolve un'affermazione sul lavoro risparmiato.
Perché il video umano è la base della piramide
La strategia dietro Pegasus 1.6 si basa su un'argomentazione su da dove provenga la conoscenza comportamentale dei robot, e vale la pena enunciarla chiaramente.
La maggior parte di ciò che le persone sanno sul fare lavoro fisico non è mai stata catturata in una forma da cui una macchina possa imparare. Un cuoco aggiusta una presa senza pensarci. Un lavoratore si riprende da un attrezzo caduto spostando peso e portata in un modo che nessuno scrive. Questi aggiustamenti sono la differenza tra un robot che esegue un movimento e un robot che completa un compito.
Il video umano è una delle fonti più ricche di questi aggiustamenti, ed è disponibile in volume enorme. La scommessa è che una vasta base di conoscenza comportamentale estratta da filmati umani, adattata a robot specifici tramite dimostrazioni teleoperate, sia un percorso più rapido verso macchine capaci rispetto a partire da zero per ogni compito.
Questa è una strategia di sviluppo piuttosto che una garanzia dimostrata, e il CEO ha detto altrettanto. Più video non producono automaticamente un robot ampiamente capace, e tradurre un'azione compresa in una eseguita rimane un problema separato che coinvolge forza, tatto e controllo.
La dimensione del consenso
Uno dei cinque flussi di lavoro supportati da Pegasus 1.6 merita di essere segnalato, perché indica una questione di governance tipica del settore. Il flagging di consenso e conformità rileva volti, astanti e dati sensibili su schermo o su carta prima che i filmati entrino nelle pipeline a valle.
Quella funzione esiste perché il video egocentrico è catturato dalla prospettiva di una persona al lavoro, e quell'inquadratura cattura più del compito. Coglie un badge, uno schermo, un volto sullo sfondo, un documento su una scrivania. Per un team di robotica che raccoglie filmati su scala industriale, il passaggio di flagging è ciò che impedisce a una pipeline di addestramento di ingerire materiale che non dovrebbe.
L'inclusione di quel flusso di lavoro accanto a quelli di etichettatura è un tacito riconoscimento che la pipeline dati ha una superficie di conformità, e che quella superficie è difficile da gestire manualmente. Per i team in settori regolamentati, la capacità di flagging potrebbe finire per contare quanto la velocità di etichettatura, perché una pipeline che non può filtrare i suoi input non può essere utilizzata affatto.
Cosa scala e cosa no
TwelveLabs inquadra il rilascio come un passaggio da piccoli dataset accuratamente curati verso una pipeline scalabile costruita su esperienza umana reale. L'avvertenza onesta è che la scala nel passaggio di etichettatura non produce automaticamente scala nel passaggio di addestramento.
Anche una pipeline di etichettatura veloce ed economica produce dati che devono ancora essere abbinati ai segnali di tatto e controllo di cui un robot ha bisogno, e devono ancora essere adattati all'incarnazione di una macchina specifica. Pegasus 1.6 rimuove un collo di bottiglia, ovvero il lavoro di etichettatura, e non fa nulla per gli altri. Questo è un contributo utile più che una soluzione completa, e i team che ne beneficiano maggiormente saranno quelli il cui passaggio di etichettatura era il vincolo principale. Se questo descriva la maggior parte dei team di robotica è esattamente la domanda a cui risponderebbero i risultati pubblicati da implementazioni reali.
Articoli correlati
Meta ottiene in licenza la tecnologia di immagini e video di Midjourney, e il motivo è rivelatore
I benchmark si muovono ogni trimestre. Il giudizio di una comunità su ciò che è bello no.
AssemblyAI ha ridotto la latenza del parlato in tempo reale a 91 millisecondi. Ecco perché quel numero conta
Il vincolo sulla voce non è mai stato il tasso di errore di parole. È stato l'alternanza dei turni.
Nano Banana 2.1 di Google è un aggiornamento di funzionalità, non un flagship
Un rilascio di fascia media ti dice cosa un laboratorio pensa che la maggior parte dei suoi utenti abbia davvero bisogno: un segnale più utile di un flagship.
Lo stack degli annunci video si è scisso in specialisti, e Boreal-H3 mostra perché
Qualità cinematografica e capacità di iterazione sono prodotti diversi, e un unico livello di generazione non può eccellere in entrambi.