TwelveLabs Pegasus 1.6 transforme la vidéo à la première personne en données d'entraînement pour robots

Apprendre à un robot à plier le linge commence par quelqu'un qui regarde des heures de séquences de personnes pliant le linge, puis qui note chaque mouvement. TwelveLabs veut supprimer cette seconde tâche.
Le 6 octobre, l'entreprise d'intelligence vidéo a publié Pegasus 1.6, un modèle prenant nativement en charge la vidéo égocentrique. Cela désigne des séquences filmées du point de vue à la première personne de la personne qui effectue le travail, qu'il s'agisse de quelqu'un qui cuisine, assemble des pièces sur une chaîne de production ou pilote un robot à distance.
Pourquoi la vidéo à la première personne pose un problème différent
Les séquences à la première personne comportent des indices spatiaux et des schémas de mouvement différents de ceux des vidéos de caméras fixes en plongée ou à la troisième personne. Elles incluent du flou de mouvement, un éclairage changeant et des objets qui apparaissent et disparaissent au gré des déplacements de la personne qui porte la caméra. Les modèles entraînés sur des données vidéo générales ont tendance à mal les traiter.
Pegasus 1.6 est conçu pour prendre cette entrée désordonnée et en extraire les détails qui comptent pour apprendre à un robot à se déplacer, saisir ou naviguer. Le modèle prend directement en charge cinq flux de travail.
La segmentation et l'étiquetage d'actions génèrent des étiquettes horodatées pour les tâches, les étapes, les objets et les interactions main-objet à partir de vidéos brutes, mappées à une taxonomie propre au domaine. L'étiquetage par légendes denses produit un langage descriptif pour les relations spatiales, le contexte de scène et les interactions main-objet, destiné à entraîner des politiques robotiques conditionnées par le langage. La notation de qualité filtre les clips de faible qualité en évaluant la clarté de l'action, le cadrage et la stabilité avant que les séquences n'atteignent les réviseurs humains. La recherche et la curation font remonter des événements rares et des scénarios à longue traîne dans un vaste référentiel vidéo au moyen de requêtes en langage naturel. Le signalement du consentement et de la conformité détecte les visages, les passants et les données sensibles à l'écran ou sur papier avant que les séquences n'entrent dans les pipelines en aval.
Le calcul de la main-d'œuvre
Le chiffre qui explique le produit est le coût de l'étiquetage manuel. Étiqueter à la main des séquences égocentriques peut prendre de 70 à 155 heures de temps humain pour chaque heure de vidéo. Rapporté à un seul clip de deux heures, un annotateur humain se retrouve face à des semaines de travail pour un seul fichier.
Pegasus 1.6 est livré avec une fenêtre de contexte de 261 120 tokens, suffisamment grande pour traiter des vidéos allant jusqu'à deux heures. L'accès passe par l'API TwelveLabs, facturée 1,75 $ par heure de vidéo, 3 $ par million de tokens d'entrée d'image et 15 $ par million de tokens de sortie, soit le double du tarif de Pegasus 1.5.
Une mise en garde pour les équipes qui planifient de gros volumes : l'analyse par lots est encore assurée par Pegasus 1.5, de sorte que le traitement en masse à grand volume n'est pas encore entièrement passé au nouveau modèle.
La distinction entre comprendre et faire
Le PDG de l'entreprise, Jae Lee, a décrit l'opportunité immédiate comme une infrastructure d'entraînement. Comprendre une action ne représente qu'une partie de son enseignement. Pegasus peut décrire les mouvements des membres et fournir une compréhension approximative des trajectoires, mais il ne fournit pas toutes les informations nécessaires pour les exécuter. La pression, le toucher et le contrôle précis restent des problèmes distincts.
C'est un cadrage honnête de la frontière, et il vaut la peine de s'y tenir. Les équipes de robotique doivent combiner les informations issues de la vidéo avec d'autres données et construire les systèmes qui les traduisent en action. Pegasus se situe en amont, alimentant le processus d'entraînement plutôt que de remplacer la pile robotique.

Lee a donné un indice de l'échelle de traitement, en évoquant une exécution qui a traité l'équivalent d'environ 17 années de séquences à la première personne en environ 18 heures sans qu'aucune vidéo n'échoue. Il n'a pas précisé les ressources informatiques ni les conditions d'évaluation, ce qui en fait une affirmation anecdotique de débit plutôt qu'un benchmark reproductible. Les documents techniques de l'entreprise décrivent des évaluations internes d'identification d'actions et de reconnaissance de la main qui exécute, mais ne fournissent aucun score numérique ni comparaison reproductible avec les concurrents.
Où il se situe face aux alternatives
Le paysage concurrentiel couvre plusieurs parties du pipeline de développement robotique. Cosmos Curator de NVIDIA chevauche directement la préparation des données via le filtrage, l'annotation et la suppression des doublons, et ses outils ouverts offrent aux équipes une alternative à un service géré. L'intégration par Encord de NVIDIA Cosmos Reason 2 et Embed rivalise sur le travail d'annotation et de curation, en générant des étiquettes préliminaires pour révision humaine avec une recherche basée sur le comportement. Gemini Robotics ER 2 de Google chevauche l'interprétation de la vidéo et le suivi de l'avancement des tâches, bien qu'il mette l'accent sur la planification et la coordination, confiant l'exécution motrice à des modèles d'action de niveau inférieur. FLUX-mimic de Black Forest Labs et mimic utilise une fondation de modèle vidéo pour produire des actions robotiques, s'attaquant à l'exécution plutôt qu'à la préparation des données.
Les unités de facturation et les périmètres produits diffèrent d'un outil à l'autre, de sorte que leurs tarifs ne déterminent pas lequel est le moins cher pour une charge de travail donnée. Pegasus facture la vidéo à la durée et la sortie texte au token, ce qui convient aux équipes dont le goulot d'étranglement est l'étiquetage plutôt que la génération d'actions.
Ce que cette publication établit, et ce qu'elle n'établit pas
Pegasus 1.6 concrétise la recherche de TwelveLabs sur la compréhension vidéo, et il cible un véritable goulot d'étranglement. Le chemin entre des séquences humaines brutes et des données d'entraînement robotique utilisables est véritablement lent et coûteux, et automatiser une partie de ce processus compterait pour quiconque construit de l'IA incarnée.
Ce qui reste incertain, c'est de savoir si le modèle offre des résultats nettement meilleurs que les alternatives existantes. Aucun benchmark tiers, aucune comparaison tarifaire sur l'ensemble du secteur, ni résultats clients publiés n'ont accompagné l'annonce. Le prochain élément le plus clair à surveiller est de savoir si les développeurs en robotique publient des résultats d'utilisation de Pegasus 1.6 dans des flux de travail d'étiquetage réels. Ces preuves feraient passer la conversation de l'annonce à l'évaluation, et c'est le seul type de preuve qui tranche une affirmation sur le travail économisé.
Pourquoi la vidéo humaine est la base de la pyramide
La stratégie derrière Pegasus 1.6 repose sur un argument concernant l'origine des connaissances comportementales des robots, et il vaut la peine de l'énoncer clairement.
La majeure partie de ce que les gens savent faire en matière de travail physique n'a jamais été capturée sous une forme exploitable par une machine. Un cuisinier ajuste sa prise sans y penser. Un ouvrier se remet d'un outil échappé en déplaçant son poids et sa portée d'une manière que personne ne note. Ces ajustements font la différence entre un robot qui exécute un mouvement et un robot qui accomplit une tâche.
La vidéo humaine est l'une des sources les plus riches de ces ajustements, et elle est disponible en volume énorme. Le pari est qu'une large base de connaissances comportementales extraites de séquences humaines, adaptée à des robots spécifiques via des démonstrations téléopérées, constitue un chemin plus rapide vers des machines capables que de repartir de zéro pour chaque tâche.
C'est une stratégie de développement plutôt qu'une garantie démontrée, et le PDG l'a dit lui-même. Plus de vidéo ne produit pas automatiquement un robot largement capable, et traduire une action comprise en une action exécutée reste un problème distinct impliquant la force, le toucher et le contrôle.
La dimension du consentement
L'un des cinq flux de travail pris en charge par Pegasus 1.6 mérite d'être mis en avant, car il pointe une question de gouvernance inhérente au domaine. Le signalement du consentement et de la conformité détecte les visages, les passants et les données sensibles à l'écran ou sur papier avant que les séquences n'entrent dans les pipelines en aval.
Cette fonctionnalité existe parce que la vidéo égocentrique est capturée du point de vue d'une personne au travail, et ce cadrage capture plus que la tâche. Il saisit un badge, un écran, un visage en arrière-plan, un document sur un bureau. Pour une équipe de robotique qui collecte des séquences à l'échelle industrielle, l'étape de signalement est ce qui empêche un pipeline d'entraînement d'ingérer du matériel qu'il ne devrait pas.
L'inclusion de ce flux de travail aux côtés de ceux d'étiquetage est une reconnaissance discrète que le pipeline de données comporte une surface de conformité, et que cette surface est difficile à gérer manuellement. Pour les équipes de secteurs réglementés, la capacité de signalement pourrait finir par compter autant que la vitesse d'étiquetage, car un pipeline qui ne peut pas filtrer ses entrées ne peut pas être utilisé du tout.
Ce qui passe à l'échelle, et ce qui ne passe pas
TwelveLabs présente cette publication comme un passage de petits jeux de données soigneusement sélectionnés vers un pipeline évolutif construit sur l'expérience humaine réelle. La mise en garde honnête est que l'échelle à l'étape d'étiquetage ne garantit pas automatiquement l'échelle à l'étape d'entraînement.
Même un pipeline d'étiquetage rapide et bon marché produit des données qui doivent encore être associées aux signaux de toucher et de contrôle dont un robot a besoin, et encore être adaptées à l'incarnation d'une machine spécifique. Pegasus 1.6 élimine un goulot d'étranglement, à savoir le travail d'étiquetage, et ne fait rien pour les autres. C'est une contribution utile plutôt qu'une solution complète, et les équipes qui en bénéficieront le plus seront celles dont l'étape d'étiquetage constituait la contrainte déterminante. Savoir si cela décrit la plupart des équipes de robotique est exactement la question à laquelle des résultats publiés de déploiements réels répondraient.
Articles associés
Meta prend sous licence la technologie d'image et de vidéo de Midjourney, et la raison est révélatrice
Les benchmarks évoluent chaque trimestre. Le jugement d'une communauté sur ce qui est beau, non.
AssemblyAI réduit la latence de la parole en temps réel à 91 millisecondes. Voici pourquoi ce chiffre compte
La contrainte sur la voix n'a jamais été le taux d'erreur de mots. C'est l'alternance des tours de parole.
Nano Banana 2.1 de Google est une mise à jour de fonctionnalités, pas un modèle phare
Une sortie de milieu de gamme vous dit ce qu’un laboratoire pense que la plupart de ses utilisateurs ont réellement besoin, ce qui est un signal plus utile qu’un modèle phare.
La pile publicitaire vidéo s'est scindée en spécialistes, et Boreal-H3 montre pourquoi
La qualité cinématographique et le débit d'itération sont des produits différents, et une seule couche de génération ne peut pas être en tête sur les deux.