← Volver al blog
Aiaprox. 9 min de lectura

TwelveLabs Pegasus 1.6 convierte el video en primera persona en datos de entrenamiento para robots

Publicado 7 oct 2026
TwelveLabs Pegasus 1.6 convierte el video en primera persona en datos de entrenamiento para robots

Enseñar a un robot a doblar la ropa comienza con alguien viendo horas de metraje de personas doblando ropa y luego anotando cada movimiento. TwelveLabs quiere eliminar esa segunda tarea.

El 6 de octubre, la empresa de inteligencia de video lanzó Pegasus 1.6, un modelo con soporte nativo para video egocéntrico. Eso significa metraje filmado desde el punto de vista en primera persona de quien realiza el trabajo, ya sea alguien cocinando, ensamblando piezas en una línea de fábrica u operando un robot de forma remota.

Por qué el video en primera persona es un problema distinto

El metraje en primera persona conlleva señales espaciales y patrones de movimiento distintos de los del video de cámara fija cenital o en tercera persona. Incluye desenfoque de movimiento, iluminación cambiante y objetos que aparecen y desaparecen a medida que la persona se mueve. Los modelos entrenados con datos de video general suelen manejarlo mal.

Pegasus 1.6 está diseñado para tomar esa entrada desordenada y extraer los detalles que importan para enseñar a un robot a moverse, agarrar o navegar. El modelo admite cinco flujos de trabajo directamente.

La segmentación y etiquetado de acciones genera etiquetas con marcas de tiempo para tareas, pasos, objetos e interacciones mano-objeto a partir de video sin procesar, mapeadas a una taxonomía específica del dominio. El etiquetado con descripciones densas produce lenguaje descriptivo para relaciones espaciales, contexto de escena e interacciones mano-objeto, orientado a entrenar políticas robóticas condicionadas por lenguaje. La puntuación de calidad filtra clips de baja calidad evaluando la claridad de la acción, el encuadre y la estabilidad antes de que el metraje llegue a revisores humanos. La búsqueda y curación sacan a la superficie eventos raros y escenarios de cola larga en un gran repositorio de video mediante consultas en lenguaje natural. El marcado de consentimiento y cumplimiento detecta rostros, transeúntes y datos sensibles en pantalla o en papel antes de que el metraje entre en los flujos posteriores.

El cálculo de la mano de obra

La cifra que explica el producto es el costo del etiquetado manual. Etiquetar metraje egocéntrico a mano puede llevar de 70 a 155 horas de tiempo humano por cada hora de video. Si se aplica a un solo clip de dos horas, un anotador humano tiene por delante semanas de trabajo para un único archivo.

Pegasus 1.6 viene con una ventana de contexto de 261,120 tokens, lo bastante grande para procesar videos de hasta dos horas de duración. El acceso se realiza a través de la API de TwelveLabs, con un precio de $1.75 por hora de video, $3 por millón de tokens de entrada de imagen y $15 por millón de tokens de salida, el doble de la tarifa de Pegasus 1.5.

Una advertencia para los equipos que planean trabajos grandes: el análisis por lotes todavía lo maneja Pegasus 1.5, por lo que el procesamiento masivo de gran volumen aún no se ha trasladado por completo al nuevo modelo.

La distinción entre comprender y hacer

El CEO de la empresa, Jae Lee, describió la oportunidad inmediata como infraestructura de entrenamiento. Comprender una acción es solo parte de enseñarla. Pegasus puede describir movimientos de extremidades y ofrecer una comprensión aproximada de las trayectorias, pero no proporciona toda la información necesaria para ejecutarlas. La presión, el tacto y el control preciso siguen siendo problemas aparte.

Esa es una delimitación honesta de la frontera, y vale la pena tenerla presente. Los equipos de robótica deben combinar la información derivada del video con otros datos y construir los sistemas que la traduzcan en acción. Pegasus se sitúa aguas arriba, alimentando el proceso de entrenamiento en lugar de reemplazar la pila de robótica.

Una pinza robótica de aluminio cepillado acercándose a un cubo cerámico blanco liso sobre una superficie gris pálida

Lee ofreció una indicación de la escala de procesamiento, al recordar una ejecución que manejó aproximadamente el equivalente a 17 años de metraje en primera persona en unas 18 horas sin un solo video fallido. No especificó los recursos de cómputo ni las condiciones de evaluación, lo que convierte eso en una afirmación anecdótica de rendimiento más que en un punto de referencia reproducible. Los materiales técnicos de la empresa describen evaluaciones internas de identificación de acciones y reconocimiento de la mano que las ejecuta, pero no aportan puntuaciones numéricas ni comparaciones reproducibles con competidores.

Dónde se sitúa frente a las alternativas

El campo competitivo abarca varias partes del pipeline de desarrollo de robótica. Cosmos Curator de NVIDIA se solapa directamente en la preparación de datos mediante filtrado, anotación y eliminación de duplicados, y su conjunto de herramientas abierto ofrece a los equipos una alternativa a un servicio gestionado. La integración de Encord con NVIDIA Cosmos Reason 2 y Embed compite por el trabajo de anotación y curación, generando etiquetas preliminares para revisión humana con búsqueda basada en comportamiento. Gemini Robotics ER 2 de Google se solapa en la interpretación de video y el seguimiento del progreso de tareas, aunque enfatiza la planificación y coordinación, dejando la ejecución motora a modelos de acción de nivel inferior. FLUX-mimic de Black Forest Labs y mimic utiliza una base de modelo de video para producir acciones de robot, abordando la ejecución en lugar de la preparación de datos.

Las unidades de facturación y los alcances de producto difieren entre estas herramientas, por lo que sus tarifas no determinan cuál es la más barata para una carga de trabajo dada. Pegasus factura el video por duración y la salida de texto por tokens, lo que conviene a equipos cuyo cuello de botella es el etiquetado y no la generación de acciones.

Lo que el lanzamiento establece y lo que no

Pegasus 1.6 pone un producto concreto detrás de la investigación de comprensión de video de TwelveLabs, y apunta a un cuello de botella real. El camino desde metraje humano sin procesar hasta datos utilizables para entrenamiento de robots es genuinamente lento y costoso, y automatizar parte de él importaría a cualquiera que construya IA encarnada.

Lo que queda por resolver es si el modelo ofrece resultados significativamente mejores que las alternativas existentes. Ningún benchmark de terceros, comparación de precios de todo el campo ni resultados de clientes publicados acompañaron el anuncio. Lo más claro que hay que observar a continuación es si los desarrolladores de robótica publican resultados del uso de Pegasus 1.6 en flujos de trabajo de etiquetado reales. Esa evidencia trasladaría la conversación del anuncio a la evaluación, y es el único tipo que zanja una afirmación sobre el trabajo ahorrado.

Por qué el video humano es la base de la pirámide

La estrategia detrás de Pegasus 1.6 se basa en un argumento sobre de dónde proviene el conocimiento conductual de los robots, y vale la pena exponerlo con claridad.

La mayor parte de lo que las personas saben sobre realizar trabajo físico nunca se ha capturado en una forma de la que una máquina pueda aprender. Un cocinero ajusta un agarre sin pensar. Un trabajador se recupera de una herramienta caída desplazando el peso y el alcance de una manera que nadie anota. Estos ajustes son la diferencia entre un robot que ejecuta un movimiento y un robot que completa una tarea.

El video humano es una de las fuentes más ricas de esos ajustes, y está disponible en un volumen enorme. La apuesta es que una base amplia de conocimiento conductual extraído de metraje humano, adaptado a robots específicos mediante demostraciones teleoperadas, es un camino más rápido hacia máquinas capaces que empezar desde cero para cada tarea.

Esa es una estrategia de desarrollo más que una garantía demostrada, y el CEO dijo exactamente eso. Más video no produce automáticamente un robot ampliamente capaz, y traducir una acción comprendida en una ejecutada sigue siendo un problema aparte que involucra fuerza, tacto y control.

La dimensión del consentimiento

Uno de los cinco flujos de trabajo que admite Pegasus 1.6 merece destacarse, porque apunta a una cuestión de gobernanza que viene con el territorio. El marcado de consentimiento y cumplimiento detecta rostros, transeúntes y datos sensibles en pantalla o en papel antes de que el metraje entre en los flujos posteriores.

Esa función existe porque el video egocéntrico se captura desde la perspectiva de una persona en el trabajo, y ese encuadre captura más que la tarea. Capta una credencial, una pantalla, un rostro en el fondo, un documento sobre un escritorio. Para un equipo de robótica que recopila metraje a escala industrial, el paso de marcado es lo que evita que un pipeline de entrenamiento ingiera material que no debería.

La inclusión de ese flujo de trabajo junto a los de etiquetado es un reconocimiento silencioso de que el pipeline de datos tiene una superficie de cumplimiento, y de que esa superficie es difícil de gestionar a mano. Para los equipos de industrias reguladas, la capacidad de marcado puede terminar importando tanto como la velocidad de etiquetado, porque un pipeline que no puede filtrar sus entradas no puede usarse en absoluto.

Lo que escala y lo que no

TwelveLabs enmarca el lanzamiento como un paso de conjuntos de datos pequeños y cuidadosamente curados hacia un pipeline escalable construido sobre experiencia humana real. La advertencia honesta es que la escala en el paso de etiquetado no entrega automáticamente escala en el paso de entrenamiento.

Incluso un pipeline de etiquetado rápido y barato produce datos que aún deben combinarse con las señales de tacto y control que necesita un robot, y aún deben adaptarse a la encarnación de una máquina específica. Pegasus 1.6 elimina un cuello de botella, el de la mano de obra de etiquetado, y no hace nada con los demás. Esa es una contribución útil más que una solución completa, y los equipos que más se beneficien serán aquellos cuyo paso de etiquetado era el factor limitante. Si eso describe a la mayoría de los equipos de robótica es exactamente la pregunta que responderían los resultados publicados de despliegues reales.

Artículos relacionados