← Voltar ao blog
Aicerca de 9 min de leitura

TwelveLabs Pegasus 1.6 transforma vídeo em primeira pessoa em dados de treinamento para robôs

Publicado 7 de out. de 2026
TwelveLabs Pegasus 1.6 transforma vídeo em primeira pessoa em dados de treinamento para robôs

Ensinar um robô a dobrar roupa começa com alguém assistindo a horas de filmagens de humanos dobrando roupa e depois anotando cada movimento. A TwelveLabs quer tirar essa segunda tarefa da equação.

Em 6 de outubro, a empresa de inteligência de vídeo lançou o Pegasus 1.6, um modelo com suporte nativo a vídeo egocêntrico. Ou seja, filmagens feitas do ponto de vista em primeira pessoa da pessoa que realiza o trabalho, seja alguém cozinhando, montando peças em uma linha de fábrica ou operando um robô remotamente.

Por que vídeo em primeira pessoa é um problema diferente

Filmagens em primeira pessoa carregam pistas espaciais e padrões de movimento diferentes de vídeos de câmeras fixas no teto ou em terceira pessoa. Elas incluem desfoque de movimento, iluminação variável e objetos que aparecem e desaparecem conforme quem usa a câmera se move. Modelos treinados com dados de vídeo gerais tendem a lidar mal com isso.

O Pegasus 1.6 foi criado para receber essa entrada desorganizada e extrair os detalhes que importam para ensinar um robô a se mover, agarrar ou navegar. O modelo oferece suporte direto a cinco fluxos de trabalho.

Segmentação e rotulagem de ações gera rótulos com carimbo de data/hora para tarefas, etapas, objetos e interações mão-objeto a partir de vídeo bruto, mapeados para uma taxonomia específica do domínio. A rotulagem com legendas densas produz linguagem descritiva para relações espaciais, contexto da cena e interações mão-objeto, voltada ao treinamento de políticas robóticas condicionadas por linguagem. A pontuação de qualidade filtra clipes de baixa qualidade ao avaliar clareza da ação, enquadramento e estabilidade antes que as filmagens cheguem aos revisores humanos. Busca e curadoria revelam eventos raros e cenários de cauda longa em um grande repositório de vídeos por meio de consultas em linguagem natural. Sinalização de consentimento e conformidade detecta rostos, transeuntes e dados sensíveis na tela ou em papel antes que as filmagens entrem nos pipelines a jusante.

A matemática da mão de obra

O número que explica o produto é o custo da rotulagem manual. Rotular filmagens egocêntricas à mão pode levar de 70 a 155 horas de tempo humano para cada hora de vídeo. Faça as contas para um único clipe de duas horas e um anotador humano está diante de semanas de trabalho para um arquivo.

O Pegasus 1.6 vem com uma janela de contexto de 261.120 tokens, grande o suficiente para processar vídeos de até duas horas. O acesso é feito pela API da TwelveLabs, com preço de US$ 1,75 por hora de vídeo, US$ 3 por milhão de tokens de entrada de imagem e US$ 15 por milhão de tokens de saída, o dobro da tarifa do Pegasus 1.5.

Uma ressalva para equipes que planejam grandes trabalhos: a análise em lote ainda é feita pelo Pegasus 1.5, então o processamento em massa de alto volume ainda não migrou totalmente para o novo modelo.

A distinção entre entender e fazer

O CEO da empresa, Jae Lee, descreveu a oportunidade imediata como infraestrutura de treinamento. Entender uma ação é apenas parte de ensiná-la. O Pegasus consegue descrever movimentos de membros e fornecer um entendimento aproximado de trajetórias, mas não fornece todas as informações necessárias para executá-las. Pressão, toque e controle preciso continuam sendo problemas à parte.

Esse é um enquadramento honesto do limite, e vale a pena guardá-lo. Equipes de robótica precisam combinar informações derivadas de vídeo com outros dados e construir os sistemas que as traduzem em ação. O Pegasus fica a montante, alimentando o processo de treinamento em vez de substituir a pilha de robótica.

Uma garra robótica de alumínio escovado se aproximando de um cubo de cerâmica branco liso sobre uma superfície cinza-clara

Lee deu uma indicação da escala de processamento, lembrando de uma execução que processou o equivalente a cerca de 17 anos de filmagens em primeira pessoa em aproximadamente 18 horas sem nenhum vídeo com falha. Ele não especificou os recursos computacionais nem as condições de avaliação, o que torna isso uma alegação anedótica de capacidade de processamento, e não um benchmark reproduzível. Os materiais técnicos da empresa descrevem avaliações internas de identificação de ações e reconhecimento da mão executora, mas não fornecem pontuações numéricas nem comparação reproduzível com concorrentes.

Onde ele se posiciona em relação às alternativas

O campo competitivo abrange várias partes do pipeline de desenvolvimento de robótica. O Cosmos Curator, da NVIDIA, tem sobreposição direta na preparação de dados por meio de filtragem, anotação e remoção de duplicatas, e seu ferramental aberto dá às equipes uma alternativa a um serviço gerenciado. A integração do Encord com o NVIDIA Cosmos Reason 2 e o Embed compete pelo trabalho de anotação e curadoria, gerando rótulos preliminares para revisão humana com busca baseada em comportamento. O Gemini Robotics ER 2, do Google, tem sobreposição na interpretação de vídeo e no acompanhamento do progresso de tarefas, embora enfatize planejamento e coordenação, deixando a execução motora para modelos de ação de nível inferior. O FLUX-mimic, da Black Forest Labs e da mimic, usa uma base de modelo de vídeo para produzir ações de robô, abordando a execução em vez da preparação de dados.

As unidades de cobrança e os escopos dos produtos diferem entre essas ferramentas, então suas tarifas não definem qual é a mais barata para uma determinada carga de trabalho. O Pegasus cobra por duração de vídeo e por tokens de saída de texto, o que atende equipes cujo gargalo é a rotulagem, e não a geração de ações.

O que o lançamento estabelece e o que não estabelece

O Pegasus 1.6 coloca um produto concreto por trás da pesquisa de compreensão de vídeo da TwelveLabs e ataca um gargalo real. O caminho de filmagens humanas brutas até dados de treinamento de robôs utilizáveis é genuinamente lento e caro, e automatizar parte dele seria importante para qualquer pessoa que esteja construindo IA incorporada.

O que permanece em aberto é se o modelo entrega resultados significativamente melhores do que as alternativas existentes. Nenhum benchmark de terceiros, comparação de preços em todo o campo ou resultado de cliente publicado acompanhou o anúncio. A coisa mais clara a observar a seguir é se desenvolvedores de robótica publicarão resultados do uso do Pegasus 1.6 em fluxos de trabalho reais de rotulagem. Essa evidência moveria a conversa de anúncio para avaliação, e é o único tipo que resolve uma alegação sobre mão de obra economizada.

Por que o vídeo humano é a base da pirâmide

A estratégia por trás do Pegasus 1.6 se baseia em um argumento sobre de onde vem o conhecimento comportamental dos robôs, e vale a pena expô-lo claramente.

A maior parte do que as pessoas sabem sobre realizar trabalho físico nunca foi capturada em um formato do qual uma máquina possa aprender. Um cozinheiro ajusta a pegada sem pensar. Um trabalhador se recupera de uma ferramenta caída deslocando o peso e o alcance de um jeito que ninguém anota. Esses ajustes são a diferença entre um robô que executa um movimento e um robô que conclui uma tarefa.

O vídeo humano é uma das fontes mais ricas desses ajustes, e está disponível em volume enorme. A aposta é que uma base ampla de conhecimento comportamental extraída de filmagens humanas, adaptada a robôs específicos por meio de demonstrações teleoperadas, é um caminho mais rápido para máquinas capazes do que começar do zero para cada tarefa.

Isso é uma estratégia de desenvolvimento, e não uma garantia demonstrada, e o CEO disse exatamente isso. Mais vídeo não produz automaticamente um robô amplamente capaz, e traduzir uma ação entendida em uma ação executada continua sendo um problema separado que envolve força, toque e controle.

A dimensão do consentimento

Um dos cinco fluxos de trabalho compatíveis com o Pegasus 1.6 merece destaque, porque aponta para uma questão de governança que acompanha esse território. A sinalização de consentimento e conformidade detecta rostos, transeuntes e dados sensíveis na tela ou em papel antes que as filmagens entrem nos pipelines a jusante.

Esse recurso existe porque o vídeo egocêntrico é capturado da perspectiva de uma pessoa trabalhando, e esse enquadramento captura mais do que a tarefa. Ele pega um crachá, uma tela, um rosto no fundo, um documento sobre a mesa. Para uma equipe de robótica que coleta filmagens em escala industrial, a etapa de sinalização é o que impede um pipeline de treinamento de ingerir material que não deveria.

A inclusão desse fluxo de trabalho ao lado dos de rotulagem é um reconhecimento discreto de que o pipeline de dados tem uma superfície de conformidade, e que essa superfície é difícil de gerenciar manualmente. Para equipes de setores regulados, a capacidade de sinalização pode acabar importando tanto quanto a velocidade de rotulagem, porque um pipeline que não consegue triar suas entradas não pode ser usado de forma alguma.

O que escala e o que não escala

A TwelveLabs enquadra o lançamento como um movimento de pequenos conjuntos de dados cuidadosamente curados para um pipeline escalável construído sobre experiência humana real. A ressalva honesta é que escala na etapa de rotulagem não entrega automaticamente escala na etapa de treinamento.

Mesmo um pipeline de rotulagem rápido e barato produz dados que ainda precisam ser combinados com os sinais de toque e controle de que um robô necessita, e ainda precisam ser adaptados à corporificação de uma máquina específica. O Pegasus 1.6 remove um gargalo, que é a mão de obra de rotulagem, e não faz nada quanto aos outros. Essa é uma contribuição útil, e não uma solução completa, e as equipes que mais se beneficiarão serão aquelas cuja etapa de rotulagem era a restrição limitante. Se isso descreve a maioria das equipes de robótica é exatamente a pergunta que resultados publicados de implantações reais responderiam.

Artigos relacionados