← Voltar ao blog
Newscerca de 7 min de leitura

Sete universidades lançam o OpenWAM em código aberto: robôs não precisam apenas “ver”, mas também “prever o próximo segundo”

Publicado 6 de out. de 2026
Sete universidades lançam o OpenWAM em código aberto: robôs não precisam apenas “ver”, mas também “prever o próximo segundo”

No início de outubro, uma equipe de pesquisadores de sete universidades — incluindo a Universidade Nacional de Singapura, a Universidade de Tsinghua e a Universidade de Pequim — publicou o OpenWAM no GitHub e no Hugging Face. O posicionamento do projeto é claro: uma pilha completa de pesquisa em código aberto voltada para World Action Models (WAM), além de um modelo base. O artigo já está no arXiv, número 2609.07398, e o repositório tinha cerca de 940 estrelas em 1º de outubro.

A notícia não demorou a circular na China, mas o que realmente merece uma segunda olhada é o velho problema que ela pretende resolver: não basta que o robô reconheça o que está diante dele.

Simuladores tradicionais calculam física e visão em separado

No passado, para criar políticas de robôs, havia dois caminhos comuns. Um era aprender simultaneamente padrões visuais e sinais de controle diretamente das demonstrações do robô; o outro era fazer primeiro um pré-treinamento com imagens e texto, trazendo conhecimento semântico e linguístico — a rota VLA.

O World Action Model seguiu um terceiro caminho: herdar primeiro, do pré-treinamento em geração de vídeo, o prior de “como o mundo vai mudar”, e depois aprender, por meio de experiência corporificada, “o que fazer nesse mundo”. Parece um desvio, mas evita a velha fissura entre simulação e máquina real. Nos simuladores tradicionais, física e visão costumam ser calculadas separadamente, e o efeito da ação não corresponde à aparência da imagem; a abordagem do OpenWAM é fazer o modelo aprender diretamente dos dados “como a ação muda o mundo” e, a partir disso, prever posições de objetos, semântica de cena e estado da tarefa.

Dividido em três camadas para tornar os experimentos reprodutíveis

A equipe dividiu o problema em três camadas, cada uma correspondendo a um componente.

O OpenWAM-Infra é a infraestrutura modular, que desacopla quatro camadas: modelos componíveis, runtime de treinamento, runtime de implantação e protocolos de avaliação. O papel dessa camada é transformar o World Action Model de uma implementação única e fortemente acoplada em um banco de testes com peças substituíveis.

O OpenWAM-Study é responsável por consolidar princípios de design. Ele não faz modelos; faz experimentos controlados, usando conjuntos de comparações para transformar “que tipo de design funciona” em conclusões reproduzíveis.

O OpenWAM-α é o próprio modelo base, que valida todo o esquema em vídeos humanos em primeira pessoa e dados de robôs em larga escala.

Três princípios de design, cada um com números de comparação

O maior medo nesse tipo de artigo é que seja tudo slogan. As três conclusões apresentadas pelo OpenWAM vêm todas acompanhadas de experimentos comparativos.

Primeiro: é preciso um prior generativo de mundo suficientemente forte. O backbone de vídeo de 14B alcançou 93,79%, enquanto o de 1,3B chegou a apenas 90,14%; a configuração padrão escolheu o de 5B, apenas 1,4 ponto percentual abaixo do de 14B. Combinado com o espaço latente visual compacto comprimido pelo DINOv3 e pelo S-VAE, o resultado fica próximo do VAE nativo do Wan2.2.

Segundo: durante o treinamento é preciso estabelecer um fluxo de informação claro do mundo para a ação. Deixar “o fluxo de ação ver o fluxo de mundo” resultou em 92,39% de acurácia; trocar por uma máscara isolada deu apenas 87,41%, uma diferença de 5 pontos percentuais. Na inferência, a remoção conjunta e sincronizada de ruído apresenta o melhor resultado.

Terceiro: os dados devem ser usados conforme a fonte. Os dados de robôs são responsáveis por preservar o grounding das ações, os vídeos humanos em primeira pessoa por ampliar a cobertura do mundo, e o treinamento colaborativo de estágio único integra os dois. Curiosamente, o ganho dentro do domínio de pré-treinamento foi limitado, mas a taxa de sucesso fora da distribuição (OOD) subiu de 14,50% para 26,62%.

As especificações reais do modelo base

O OpenWAM-α é composto por duas partes: o Wan2.2-TI2V-5B como fluxo de vídeo, com um DiT de ação de 1B acoplado. O espaço de ação é unificado em 80 dimensões, compatível com 17 plataformas físicas. Os dados de pré-treinamento somam 14.300 horas, das quais 30% são vídeos humanos em primeira pessoa, 30% dados sintéticos e 40% dados reais.

Uma folha em branco de registro de experimentos sobre uma bancada de marcenaria clara, ao lado de três componentes de juntas metálicas polidas dispostos lado a lado

Em velocidade de inferência, um único bloco de ação leva 170 milissegundos em uma RTX 5090. A avaliação cobre 8 benchmarks de simulação, como LIBERO, RoboTwin2.0 e RoboDojo, com morfologias que vão de braço único e braços duplos até manipulação móvel e mãos hábeis. No item de braços duplos móveis do EBench, ele é atualmente o melhor, liderando o segundo colocado por cerca de 4 pontos percentuais. A validação em máquina real usou um braço único Franka em seis tarefas, com taxa média de sucesso de 82,5%, acima dos 77,5% do LingBot-VA e dos 55,0% do π0.5, com duas tarefas atingindo 100%. Trocando por uma mão hábil não vista no treinamento, após o fine-tuning ele também supera o π0.5 em todos os aspectos.

Ele não declara o fim do VLA

Há um trecho de conclusão no artigo que vale destacar separadamente: o WAM, ao usar variáveis latentes de vídeo futuro como supervisão, se encaixa melhor dentro da distribuição; o VLA é mais robusto sob perturbações fora da distribuição. A disputa entre os dois ainda não está decidida.

Essa frase é bem mais honesta do que “um paradigma morreu”. Quem lê o artigo tende a lembrar apenas das pontuações, mas o que deveria ficar é esta frase: as duas rotas hoje têm suas vantagens, e ainda não chegou o momento de bater o martelo.

A barreira foi rebaixada um degrau

Visto em um contexto mais amplo, nessa linha dos world models, o Gemini Robotics 2, do Google, proclamou “um cérebro, aplicável a qualquer robô”, e Jim Fan, da Nvidia, lançou “o VLA morreu, o World Action Model é o que vale”. Em 3 de outubro, a Nvidia ampliou sua pilha aberta de IA física, liberando o world model Cosmos, o Isaac Lab Arena, o Alpamayo de direção autônoma, a ferramenta de orquestração OSMO e a biblioteca OpenUSD, com Caterpillar, LEM Surgical e Neura Robotics entre os primeiros usuários. Em 4 de outubro, vários robôs humanoides da Yunshenchu Technology, de Hangzhou, Zhejiang, foram às ruas para testar controle de tráfego em cruzamentos e atendimento a turistas, rodando até na chuva.

Com essa densidade, universidades abrirem a pilha completa em código aberto equivale a rebaixar um degrau a barreira de entrada para essa direção, e também torna “aprender o mundo com vídeo, aprender ações com trajetórias” uma rota mais pública.

Ele não serve para implantação direta

É preciso deixar claro que o OpenWAM é posicionado como infraestrutura de pesquisa, não como um produto pronto para uso. O README oficial recomenda preparar cerca de 640 GB de dados de treinamento, com ambiente em torno de 6,5 GB, e o repositório ainda passa por mudanças ativas. Ele serve para equipes que já têm GPU e dados e querem fazer pesquisa em World Action Models sobre essa base; não é adequado para cenários de implementação em pequena escala.

Os pontos de observação futuros também são concretos: qual será a taxa de reprodução, quantas pessoas ainda estarão enviando melhorias daqui a seis meses, e se alguma equipe realmente o ajustará finamente para dentro de uma linha de produto. A popularidade do dia do lançamento vai passar; o que fica é o código que continua sendo usado.

Artigos relacionados