Sete universidades lançam o OpenWAM em código aberto: robôs não precisam apenas “ver”, mas também “prever o próximo segundo”

No início de outubro, uma equipe de pesquisadores de sete universidades — incluindo a Universidade Nacional de Singapura, a Universidade de Tsinghua e a Universidade de Pequim — publicou o OpenWAM no GitHub e no Hugging Face. O posicionamento do projeto é claro: uma pilha completa de pesquisa em código aberto voltada para World Action Models (WAM), além de um modelo base. O artigo já está no arXiv, número 2609.07398, e o repositório tinha cerca de 940 estrelas em 1º de outubro.
A notícia não demorou a circular na China, mas o que realmente merece uma segunda olhada é o velho problema que ela pretende resolver: não basta que o robô reconheça o que está diante dele.
Simuladores tradicionais calculam física e visão em separado
No passado, para criar políticas de robôs, havia dois caminhos comuns. Um era aprender simultaneamente padrões visuais e sinais de controle diretamente das demonstrações do robô; o outro era fazer primeiro um pré-treinamento com imagens e texto, trazendo conhecimento semântico e linguístico — a rota VLA.
O World Action Model seguiu um terceiro caminho: herdar primeiro, do pré-treinamento em geração de vídeo, o prior de “como o mundo vai mudar”, e depois aprender, por meio de experiência corporificada, “o que fazer nesse mundo”. Parece um desvio, mas evita a velha fissura entre simulação e máquina real. Nos simuladores tradicionais, física e visão costumam ser calculadas separadamente, e o efeito da ação não corresponde à aparência da imagem; a abordagem do OpenWAM é fazer o modelo aprender diretamente dos dados “como a ação muda o mundo” e, a partir disso, prever posições de objetos, semântica de cena e estado da tarefa.
Dividido em três camadas para tornar os experimentos reprodutíveis
A equipe dividiu o problema em três camadas, cada uma correspondendo a um componente.
O OpenWAM-Infra é a infraestrutura modular, que desacopla quatro camadas: modelos componíveis, runtime de treinamento, runtime de implantação e protocolos de avaliação. O papel dessa camada é transformar o World Action Model de uma implementação única e fortemente acoplada em um banco de testes com peças substituíveis.
O OpenWAM-Study é responsável por consolidar princípios de design. Ele não faz modelos; faz experimentos controlados, usando conjuntos de comparações para transformar “que tipo de design funciona” em conclusões reproduzíveis.
O OpenWAM-α é o próprio modelo base, que valida todo o esquema em vídeos humanos em primeira pessoa e dados de robôs em larga escala.
Três princípios de design, cada um com números de comparação
O maior medo nesse tipo de artigo é que seja tudo slogan. As três conclusões apresentadas pelo OpenWAM vêm todas acompanhadas de experimentos comparativos.
Primeiro: é preciso um prior generativo de mundo suficientemente forte. O backbone de vídeo de 14B alcançou 93,79%, enquanto o de 1,3B chegou a apenas 90,14%; a configuração padrão escolheu o de 5B, apenas 1,4 ponto percentual abaixo do de 14B. Combinado com o espaço latente visual compacto comprimido pelo DINOv3 e pelo S-VAE, o resultado fica próximo do VAE nativo do Wan2.2.
Segundo: durante o treinamento é preciso estabelecer um fluxo de informação claro do mundo para a ação. Deixar “o fluxo de ação ver o fluxo de mundo” resultou em 92,39% de acurácia; trocar por uma máscara isolada deu apenas 87,41%, uma diferença de 5 pontos percentuais. Na inferência, a remoção conjunta e sincronizada de ruído apresenta o melhor resultado.
Terceiro: os dados devem ser usados conforme a fonte. Os dados de robôs são responsáveis por preservar o grounding das ações, os vídeos humanos em primeira pessoa por ampliar a cobertura do mundo, e o treinamento colaborativo de estágio único integra os dois. Curiosamente, o ganho dentro do domínio de pré-treinamento foi limitado, mas a taxa de sucesso fora da distribuição (OOD) subiu de 14,50% para 26,62%.
As especificações reais do modelo base
O OpenWAM-α é composto por duas partes: o Wan2.2-TI2V-5B como fluxo de vídeo, com um DiT de ação de 1B acoplado. O espaço de ação é unificado em 80 dimensões, compatível com 17 plataformas físicas. Os dados de pré-treinamento somam 14.300 horas, das quais 30% são vídeos humanos em primeira pessoa, 30% dados sintéticos e 40% dados reais.

Em velocidade de inferência, um único bloco de ação leva 170 milissegundos em uma RTX 5090. A avaliação cobre 8 benchmarks de simulação, como LIBERO, RoboTwin2.0 e RoboDojo, com morfologias que vão de braço único e braços duplos até manipulação móvel e mãos hábeis. No item de braços duplos móveis do EBench, ele é atualmente o melhor, liderando o segundo colocado por cerca de 4 pontos percentuais. A validação em máquina real usou um braço único Franka em seis tarefas, com taxa média de sucesso de 82,5%, acima dos 77,5% do LingBot-VA e dos 55,0% do π0.5, com duas tarefas atingindo 100%. Trocando por uma mão hábil não vista no treinamento, após o fine-tuning ele também supera o π0.5 em todos os aspectos.
Ele não declara o fim do VLA
Há um trecho de conclusão no artigo que vale destacar separadamente: o WAM, ao usar variáveis latentes de vídeo futuro como supervisão, se encaixa melhor dentro da distribuição; o VLA é mais robusto sob perturbações fora da distribuição. A disputa entre os dois ainda não está decidida.
Essa frase é bem mais honesta do que “um paradigma morreu”. Quem lê o artigo tende a lembrar apenas das pontuações, mas o que deveria ficar é esta frase: as duas rotas hoje têm suas vantagens, e ainda não chegou o momento de bater o martelo.
A barreira foi rebaixada um degrau
Visto em um contexto mais amplo, nessa linha dos world models, o Gemini Robotics 2, do Google, proclamou “um cérebro, aplicável a qualquer robô”, e Jim Fan, da Nvidia, lançou “o VLA morreu, o World Action Model é o que vale”. Em 3 de outubro, a Nvidia ampliou sua pilha aberta de IA física, liberando o world model Cosmos, o Isaac Lab Arena, o Alpamayo de direção autônoma, a ferramenta de orquestração OSMO e a biblioteca OpenUSD, com Caterpillar, LEM Surgical e Neura Robotics entre os primeiros usuários. Em 4 de outubro, vários robôs humanoides da Yunshenchu Technology, de Hangzhou, Zhejiang, foram às ruas para testar controle de tráfego em cruzamentos e atendimento a turistas, rodando até na chuva.
Com essa densidade, universidades abrirem a pilha completa em código aberto equivale a rebaixar um degrau a barreira de entrada para essa direção, e também torna “aprender o mundo com vídeo, aprender ações com trajetórias” uma rota mais pública.
Ele não serve para implantação direta
É preciso deixar claro que o OpenWAM é posicionado como infraestrutura de pesquisa, não como um produto pronto para uso. O README oficial recomenda preparar cerca de 640 GB de dados de treinamento, com ambiente em torno de 6,5 GB, e o repositório ainda passa por mudanças ativas. Ele serve para equipes que já têm GPU e dados e querem fazer pesquisa em World Action Models sobre essa base; não é adequado para cenários de implementação em pequena escala.
Os pontos de observação futuros também são concretos: qual será a taxa de reprodução, quantas pessoas ainda estarão enviando melhorias daqui a seis meses, e se alguma equipe realmente o ajustará finamente para dentro de uma linha de produto. A popularidade do dia do lançamento vai passar; o que fica é o código que continua sendo usado.
Artigos relacionados
Uma juíza federal chamou a rede de leitura de placas da Flock de “vigilância em massa indiscriminada”
Um único avistamento de um carro revela pouco. Um mês de avistamentos agregados de muitas agências revela uma vida.
Procuradores federais dizem que US$ 300 milhões em servidores Nvidia foram para a China via Malásia
Casos de fiscalização medem o fluxo em vez de detê-lo, e a rota de trânsito é a parte que a política ainda não resolveu.
Supabase comprou a Turso porque agentes precisam de um banco de dados por tarefa
Um banco de dados por agente só faz sentido quando a menor unidade de armazenamento fica barata o suficiente para ser distribuída como um token de sessão.
Atores conseguiram um contrato que regula suas réplicas digitais. A parte difícil é a aplicação.
Um contrato pode definir o que é uma réplica digital. Provar que uma foi feita sem consentimento é um problema diferente.