Sept universités unissent leurs forces pour open-sourcer OpenWAM : un robot ne doit pas seulement « voir », il doit aussi « anticiper la seconde suivante »

Début octobre, une équipe composée de chercheurs de sept universités, dont l'Université nationale de Singapour, l'Université Tsinghua et l'Université de Pékin, a mis OpenWAM en ligne sur GitHub et Hugging Face. Le positionnement du projet est clair : une stack complète de recherche open source dédiée aux modèles d'action du monde (World Action Model, WAM), avec en plus un modèle de base. L'article est déjà sur arXiv, sous le numéro 2609.07398, et le dépôt comptait environ 940 étoiles au 1er octobre.
L'information n'a pas mis longtemps à circuler en Chine, mais ce qui mérite vraiment qu'on s'y attarde, c'est le vieux problème qu'elle cherche à résoudre : pour un robot, il ne suffit pas d'identifier ce qu'il a sous les yeux.
Les simulateurs traditionnels calculent la physique et la vision séparément
Par le passé, pour concevoir des politiques robotiques, deux voies étaient courantes. La première consistait à apprendre simultanément les régularités visuelles et les signaux de contrôle directement à partir de démonstrations robotiques ; la seconde passait d'abord par un pré-entraînement image-texte pour y injecter des connaissances sémantiques et linguistiques : c'est la voie VLA.
Le modèle d'action du monde emprunte une troisième voie : hériter d'abord, via le pré-entraînement à la génération vidéo, d'un a priori sur « comment le monde va évoluer », puis apprendre par l'expérience incarnée « quoi faire dans ce monde ». Cela peut sembler un détour, mais cette approche évite l'ancienne fracture entre simulation et robot réel. Dans les simulateurs traditionnels, physique et vision sont souvent calculées séparément, si bien que l'effet d'une action et le rendu visuel ne concordent pas ; OpenWAM fait plutôt apprendre directement au modèle, à partir des données, « comment une action modifie le monde », avant de prédire sur cette base la position des objets, la sémantique de la scène et l'état de la tâche.
Trois couches pour rendre les expériences reproductibles
L'équipe a décomposé le problème en trois couches, chacune correspondant à un composant.
OpenWAM-Infra est une infrastructure modulaire qui découple quatre niveaux : les modèles composables, le runtime d'entraînement, le runtime de déploiement et les protocoles d'évaluation. Cette couche transforme le modèle d'action du monde, d'une implémentation unique fortement couplée, en une plateforme d'expérimentation dont on peut remplacer les pièces.
OpenWAM-Study se charge de capitaliser les principes de conception. Il ne produit pas de modèle : il mène des expériences contrôlées et transforme, par une série de comparaisons, la question « quel design est efficace » en conclusions reproductibles.
OpenWAM-α est le modèle de base lui-même, qui valide l'ensemble de l'approche sur des vidéos à la première personne humaines à grande échelle et des données robotiques.
Trois principes de conception, chacun accompagné de chiffres comparatifs
Ce type d'article craint par-dessus tout de n'être qu'une suite de slogans. Les trois conclusions d'OpenWAM sont toutes accompagnées d'expériences comparatives.
Premièrement, il faut un a priori génératif du monde suffisamment fort. Le backbone vidéo 14B atteint 93,79 %, contre 90,14 % pour le 1,3B ; la configuration par défaut retient le 5B, soit seulement 1,4 point de moins que le 14B. Associé à un espace latent visuel compact compressé par DINOv3 et S-VAE, le résultat est proche de celui du VAE intégré à Wan2.2.
Deuxièmement, l'entraînement doit établir un flux d'information explicite du monde vers l'action. Lorsque « le flux d'action voit le flux du monde », la précision atteint 92,39 % ; avec un masque isolé, elle tombe à 87,41 %, soit un écart de 5 points entiers. À l'inférence, le débruitage conjoint synchronisé donne les meilleurs résultats.
Troisièmement, les données doivent être utilisées selon leur source. Les données robotiques servent à préserver l'ancrage des actions, les vidéos humaines à la première personne à élargir la couverture du monde, et un entraînement conjoint en une seule phase intègre les deux. Fait intéressant : le gain dans le domaine de pré-entraînement reste limité, mais le taux de réussite hors distribution (OOD) passe de 14,50 % à 26,62 %.
Les spécifications concrètes du modèle de base
OpenWAM-α est composé de deux parties : Wan2.2-TI2V-5B comme flux vidéo, auquel est rattaché un DiT d'action de 1B. L'espace d'action est unifié en 80 dimensions et compatible avec 17 plateformes physiques. Les données de pré-entraînement totalisent 14 300 heures, dont 30 % de vidéos humaines à la première personne, 30 % de données synthétiques et 40 % de données réelles.

En termes de vitesse d'inférence, un bloc d'action prend 170 millisecondes sur une RTX 5090. L'évaluation couvre 8 benchmarks de simulation, dont LIBERO, RoboTwin2.0 et RoboDojo, avec des morphologies allant du bras unique au double bras, jusqu'à la manipulation mobile et aux mains dextres. Sur le projet de double bras mobile d'EBench, il est actuellement le meilleur, avec environ 4 points d'avance sur le deuxième. La validation sur robot réel a été effectuée avec un bras unique Franka sur six tâches, avec un taux de réussite moyen de 82,5 %, supérieur aux 77,5 % de LingBot-VA et aux 55,0 % de π0.5, dont deux tâches à 100 %. En passant à une main dextre jamais vue pendant l'entraînement, après fine-tuning, il dépasse également π0.5 de manière globale.
Il ne déclare pas les VLA hors jeu
Une conclusion de l'article mérite d'être isolée : le WAM, qui s'appuie sur des variables latentes vidéo futures pour la supervision, est plus adapté en distribution ; le VLA est plus robuste face aux perturbations hors distribution. Entre les deux, le match n'est pas tranché.
Cette phrase est bien plus honnête que « tel paradigme est mort ». Les lecteurs d'articles retiennent facilement les scores, mais ce qu'ils devraient surtout retenir, c'est ceci : les deux approches ont aujourd'hui chacune leurs forces, et le moment n'est pas encore venu de trancher définitivement.
Le seuil d'entrée a été abaissé d'un cran
Replacé dans un contexte plus large, sur la ligne des modèles du monde, Gemini Robotics 2 de Google proclame « un seul cerveau, pour n'importe quel robot », et Jim Fan, chez Nvidia, lance « le VLA est mort, place au modèle d'action du monde ». Le 3 octobre, Nvidia a encore étendu sa pile ouverte d'IA physique, en publiant ensemble le modèle du monde Cosmos, Isaac Lab Arena, Alpamayo pour la conduite autonome, l'outil d'orchestration OSMO et la bibliothèque OpenUSD ; Caterpillar, LEM Surgical et Neura Robotics figurent parmi les premiers utilisateurs. Le 4 octobre, à Hangzhou, dans le Zhejiang, plusieurs robots humanoïdes de la société DEEP Robotics sont descendus dans la rue pour tester la régulation de la circulation aux intersections et l'information des touristes, et ils fonctionnaient même sous la pluie.
Dans une telle densité d'annonces, le fait que des universités ouvrent une base full-stack revient à abaisser d'un cran le seuil d'entrée dans cette direction, et rend la voie « apprendre le monde par la vidéo, apprendre l'action par la trajectoire » plus ouverte au public.
Il n'est pas destiné à un déploiement direct
Il faut préciser une chose : OpenWAM est positionné comme une infrastructure de recherche, pas comme un produit prêt à l'emploi. Le README officiel recommande de prévoir environ 640 Go de données d'entraînement, l'environnement pèse environ 6,5 Go, et le dépôt continue d'évoluer activement. Il convient aux équipes qui disposent déjà de GPU et de données et qui veulent mener des recherches sur les modèles d'action du monde à partir de cette base ; il ne convient pas aux scénarios de déploiement à petite échelle.
Les points à surveiller par la suite sont eux aussi très concrets : quel sera le taux de reproduction de cette vague, combien de personnes continueront à y proposer des améliorations six mois plus tard, et si une équipe parviendra réellement à l'intégrer par fine-tuning dans une gamme de produits. L'engouement du jour de la publication retombera ; ce qui restera, ce sont les lignes de code encore utilisées.
Articles associés
Un juge fédéral qualifie le réseau de lecture de plaques d'immatriculation de Flock de « surveillance de masse indiscriminée »
Une seule observation d'une voiture révèle peu de choses. Un mois de signalements agrégés provenant de nombreuses agences révèle une vie.
Des procureurs fédéraux affirment que 300 millions de dollars de serveurs Nvidia ont transité vers la Chine via la Malaisie
Les affaires d'application des règles mesurent le flux plutôt qu'elles ne l'arrêtent, et la route de transit est la partie que la politique n'a pas résolue.
Supabase rachète Turso parce que les agents ont besoin d'une base de données par tâche
Une base de données par agent n'a de sens que lorsque la plus petite unité de stockage devient assez bon marché pour être distribuée comme un jeton de session.
Les acteurs ont obtenu un contrat qui encadre leurs répliques numériques. Le plus difficile reste l'application.
Un contrat peut définir ce qu'est une réplique numérique. Prouver qu'une réplique a été créée sans consentement est un problème différent.