← Retour au blog
AiEnviron 8 min de lecture

Le pari Praxis-1 de Runway : le pré-entraînement vidéo comme raccourci vers le cerveau des robots

Publié le 2 oct. 2026
Le pari Praxis-1 de Runway : le pré-entraînement vidéo comme raccourci vers le cerveau des robots

Tout programme de robotique ayant de sérieuses ambitions de déploiement se heurte au même mur, et ce n'est pas un mur matériel. Les données du monde réel sont rares et coûteuses à collecter, au volume dont une politique généraliste a besoin. Pour les domaines truffés de cas particuliers, notamment la conduite autonome, la robotique domestique et le travail en entrepôt dans des environnements désordonnés, il n'existe aucun moyen pratique de rassembler les démonstrations nécessaires pour entraîner un modèle capable de gérer ce qui se produira réellement.

Runway a annoncé Praxis-1 le 30 septembre, et son argumentaire commence par ce mur. Praxis-1 est un modèle d'action du monde (world action model) à poids ouverts qui convertit le pré-entraînement vidéo à grande échelle de Runway en politiques de contrôle pour des robots réels. L'entreprise le teste avec des partenaires précoces — Noble Machines, Standard Bots et Ultra —, chacun exécutant le modèle sur son propre matériel, une publication publique sous poids ouverts étant prévue dans les mois à venir.

La vidéo comme substitut à la téléopération

La prémisse est simple une fois énoncée. La vidéo est pratiquement illimitée, et elle le devient davantage à mesure que les modèles génératifs atteignent la parité avec des images réelles en qualité et en vitesse. Les gens filment et mettent en ligne chaque jour plus de vie quotidienne qu'aucun laboratoire de robotique ne pourrait en capturer via des démonstrations téléopérées. Si un modèle peut apprendre la structure du monde physique à partir de ces images, le goulot d'étranglement se déplace des données robotiques rares vers la vidéo générale abondante.

L'affirmation qui donne du poids à tout cela est empirique. Runway rapporte que la simulation de politiques robotiques à l'intérieur de son modèle du monde prédit les résultats réels avec une corrélation de 0,95, ce qui est favorable comparé à des techniques plus coûteuses fondées sur la reconstruction 3D. Un modèle du monde utilisable comme environnement de test fidèle change l'économie du développement de politiques, car l'évaluation n'exige plus de matériel physique à chaque itération.

L'entreprise a également constaté que la performance des politiques s'améliore à mesure que l'échelle de la vidéo à la troisième personne augmente, et en conclut que le goulot d'étranglement d'une politique performante devient la quantité de vidéo générale sur laquelle un modèle peut s'entraîner. C'est le même argument de mise à l'échelle que celui qui a propulsé les modèles de langage, appliqué au contrôle moteur. Une politique qui comprend déjà la plausibilité physique et le comportement des objets grâce au pré-entraînement vidéo part d'une position bien plus forte qu'une politique construite uniquement à partir de données d'action.

L'architecture derrière le pari

Praxis-1 s'appuie sur le même pré-entraînement vidéo qui a produit les modèles du monde généraux de Runway et ses travaux interactifs en temps réel tels que Solaris et la gamme GWM Worlds. La logique de cette filiation compte. Apprendre à un modèle comment les objets se comportent, comment les mains bougent et à quoi ressemble une tâche en cours de réalisation crée des environnements dynamiques pour entraîner des agents dans des contextes numériques comme physiques.

Runway présente cela comme un avantage cumulatif. Plus le modèle comprend le fonctionnement du monde à partir de la vidéo, mieux il peut contrôler un robot dans des environnements différents de tout ce qu'il a vu à l'entraînement. L'objectif annoncé est un modèle de politique généraliste destiné aux développeurs et chercheurs en robotique, fonctionnant sur n'importe quelle incarnation ou environnement, plutôt qu'une politique réglée pour un bras ou une pince spécifique.

C'est là que la lecture sceptique intervient. « Fonctionne sur n'importe quelle incarnation » est une affirmation forte, et les preuves disponibles jusqu'ici proviennent de trois partenaires nommés qui exécutent le modèle sur leur propre matériel, avant un lancement plus large. Le chiffre de corrélation de 0,95 est mesuré entre la simulation à l'intérieur du modèle du monde de Runway et les résultats réels, ce qui valide autant le simulateur que la politique. Les deux sont utiles, et les deux sont, à ce stade, les propres chiffres de Runway.

Pourquoi des poids ouverts, et pourquoi c'est un argument stratégique

Runway livre Praxis-1 avec des poids ouverts plutôt que sous forme de modèle fermé, et le raisonnement est inhabituellement explicite pour une entreprise qui a gardé la plupart de ses modèles propriétaires. L'annonce le présente comme une question de compétitivité américaine dans l'IA physique : reconquérir le leadership industriel, accélérer la productivité et sécuriser des alliés exigeront, selon les mots de Runway, un niveau d'interopérabilité et d'ouverture des modèles américains qui n'existe pas actuellement pour les cas d'usage physiques.

C'est un argument teinté de politique, et il tombe au beau milieu d'un débat actif sur la part de la pile IA qui devrait être ouverte. Pour la robotique en particulier, l'argument en faveur des poids ouverts est plus fort que pour les modèles de langage de pointe. Les développeurs de matériel doivent exécuter des politiques sur leurs propres machines, avec leurs propres capteurs et actionneurs, et une API cloud qui exige d'envoyer ces signaux ailleurs est mal adaptée. Les modèles du monde ouverts donnent aux fabricants de matériel une flexibilité et un contrôle qu'un modèle hébergé ne peut leur offrir.

Il existe aussi une dimension concurrentielle que l'annonce n'énonce pas ouvertement. Une grande partie de la dynamique dans les modèles vidéo et les modèles du monde à poids ouverts vient de laboratoires chinois. Qu'une entreprise américaine de premier plan livre des poids ouverts dans la même catégorie se lit en partie comme une tentative de définir le centre de gravité de l'écosystème avant que quelqu'un d'autre ne le fasse.

Une corrélation de 0,95 est un chiffre fort, et il mérite une traduction. Cela signifie que lorsque Runway exécute une politique candidate dans son modèle du monde et mesure ses performances, le robot réel se comporte presque de la même manière. Si cela tient à travers les tâches, la conséquence pratique est qu'une équipe de robotique peut mener l'essentiel de ses expériences en simulation et réserver le matériel physique à la vérification finale. Vu le coût et la lenteur des essais physiques, c'est la différence entre réaliser cent itérations en une semaine et une poignée en un mois.

La question plus difficile est celle de la généralisation. La vidéo apprend à un modèle à quoi ressemble le monde et comment les objets ont tendance à se comporter, mais un robot doit aussi savoir quoi faire avec un bras précis, sur une tâche précise, avec une tolérance à l'échec précise. L'argument de Runway est que le prior entraîné sur vidéo réduit la quantité de données spécifiques à la tâche nécessaires pour y parvenir. C'est plausible, et non prouvé à grande échelle.

Où cela s'inscrit dans la course à la robotique

Praxis-1 arrive une année où la robotique humanoïde et manufacturière est passée des démonstrations aux déploiements. Figure a entraîné des humanoïdes retirés du service pour des tâches extrêmes. Les fabricants d'humanoïdes signent des pilotes en usine avec des constructeurs automobiles, et Boston Dynamics a commencé à tester son robot Atlas dans une installation de Hyundai, avec des projets de déploiement à grande échelle d'ici 2030. Le fil conducteur est que les capacités progressent plus vite que le pipeline de données qui les alimente.

La contribution de Runway est d'affirmer que le problème du pipeline de données a un raccourci, et que ce raccourci passe par la vidéo. Si la corrélation entre résultats simulés et réels se vérifie chez les partenaires et sur diverses tâches, l'effet pratique est que les équipes de robotique peuvent itérer dans un modèle du monde, réserver les tests physiques à la validation finale et apprendre d'une catégorie de données qui ne cesse de croître d'elle-même.

C'est une affirmation importante, et non prouvée. L'entreprise offre un accès pré-lancement à certains partenaires et invite les chercheurs à le tester sur leur propre matériel. La preuve qui comptera ne sera pas le chiffre de corrélation issu des travaux internes de Runway. Ce sera de savoir si des laboratoires indépendants reproduisent le résultat, et si une politique entraînée en grande partie sur de la vidéo internet à la troisième personne gère une tâche qu'elle n'a jamais vue dans une pièce où elle n'a jamais été. C'est ce test qui déterminera si le pré-entraînement vidéo devient la fondation par défaut des cerveaux robotiques ou reste une direction de recherche intéressante.

Articles associés