← Retour au blog
AiEnviron 8 min de lecture

Les photos satellites sont désormais des données d'entraînement pour les robots

Publié le 7 oct. 2026
Les photos satellites sont désormais des données d'entraînement pour les robots

La façon la plus rapide d'apprendre un nouveau lieu à une machine n'est peut-être pas de l'y conduire. Deux annonces publiées ce mois-ci pointent vers la même idée, mais par des directions opposées. La première transforme l'imagerie satellite en chantiers simulés, pour que les robots puissent s'entraîner avant d'arriver. La seconde corrige la géométrie qui sous-tend les modèles du monde vidéo, afin que ce qu'imagine un robot corresponde à l'emplacement réel des choses.

Bonsai Robotics, qui développe des logiciels d'autonomie pour le matériel agricole et minier, a présenté Bonsai World le 2 octobre. Le système part d'images satellites d'une exploitation agricole, d'une mine ou d'un autre terrain accidenté et transforme cette vue plate en une simulation 3D structurée. Les machines peuvent ensuite y répéter des trajectoires réelles. L'entreprise affirme pouvoir y superposer des conditions que la flotte n'a pas rencontrées physiquement : poussière, débris, animaux, véhicules et sols mouvants.

La puissance de calcul sous-jacente repose sur une pile multi-fournisseurs. Le modèle de vision Gemini de Google lit l'image satellite et construit une carte structurée. Le modèle du monde propre à Bonsai, post-entraîné sur plus de 50 millions d'échantillons réels collectés sur plus d'un million d'acres, génère les vues au niveau du sol. L'entraînement tourne sur des machines virtuelles Google A2 équipées de GPU Nvidia A100, tandis que la génération d'environnements à la demande utilise des machines Google G4 avec des GPU serveur RTX PRO 6000 Blackwell. Les modèles Cosmos de Nvidia en constituent la couche inférieure.

L'argument commercial porte sur le temps de mise en service. Faire fonctionner un logiciel d'autonomie sur une nouvelle culture, une nouvelle machine ou un nouveau site implique normalement de collecter des données de terrain et d'itérer sur place, ce qui est lent et coûteux. Si le système peut s'entraîner d'abord sur une reconstruction plausible, la machine arrive plus proche d'être opérationnelle. Bonsai indique que cette approche réduit la collecte de données de terrain plutôt qu'elle ne la remplace : c'est la version honnête de l'argument.

Le problème de géométrie que personne ne voit

Une simulation issue d'images ne fonctionne que si la 3D qu'elle produit est fidèle. C'est là qu'un article publié sur arXiv ce mois-ci devient intéressant. Une équipe de l'Université technique tchèque et d'Inria a publié DepthWorld, accepté à la Conference on Robot Learning, et elle commence par un aveu qui sape beaucoup de démonstrations : les modèles du monde vidéo actuels sont entraînés sur du RGB seul et produisent des rollouts qui semblent corrects image par image sans pour autant composer un monde 3D cohérent.

La défaillance est facile à se représenter. Donnez à un modèle du monde purement RGB une scène avec une armoire ouverte : il ne peut pas distinguer la porte ouverte d'une surface pleine et simule donc un bras robotique entrant en collision avec le vide. Si vous utilisez le modèle pour évaluer une politique, ce type d'erreur produit un signal pire qu'inutile, car il ressemble à un échec réel sans en être un.

Le premier correctif de l'équipe porte sur les données. Ils ont construit un pipeline de calibration qui combine une profondeur stéréo apprise avec un graphe de facteurs conjoint, en regroupant tous les épisodes collectés sur un même robot physique afin que le modèle puisse retrouver la cinématique partagée de ce robot en même temps que les paramètres extrinsèques de caméra de chaque scène. Appliqué à DROID, le plus grand jeu de données ouvert de téléopération, cela produit DROID-3D : une profondeur métrique dense et des paramètres extrinsèques multi-vues recalibrés sur plus de 70 000 épisodes, avec une erreur de reprojection inférieure à 0,7 pixel sur 90 % des épisodes pour les caméras externes.

Le second correctif est architectural. Plutôt que de réinitialiser un modèle vidéo pré-entraîné pour y ajouter la profondeur, ce qui risque de détruire les a priori visuels et de mouvement qu'il a déjà appris, ils juxtaposent RGB et profondeur côte à côte dans une grille latente plus large et étendent les embeddings de position pour la couvrir. Le composant pré-entraîné reste intact. La récompense est un résultat qui m'a surpris à la lecture : ajouter la profondeur comme second objectif de prédiction a amélioré la prédiction RGB elle-même, de 1,48 dB de PSNR à budget d'entraînement égal.

Pourquoi ce chiffre compte au-delà de l'article

Un modèle du monde n'est utile à la planification que si sa géométrie tient sur un long rollout, et c'est là que la comparaison avec PointWorld de Nvidia devient intéressante. PointWorld était plus précis sur les objets en mouvement à court horizon, mais DepthWorld se dégradait bien moins avec le temps, passant de 8 à 9 millimètres d'erreur sur l'ensemble de la scène là où l'autre passait de 8 à 18. Pour un système qui planifie plusieurs minutes à l'avance, la courbe compte plus que le point de départ.

Rapprochez Bonsai World et DepthWorld et un schéma apparaît. Le goulot d'étranglement de l'entraînement en IA physique n'est plus le calcul, ni même la capacité des modèles. Il est devenu la qualité du monde synthétique, et plus précisément le fait que la géométrie qu'il contient soit métrique, calibrée et stable. C'est un problème d'ingénierie des données avant d'être un problème de modélisation. La contribution de DROID-3D est un pipeline plutôt qu'une architecture : il retrouve des poses de caméra précises au millimètre à partir d'un jeu de données qui n'a jamais été conçu pour les avoir, et il y parvient en regroupant les épisodes au lieu de faire confiance à un seul d'entre eux.

Ce qui s'améliore, et ce qui ne s'améliore pas

Les gains sont réels et limités. Bonsai World fonctionne sur des environnements extérieurs structurés où l'imagerie satellite est disponible et où le terrain est la variable dominante. Cela couvre bien l'agriculture et l'exploitation minière de surface. Il couvre mal une cuisine encombrée ou un couloir d'hôpital, car ces espaces ne sont pas visibles depuis l'orbite et leur difficulté vient des objets, pas du sol. La formulation de l'entreprise elle-même — environnements difficiles et non structurés — est autant une délimitation du périmètre qu'une description de marché.

DepthWorld a la limitation inverse. Il est le plus performant là où l'on dispose de nombreux épisodes issus d'un même robot et où l'on peut mutualiser leur calibration : c'est exactement la configuration d'un laboratoire de recherche, et c'est moins courant dans une flotte déployée avec du matériel hétérogène. Le benchmark de l'article lui-même repose sur un seul jeu de données ouvert.

Il existe aussi un déficit de vérification qu'il vaut la peine de nommer. Bonsai n'a publié, avec son annonce, ni mesures de performance indépendantes sur le terrain, ni poids de modèle ouverts. Le modèle du monde reste une affirmation tant que personne ne l'a testé en dehors de l'entreprise. Le code et le jeu de données de DepthWorld relèvent du cas inverse : un article publié, une conférence qui l'a accepté et un pipeline reproductible — c'est pourquoi il influencera probablement la façon dont d'autres équipes construisent leurs propres modèles du monde, même si personne n'utilise celui-ci en particulier.

Ce qui devrait inquiéter les équipes de robotique

Si les environnements synthétiques deviennent la méthode par défaut pour pré-entraîner l'autonomie, alors la qualité de la simulation devient un point de défaillance unique pour de nombreux déploiements. Un biais inscrit dans le générateur — qu'il concerne l'éclairage, le terrain ou la distribution des obstacles — se propage à chaque machine entraînée avec lui, et il le fait de manière invisible, car les machines qui échouent n'atteignent jamais le terrain pour le révéler.

C'est l'argument pour maintenir une part de collecte en conditions réelles dans la boucle, même lorsque la version synthétique paraît convaincante. Les données de terrain justifient leur coût par les exemples qu'elles fournissent et, plus important encore, par le contrôle qu'elles exercent sur le simulateur. Les deux publications de ce mois font avancer le domaine sur ce front : l'une en rendant les environnements simulés peu coûteux à générer, l'autre en rendant la géométrie qu'ils contiennent honnête. Aucune des deux ne supprime la nécessité de finir par sortir la machine sur le terrain pour voir ce qu'elle fait.

Articles associés