La NASA et IBM ont mis en open source un modèle de fondation lunaire entraîné sur 17 ans de données d'orbiteur

Dix-sept années d'observation de la Lune avaient produit plus de données que toutes les autres missions planétaires de la NASA réunies. Les rendre exploitables pour l'apprentissage automatique était le problème le plus difficile.
Le 5 octobre, la NASA et IBM Research, en collaboration avec plusieurs institutions universitaires, ont publié le NASA-IBM Lunar Foundation Model. Le modèle est open source, publié sur Hugging Face avec le code sur GitHub, et intégré à la boîte à outils open source TerraTorch. Les jeux de données de préentraînement et les collections de benchmarks ont été publiés en même temps.
Le modèle réduit l'erreur de prédiction des dépôts de glace polaire jusqu'à 22 % par rapport à la meilleure référence, SwinV2-B, et améliore la détection des cratères à échelle grossière de près de 19 % tout en n'utilisant que la moitié des données étiquetées.
Pourquoi un modèle de fondation plutôt qu'un modèle spécifique à une tâche
La science lunaire a un problème de données étrange. Les observations sont abondantes. Les étiquettes sont rares. Construire un modèle pour la détection de cratères à une échelle, un autre pour la stabilité de la glace, et un autre pour la segmentation de surface signifie repartir de zéro à chaque fois, sur de petits ensembles étiquetés, sans représentation partagée en dessous.
Un modèle de fondation inverse cette logique. Il se préentraîne sur de grands volumes de données non étiquetées, puis s'adapte à une tâche spécifique avec seulement quelques exemples étiquetés. Kevin Murphy, responsable principal des données scientifiques de la NASA, a présenté la publication exactement en ces termes : la NASA a passé des décennies à construire un dossier scientifique de la Lune, et collecter des données n'est qu'une partie du travail. Le reste consiste à les rendre plus faciles à utiliser pour les scientifiques.
Le corpus d'entraînement est SomBench, décrit comme le plus grand jeu de données lunaires multimodal co-enregistré assemblé à ce jour : près de deux millions d'ensembles de tuiles à travers onze modalités et deux échelles spatiales. Environ un million d'images haute résolution proviennent de la Narrow Angle Camera à environ un mètre par pixel. Près de 964 000 images multispectrales proviennent de la Wide Angle Camera à 100 mètres par pixel. L'essentiel remonte au Lunar Reconnaissance Orbiter, complété par des données de GRAIL, Lunar Prospector et de la sonde Kaguya de la JAXA. Plus de 30 couches de données alignées spatialement provenant de neuf instruments sur quatre missions.

Le choix de conception qui a fait la majeure partie du travail
L'architecture adapte TerraMind, un modèle multimodal d'observation de la Terre, mais l'équipe a entraîné la version lunaire à partir de zéro plutôt que d'affiner un modèle existant. La Lune n'a ni atmosphère ni météo, de sorte que les hypothèses héritées d'un modèle terrestre deviennent pires qu'inutiles : activement trompeuses. Sur la Lune, l'apparence d'une chose est largement fonction de son éclairage.
Cette observation a motivé la deuxième décision clé. Le modèle reçoit la géométrie d'imagerie comme contexte explicite pour chaque tuile : angles d'illumination, position du soleil, étendue de la tuile. Au lieu de déduire l'éclairage à partir des pixels bruts, on le lui indique. L'une des conclusions les plus révélatrices est qu'un modèle de contrôle architecturalement identique avec une initialisation aléatoire est resté compétitif sur la prédiction de la glace, ce que les chercheurs ont interprété comme la preuve que la méthode de traitement des données elle-même apportait une grande partie du gain.
FlexiViT gère la variation de taille des patchs, permettant au modèle entraîné de s'adapter à des tâches à différentes échelles d'image sans réentraînement.
Benchmarks et limites citées par les auteurs
L'équipe a testé le modèle sur la détection de cratères aux échelles de 100 mètres et de 1 mètre, la prédiction des dépôts de glace polaire et la segmentation des taches de mare irrégulières. Le modèle préentraîné a égalé ou dépassé les références courantes et le contrôle à initialisation aléatoire. La prédiction de la glace a enregistré les gains les plus importants.
Le rapport technique est explicite sur ce que le modèle ne peut pas faire. Il ne convient pas au positionnement géodésique absolu. Dans les tests de génération, la latitude et la longitude étaient décalées de plusieurs dizaines de degrés dans certains cas, et les structures d'élévation apparaissaient avec des valeurs de hauteur absolue décalées même lorsque la reconstruction de forme était correcte. Juan Bernabé-Moreno d'IBM Research Europe a décrit le modèle comme une fondation réutilisable pour la recherche lunaire en aval plutôt qu'un substitut aux mesures physiques.
Cette distinction traverse toute la publication. Le modèle accélère l'analyse : il estime où la glace d'eau pourrait rester stable dans les régions perpétuellement ombragées, cartographie les cratères pour estimer l'âge des surfaces, et signale les taches de mare irrégulières pour l'étude volcanique. Il ne confirme pas que des ressources exploitables existent ni ne garantit qu'un site est sûr pour l'atterrissage.
Ce qu'il ne peut pas faire
La section sur les limites du rapport mérite une lecture attentive, car elle définit la frontière entre un outil de recherche et un instrument. Le modèle ne convient pas au positionnement géodésique absolu : dans les tests de génération, la latitude et la longitude étaient décalées de plusieurs dizaines de degrés dans certains cas, et les structures d'élévation apparaissaient avec des valeurs de hauteur absolue décalées même lorsque les formes reconstruites étaient correctes.
Traduit en pratique, cela signifie que le modèle est utile pour trouver et caractériser des caractéristiques, et peu fiable pour dire exactement où elles se trouvent avec une haute précision. Un planificateur de mission pourrait l'utiliser pour réduire les régions candidates pour la glace polaire, puis confirmer avec des mesures ciblées. Une équipe qui traiterait sa sortie comme des coordonnées de qualité topographique en ferait un mauvais usage.
Les auteurs présentent la publication de la même manière, comme une fondation réutilisable pour la recherche en aval plutôt qu'un substitut à la mesure physique. Cette honnêteté sur la portée est ce qui rend la publication utilisable, car elle indique aux équipes en aval à quelles tâches faire confiance au modèle et lesquelles continuer à faire de manière traditionnelle.
Pourquoi l'adaptation du modèle terrestre compte
TerraMind a été conçu pour l'observation de la Terre, où l'imagerie est façonnée par l'atmosphère, les cycles de végétation et l'activité humaine. Adapter son architecture tout en entraînant à partir de zéro est une voie médiane délibérée. L'équipe a conservé ce qui se généralise, à savoir les mécanismes de traitement des données multimodales alignées spatialement, et a écarté ce qui ne se généralise pas, à savoir toute hypothèse sur l'apparence d'une surface.
La décision de fournir l'illumination en entrée montre pourquoi cette distinction compte. Sur Terre, une image satellite porte suffisamment de redondance visuelle pour qu'un modèle puisse souvent déduire l'éclairage à partir de la texture et de l'ombre. Sur la Lune, la surface est largement uniforme et l'ombre est le signal. Donner directement au modèle l'angle du soleil et la géométrie d'illumination, plutôt que de lui demander de les reconstruire, lui a permis de consacrer sa capacité aux tâches scientifiques au lieu de redériver une physique qui lui était déjà fournie.
C'est un schéma qui se transfère. Tout domaine où une mesure physique est facile à calculer mais coûteuse à inférer pour un modèle est candidat à un conditionnement explicite : profondeur à partir de stéréo, correction atmosphérique, calibration de capteur. La Lune a permis de démontrer le cas proprement parce qu'elle a très peu de variables confusionnelles.
Ce que signifie une publication ouverte ici
Mettre en open source un modèle et ses jeux de données change qui peut participer. Les équipes de recherche en dehors de la NASA et d'IBM peuvent reproduire les résultats publiés, affiner le modèle sur leurs propres problèmes et construire des applications pour de futures missions sans négocier l'accès aux données. Lorsque les données lunaires étiquetées sont coûteuses à produire, un modèle préentraîné qui n'a besoin que de quelques exemples fait la différence entre une étude qui a lieu et une qui n'a pas lieu.
La publication est aussi un gabarit. La Lune a été indexée par un modèle conçu pour un type spécifique d'imagerie, nourri de la physique qui détermine l'apparence de cette imagerie, et entraîné sur des données qui étaient restées dans les archives pendant dix-sept ans en attente de traitement. Le même schéma s'applique à tout domaine avec des observations non étiquetées abondantes et des étiquettes rares, ce qui représente la majeure partie de la télédétection scientifique.
Articles associés
Cloudflare lance un modèle de décision de 27 B qui bat Jev sur son propre terrain
Certains appels de modèle devraient renvoyer un nombre, pas un paragraphe. Une catégorie se forme autour de cette idée.
BOSSFIGHT a fait jouer à des modèles de frontière le rôle de propriétaires de café pendant 24 semaines. La plupart ont perdu face à l'inaction.
Résister à un pot-de-vin dans un quiz et refuser de céder lors d'un trimestre réel sont deux compétences différentes, et les évaluations actuelles ont tendance à mesurer la plus facile.
Quatre étapes au lieu de quarante : comment la distillation compresse les modèles d'images ouverts sur les GPU grand public
La distillation à faible nombre d'étapes est un compromis, pas un repas gratuit. La fidélité du texte, la précision des retouches et la cohérence multi-références sont les premières choses à en pâtir.
Des agents ont commencé à réaliser des courts métrages cette semaine. Le goulot d'étranglement s'est déplacé vers le contrôle qualité.
La génération est bon marché, l'orchestration est le produit, et ce qui détermine si un pipeline est utile, c'est s'il peut savoir quand il a échoué.