← Volver al blog
Aiaprox. 8 min de lectura

La NASA e IBM publicaron como código abierto un modelo fundacional lunar entrenado con 17 años de datos de orbitadores

Publicado 6 oct 2026
La NASA e IBM publicaron como código abierto un modelo fundacional lunar entrenado con 17 años de datos de orbitadores

Diecisiete años de observación de la Luna habían producido más datos que todas las demás misiones planetarias de la NASA combinadas. Hacerlos utilizables para el aprendizaje automático era el problema más difícil.

El 5 de octubre, la NASA e IBM Research, en colaboración con varias instituciones académicas, publicaron el Modelo Fundacional Lunar NASA-IBM. El modelo es de código abierto, publicado en Hugging Face con código en GitHub, e integrado en el kit de herramientas de código abierto TerraTorch. Los conjuntos de datos de preentrenamiento y las colecciones de referencia se publicaron junto con él.

El modelo reduce el error de predicción de depósitos de hielo polar hasta en un 22 por ciento en comparación con la mejor línea base, SwinV2-B, y mejora la detección de cráteres a escala gruesa en casi un 19 por ciento utilizando solo la mitad de los datos etiquetados.

Por qué un modelo fundacional en lugar de uno específico para una tarea

La ciencia lunar tiene un problema de datos peculiar. Las observaciones son abundantes. Las etiquetas son escasas. Construir un modelo para la detección de cráteres a una escala, otro para la estabilidad del hielo y otro para la segmentación de la superficie significa construir desde cero cada vez, sobre pequeños conjuntos etiquetados, sin una representación compartida subyacente.

Un modelo fundacional invierte eso. Se preentrena con grandes volúmenes de datos no etiquetados y luego se adapta a una tarea específica con solo unos pocos ejemplos etiquetados. Kevin Murphy, director de datos científicos de la NASA, enmarcó el lanzamiento exactamente en esos términos: la NASA ha pasado décadas construyendo un registro científico de la Luna, y recopilar datos es solo parte del trabajo. El resto es hacer que sea más fácil para los científicos usarlos.

El corpus de entrenamiento es SomBench, descrito como el mayor conjunto de datos lunares multimodal co-registrado ensamblado hasta ahora: casi dos millones de paquetes de teselas en once modalidades y dos escalas espaciales. Alrededor de un millón de imágenes de alta resolución provienen de la Cámara de Ángulo Estrecho a aproximadamente un metro por píxel. Casi 964.000 imágenes multiespectrales provienen de la Cámara de Ángulo Amplio a 100 metros por píxel. La mayor parte se remonta al Orbitador de Reconocimiento Lunar, complementado con datos de GRAIL, Lunar Prospector y la sonda Kaguya de JAXA. Más de 30 capas de datos alineadas espacialmente de nueve instrumentos en cuatro misiones.

Una muestra de roca gris sobre un pedestal de piedra pálida con una fina luz en arco detrás

La decisión de diseño que hizo la mayor parte del trabajo

La arquitectura adapta TerraMind, un modelo multimodal de observación de la Tierra, pero el equipo entrenó la versión lunar desde cero en lugar de ajustar una existente. La Luna no tiene atmósfera ni clima, por lo que las suposiciones heredadas de un modelo terrestre se vuelven peores que inútiles: activamente engañosas. En la Luna, cómo se ve algo es en gran medida una función de cómo está iluminado.

Esa observación impulsó la segunda decisión clave. El modelo recibe la geometría de imagen como contexto explícito para cada tesela: ángulos de iluminación, posición del sol, extensión de la tesela. En lugar de inferir la iluminación a partir de los píxeles brutos, se le indica. Uno de los hallazgos más reveladores es que un modelo de control arquitectónicamente idéntico con inicialización aleatoria aún se desempeñó de manera competitiva en la predicción de hielo, lo que los investigadores tomaron como evidencia de que el método de manejo de datos en sí mismo conllevaba gran parte de la ganancia.

FlexiViT maneja la variación del tamaño de parche, permitiendo que el modelo entrenado se adapte a tareas en diferentes escalas de imagen sin reentrenamiento.

Puntos de referencia y los límites que los autores señalaron

El equipo probó el modelo en la detección de cráteres a escalas de 100 metros y 1 metro, la predicción de depósitos de hielo polar y la segmentación de parches irregulares de mar. El modelo preentrenado igualó o superó las líneas base comunes y el control de inicialización aleatoria. La predicción de hielo vio las mayores ganancias.

El informe técnico es explícito sobre lo que el modelo no puede hacer. No es adecuado para posicionamiento geodésico absoluto. En las pruebas de generación, la latitud y la longitud se desviaron por docenas de grados en algunos casos, y las estructuras de elevación aparecieron con valores de altura absoluta desplazados incluso cuando la reconstrucción de la forma era correcta. Juan Bernabé-Moreno de IBM Research Europe describió el modelo como una base reutilizable para la investigación lunar posterior en lugar de un sustituto de las mediciones físicas.

Esa distinción se mantiene en todo el lanzamiento. El modelo acelera el análisis: estima dónde el hielo de agua podría permanecer estable en regiones permanentemente sombreadas, mapea cráteres para estimar edades de la superficie y señala parches irregulares de mar para el estudio volcánico. No confirma que existan recursos explotables ni garantiza que un sitio sea seguro para aterrizar.

Lo que no puede hacer

La sección de limitaciones del propio informe vale la pena leerla con atención, porque define la frontera entre una herramienta de investigación y un instrumento. El modelo no es adecuado para el posicionamiento geodésico absoluto: en las pruebas de generación, la latitud y la longitud se desviaron por docenas de grados en algunos casos, y las estructuras de elevación aparecieron con valores de altura absoluta desplazados incluso cuando las formas reconstruidas eran correctas.

Traducido a la práctica, eso significa que el modelo es útil para encontrar y caracterizar características, y poco fiable para decir exactamente dónde están con alta precisión. Un planificador de misiones podría usarlo para reducir las regiones candidatas para hielo polar y luego confirmarlas con mediciones específicas. Un equipo que tratara su salida como coordenadas de grado topográfico estaría haciendo un mal uso de él.

Los autores enmarcan el lanzamiento de la misma manera, como una base reutilizable para la investigación posterior en lugar de un sustituto de la medición física. Esa honestidad sobre el alcance es lo que hace que el lanzamiento sea utilizable, porque indica a los equipos posteriores en qué tareas confiar en el modelo y cuáles seguir haciendo a la manera difícil.

Por qué importa la adaptación del modelo terrestre

TerraMind fue construido para la observación de la Tierra, donde las imágenes están moldeadas por la atmósfera, los ciclos de vegetación y la actividad humana. Adaptar su arquitectura mientras se entrena desde cero es un camino intermedio deliberado. El equipo conservó lo que generaliza, que es la maquinaria para manejar datos multimodales alineados espacialmente, y descartó lo que no, que es cualquier suposición sobre cómo debería verse una superficie.

La decisión de la iluminación como entrada muestra por qué importa esa distinción. En la Tierra, una imagen satelital conlleva suficiente redundancia visual como para que un modelo a menudo pueda inferir la iluminación a partir de la textura y la sombra. En la Luna, la superficie es en gran medida uniforme y la sombra es la señal. Entregar al modelo el ángulo solar y la geometría de iluminación directamente, en lugar de pedirle que los reconstruya, le permitió gastar su capacidad en las tareas científicas en lugar de en volver a derivar la física que ya se le había dado.

Ese es un patrón que se transfiere. Cualquier dominio donde una medición física sea fácil de calcular pero costosa de inferir para un modelo es candidato para un condicionamiento explícito: profundidad a partir de estéreo, corrección atmosférica, calibración de sensores. La Luna resultó ser un caso claro porque tiene muy pocas variables de confusión.

Qué significa la publicación abierta aquí

Publicar un modelo y sus conjuntos de datos como código abierto cambia quién puede participar. Los equipos de investigación fuera de la NASA e IBM pueden reproducir los resultados publicados, ajustar el modelo a sus propios problemas y construir aplicaciones para futuras misiones sin negociar el acceso a los datos. Cuando los datos lunares etiquetados son costosos de producir, un modelo preentrenado que necesita solo unos pocos ejemplos es la diferencia entre un estudio que se realiza y uno que no.

El lanzamiento también es una plantilla. La Luna fue indexada por un modelo construido para un tipo específico de imágenes, alimentado con la física que determina cómo se ven esas imágenes, y entrenado con datos que habían estado en archivos durante diecisiete años esperando ser procesados. El mismo patrón se aplica a cualquier dominio con observaciones no etiquetadas abundantes y etiquetas escasas, que es la mayor parte de la teledetección científica.

Artículos relacionados