← Voltar ao blog
Aicerca de 8 min de leitura

NASA e IBM disponibilizam em código aberto um modelo de fundação lunar treinado com 17 anos de dados de orbitadores

Publicado 6 de out. de 2026
NASA e IBM disponibilizam em código aberto um modelo de fundação lunar treinado com 17 anos de dados de orbitadores

Dezessete anos de observação da Lua produziram mais dados do que todas as outras missões planetárias da NASA combinadas. Torná-los utilizáveis para aprendizado de máquina era o problema mais difícil.

Em 5 de outubro, a NASA e a IBM Research, em colaboração com várias instituições acadêmicas, lançaram o Modelo de Fundação Lunar NASA-IBM. O modelo é de código aberto, publicado no Hugging Face com código no GitHub e integrado ao kit de ferramentas de código aberto TerraTorch. Os conjuntos de dados de pré-treinamento e as coleções de benchmarks foram disponibilizados junto com ele.

O modelo reduz o erro de previsão de depósitos de gelo polar em até 22% em comparação com a melhor linha de base, SwinV2-B, e melhora a detecção de crateras em escala grossa em quase 19%, usando apenas metade dos dados rotulados.

Por que um modelo de fundação em vez de um específico para tarefa

A ciência lunar tem um problema de dados curioso. As observações são abundantes. Os rótulos são escassos. Construir um modelo para detecção de crateras em uma escala, outro para estabilidade de gelo e outro para segmentação de superfície significa construir do zero a cada vez, com pequenos conjuntos rotulados, sem nenhuma representação compartilhada por baixo.

Um modelo de fundação inverte isso. Ele é pré-treinado em grandes volumes de dados não rotulados e depois se adapta a uma tarefa específica com apenas alguns exemplos rotulados. Kevin Murphy, diretor científico de dados da NASA, enquadrou o lançamento exatamente nesses termos: a NASA passou décadas construindo um registro científico da Lua, e coletar dados é apenas parte do trabalho. O resto é tornar mais fácil para os cientistas usá-los.

O corpus de treinamento é o SomBench, descrito como o maior conjunto de dados lunares multimodal co-registrado já montado: quase dois milhões de pacotes de tiles em onze modalidades e duas escalas espaciais. Cerca de um milhão de imagens de alta resolução vêm da Narrow Angle Camera a aproximadamente um metro por pixel. Quase 964.000 imagens multiespectrais vêm da Wide Angle Camera a 100 metros por pixel. A maior parte remonta ao Lunar Reconnaissance Orbiter, complementado por dados da GRAIL, do Lunar Prospector e da sonda Kaguya da JAXA. Mais de 30 camadas de dados espacialmente alinhadas de nove instrumentos em quatro missões.

Uma amostra de rocha cinza apoiada sobre um pedestal de pedra clara com uma luz em arco fina atrás dela

A escolha de design que fez a maior parte do trabalho

A arquitetura adapta o TerraMind, um modelo multimodal de observação da Terra, mas a equipe treinou a versão lunar do zero, em vez de fazer ajuste fino em um modelo existente. A Lua não tem atmosfera nem clima, então suposições herdadas de um modelo da Terra se tornam piores que inúteis: ativamente enganosas. Na Lua, a aparência de algo é em grande parte função de como ele é iluminado.

Essa observação motivou a segunda decisão-chave. O modelo recebe a geometria de imageamento como contexto explícito para cada tile: ângulos de iluminação, posição do sol, extensão do tile. Em vez de inferir a iluminação a partir dos pixels brutos, ela lhe é informada. Uma das descobertas mais reveladoras é que um modelo de controle arquiteturalmente idêntico, com inicialização aleatória, ainda teve desempenho competitivo na previsão de gelo, o que os pesquisadores interpretaram como evidência de que o próprio método de tratamento dos dados carregava grande parte do ganho.

O FlexiViT lida com a variação no tamanho dos patches, permitindo que o modelo treinado se adapte a tarefas em diferentes escalas de imagem sem novo treinamento.

Benchmarks e os limites apontados pelos autores

A equipe testou o modelo na detecção de crateras em escalas de 100 metros e 1 metro, na previsão de depósitos de gelo polar e na segmentação de manchas irregulares de mare. O modelo pré-treinado igualou ou superou linhas de base comuns e o controle com inicialização aleatória. A previsão de gelo teve os maiores ganhos.

O relatório técnico é explícito sobre o que o modelo não pode fazer. Ele não é adequado para posicionamento geodésico absoluto. Em testes de geração, latitude e longitude ficaram erradas em dezenas de graus em alguns casos, e estruturas de elevação apareceram com valores de altura absoluta deslocados, mesmo quando a reconstrução de forma estava correta. Juan Bernabé-Moreno, da IBM Research Europe, descreveu o modelo como uma base reutilizável para pesquisa lunar subsequente, em vez de um substituto para medições físicas.

Essa distinção permeia todo o lançamento. O modelo acelera a análise: estima onde gelo de água poderia permanecer estável em regiões permanentemente sombreadas, mapeia crateras para estimar idades da superfície e sinaliza manchas irregulares de mare para estudo vulcânico. Ele não confirma que recursos exploráveis existem nem garante que um local seja seguro para pousar.

O que ele não pode fazer

A própria seção de limitações do relatório vale a pena ser lida com atenção, porque define a fronteira entre uma ferramenta de pesquisa e um instrumento. O modelo não é adequado para posicionamento geodésico absoluto: em testes de geração, latitude e longitude ficaram erradas em dezenas de graus em alguns casos, e estruturas de elevação apareceram com valores de altura absoluta deslocados, mesmo quando as formas reconstruídas estavam corretas.

Traduzido para a prática, isso significa que o modelo é útil para encontrar e caracterizar feições, e não é confiável para dizer exatamente onde elas estão com alta precisão. Um planejador de missão poderia usá-lo para restringir regiões candidatas para gelo polar e depois confirmar com medições direcionadas. Uma equipe que tratasse sua saída como coordenadas com precisão de levantamento estaria fazendo mau uso dele.

Os autores enquadram o lançamento da mesma forma, como uma base reutilizável para pesquisa subsequente, em vez de um substituto para medição física. Essa honestidade sobre o escopo é o que torna o lançamento utilizável, porque diz às equipes subsequentes em quais tarefas confiar o modelo e quais continuar fazendo do jeito difícil.

Por que a adaptação do modelo da Terra importa

O TerraMind foi criado para observação da Terra, onde as imagens são moldadas pela atmosfera, pelos ciclos de vegetação e pela atividade humana. Adaptar sua arquitetura enquanto se treina do zero é um caminho intermediário deliberado. A equipe manteve o que generaliza, que é a maquinaria para lidar com dados multimodais e espacialmente alinhados, e descartou o que não generaliza, que é qualquer suposição sobre como uma superfície deveria parecer.

A decisão de usar iluminação como entrada mostra por que essa distinção importa. Na Terra, uma imagem de satélite carrega redundância visual suficiente para que um modelo muitas vezes consiga inferir a iluminação a partir da textura e da sombra. Na Lua, a superfície é em grande parte uniforme e a sombra é o sinal. Entregar ao modelo o ângulo do sol e a geometria de iluminação diretamente, em vez de pedir que ele os reconstrua, permitiu que ele gastasse sua capacidade nas tarefas científicas, em vez de re-derivar a física que já lhe foi fornecida.

Esse é um padrão que se transfere. Qualquer domínio em que uma medição física seja fácil de calcular, mas cara para um modelo inferir, é candidato a condicionamento explícito: profundidade a partir de estéreo, correção atmosférica, calibração de sensores. A Lua acabou tornando o caso claro porque tem pouquíssimas variáveis de confusão.

O que o lançamento aberto significa aqui

Disponibilizar um modelo e seus conjuntos de dados em código aberto muda quem pode participar. Equipes de pesquisa fora da NASA e da IBM podem reproduzir os resultados publicados, fazer ajuste fino do modelo em seus próprios problemas e criar aplicações para futuras missões sem negociar acesso a dados. Quando dados lunares rotulados são caros de produzir, um modelo pré-treinado que precisa de apenas alguns exemplos é a diferença entre um estudo que acontece e um que não acontece.

O lançamento também é um modelo a seguir. A Lua foi indexada por um modelo criado para um tipo específico de imagens, alimentado com a física que determina a aparência dessas imagens e treinado com dados que estavam em arquivos por dezessete anos esperando para serem processados. O mesmo padrão se aplica a qualquer domínio com observações não rotuladas abundantes e rótulos escassos, o que corresponde à maior parte do sensoriamento remoto científico.

Artigos relacionados