← 返回博客
Ai预计阅读 10 分钟

NASA 与 IBM 开源基于 17 年轨道器数据训练的月球基础模型

发布于 2026年10月6日
NASA 与 IBM 开源基于 17 年轨道器数据训练的月球基础模型

对月球持续观测十七年所产生的数据,超过了 NASA 其他所有行星任务的总和。而让它可用于机器学习,才是更难的问题。

10 月 5 日,NASA 与 IBM Research 携手多家学术机构,发布了 NASA-IBM 月球基础模型。该模型是开源的,已发布在 Hugging Face 上,代码在 GitHub 上,并集成到开源 TerraTorch 工具包中。预训练数据集和基准集合也随之一同发布。

与最佳基线 SwinV2-B 相比,该模型将极地冰沉积预测误差最多降低 22%,并将粗尺度撞击坑检测提升近 19%,同时仅使用一半的标注数据。

为什么选择基础模型而不是特定任务模型

月球科学有一个奇特的数据问题。观测数据充足,标注却稀缺。为某一尺度上的撞击坑检测构建一个模型,为冰稳定性构建另一个,再为地表分割构建另一个,意味着每次都要从小型标注集从头构建,底层没有共享表示。

基础模型扭转了这一点。它先在海量无标注数据上预训练,然后仅用少量标注样本适配特定任务。NASA 首席科学数据官凯文·墨菲(Kevin Murphy)正是这样描述此次发布的:NASA 用数十年建立了月球的科学记录,而收集数据只是工作的一部分。其余部分是让科学家更容易使用这些数据。

训练语料库是 SomBench,被描述为迄今组装的最大共配准多模态月球数据集:涵盖十一种模态和两个空间尺度,包含近两百万个瓦片包。约一百万张高分辨率图像来自窄角相机,分辨率约为每像素一米。近 964,000 张多光谱图像来自广角相机,分辨率为每像素 100 米。大部分数据可追溯到月球勘测轨道飞行器(Lunar Reconnaissance Orbiter),并辅以 GRAIL、月球勘探者号(Lunar Prospector)和 JAXA 辉夜号(Kaguya)探测器的数据。来自四次任务、九台仪器的 30 多个空间对齐数据层。

一块灰色岩石样本置于浅色石质基座上,其后有一道细细的弧形光

起了最大作用的设计选择

该架构改编自多模态地球观测模型 TerraMind,但团队从头训练月球版本,而不是微调现有模型。月球没有大气层,也没有天气,因此从地球模型继承的假设会变得比无用更糟:主动产生误导。在月球上,某物看起来如何,很大程度上取决于它如何被照亮。

这一观察推动了第二个关键决策。模型将成像几何作为每个瓦片的显式上下文接收:光照角度、太阳位置、瓦片范围。它不是从原始像素推断光照,而是被直接告知。更具说明力的发现之一是,一个架构完全相同但随机初始化的对照模型在冰预测上仍表现出了竞争力,研究人员将此视为证据,表明数据处理方法本身带来了很大一部分增益。

FlexiViT 处理图像块尺寸变化,使训练后的模型无需重新训练即可适应不同图像尺度的任务。

基准测试与作者指出的局限

团队在 100 米和 1 米尺度的撞击坑检测、极地冰沉积预测以及不规则月海斑块分割上测试了该模型。预训练模型达到或超过了常见基线以及随机初始化对照模型。冰预测的增益最大。

技术报告明确说明了该模型不能做什么。它不适合绝对大地定位。在生成测试中,纬度和经度有时偏差达数十度,即使形状重建正确,高程结构也会以偏移的绝对高度值出现。IBM Research Europe 的 Juan Bernabé-Moreno 将该模型描述为下游月球研究的可复用基础,而不是物理测量的替代品。

这一区分贯穿整个发布。该模型加速分析:它估计水冰在永久阴影区可能保持稳定的位置,绘制撞击坑以估算地表年龄,并标记不规则月海斑块以供火山研究。它不确认存在可开采资源,也不保证某地点可安全着陆。

它不能做什么

报告自身的局限性部分值得仔细阅读,因为它界定了研究工具与仪器之间的边界。该模型不适合绝对大地定位:在生成测试中,纬度和经度有时偏差达数十度,即使重建形状正确,高程结构也会以偏移的绝对高度值出现。

转化为实践,这意味着该模型可用于发现和表征特征,但在高精度说明特征确切位置方面不可靠。任务规划者可以用它缩小极地冰的候选区域,然后通过有针对性的测量加以确认。若团队将其输出视为测量级坐标,则是在误用该模型。

作者也以同样方式描述此次发布:它是下游研究的可复用基础,而不是物理测量的替代品。这种对适用范围的坦诚正是该发布可用的原因,因为它告诉下游团队哪些任务可以信任模型,哪些任务仍需用费力方式完成。

为什么地球模型的适配很重要

TerraMind 是为地球观测构建的,在地球观测中,影像受到大气、植被周期和人类活动的影响。改编其架构同时从头训练,是一条刻意的中间道路。团队保留了能够泛化的部分,即处理多模态、空间对齐数据的机制,并舍弃了不能泛化的部分,即任何关于地表应该是什么样子的假设。

将光照作为输入的决定说明了为什么这一区分很重要。在地球上,卫星图像带有足够的视觉冗余,模型通常可以从纹理和阴影推断光照。在月球上,地表大体均匀,阴影就是信号。直接将太阳角度和光照几何交给模型,而不是要求它重建这些信息,让它能把容量花在科学任务上,而不是重新推导已经给它的物理信息。

这是一种可以迁移的模式。任何物理测量容易计算但模型推断代价高昂的领域,都适合进行显式条件化:立体深度、大气校正、传感器校准。月球恰好干净地证明了这一点,因为它的混杂变量极少。

开放发布在这里意味着什么

开源模型及其数据集改变了谁可以参与。NASA 和 IBM 之外的研究团队可以复现已发表的结果,在自己的问题上微调模型,并为未来任务构建应用,而无需协商数据访问权限。当标注月球数据的生产成本高昂时,一个只需少量样本的预训练模型,就是一项研究能否发生之间的差别。

这次发布也是一个模板。月球被一个为特定类型影像构建的模型索引,该模型被喂入决定此类影像外观的物理信息,并在档案中等待处理长达十七年的数据上训练。同样的模式适用于任何拥有大量无标注观测和稀缺标注的领域,而这正是大多数科学遥感的情况。

相关文章