NASA와 IBM, 17년간의 궤도선 데이터로 훈련된 달 파운데이션 모델을 오픈소스로 공개

17년 동안 달을 관측한 결과는 NASA의 다른 모든 행성 탐사 임무를 합친 것보다 많은 데이터를 만들어냈다. 더 어려운 문제는 그 데이터를 머신러닝에 쓸 수 있게 만드는 일이었다.
10월 5일, NASA와 IBM Research는 여러 학술 기관과 협력하여 NASA-IBM 달 파운데이션 모델을 공개했다. 이 모델은 오픈소스로, Hugging Face에 게시되고 코드는 GitHub에 공개되었으며, 오픈소스 TerraTorch 툴킷에 통합되었다. 사전 훈련 데이터셋과 벤치마크 컬렉션도 함께 공개되었다.
이 모델은 최고의 기준 모델인 SwinV2-B와 비교해 극지방 얼음 퇴적물 예측 오차를 최대 22% 줄였으며, 라벨링된 데이터를 절반만 사용하면서도 광역 규모 크레이터 탐지 성능을 약 19% 향상시켰다.
특정 작업 전용 모델 대신 파운데이션 모델을 쓰는 이유
달 과학에는 독특한 데이터 문제가 있다. 관측 자료는 풍부하지만 라벨은 부족하다. 한 규모의 크레이터 탐지용 모델, 또 다른 규모의 얼음 안정성 모델, 그리고 표면 분할용 모델을 각각 만드는 것은 매번 작은 라벨 세트로 처음부터 구축하는 것을 의미하며, 그 아래에 공유되는 표현이 없다.
파운데이션 모델은 이를 뒤집는다. 대량의 라벨 없는 데이터로 사전 훈련한 뒤, 소수의 라벨링된 예시만으로 특정 작업에 적응한다. NASA의 최고 과학 데이터 책임자인 케빈 머피는 이번 공개를 바로 그런 관점에서 설명했다. NASA는 수십 년간 달에 대한 과학적 기록을 구축해 왔으며, 데이터 수집은 작업의 일부일 뿐이다. 나머지는 과학자들이 더 쉽게 사용할 수 있게 만드는 일이다.
훈련 코퍼스는 SomBench로, 지금까지 구축된 것 중 가장 큰 공동 등록 다중 모달 달 데이터셋으로 설명된다. 11개 모달리티와 2개 공간 규모에 걸친 약 200만 개의 타일 번들이다. 약 100만 장의 고해상도 이미지는 픽셀당 약 1미터 해상도의 협각 카메라(Narrow Angle Camera)에서 나왔다. 약 964,000장의 다중 분광 이미지는 픽셀당 100미터 해상도의 광각 카메라(Wide Angle Camera)에서 왔다. 대부분은 달 정찰 궤도선(Lunar Reconnaissance Orbiter)에서 비롯되었고, GRAIL, Lunar Prospector, JAXA의 카구야 탐사선 데이터로 보완되었다. 4개 임무의 9개 기기에서 얻은 30개 이상의 공간 정렬 데이터 레이어다.

가장 큰 역할을 한 설계 선택
이 아키텍처는 다중 모달 지구 관측 모델인 TerraMind를 차용했지만, 팀은 기존 모델을 미세 조정하는 대신 달 버전을 처음부터 훈련했다. 달에는 대기와 날씨가 없기 때문에 지구 모델에서 물려받은 가정은 쓸모없는 정도를 넘어 적극적으로 오해를 낳는다. 달에서는 어떤 것이 어떻게 보이는지가 대부분 조명에 의해 결정된다.
이 관찰이 두 번째 핵심 결정으로 이어졌다. 모델은 각 타일에 대한 명시적 맥락으로 촬영 기하 정보를 받는다. 조명 각도, 태양 위치, 타일 범위 등이다. 원시 픽셀에서 조명을 추론하는 대신, 조명을 직접 알려주는 것이다. 더 시사적인 발견 중 하나는 무작위 초기화를 사용한 아키텍처 동일 대조 모델이 얼음 예측에서 여전히 경쟁력 있는 성능을 보였다는 점이며, 연구진은 이를 데이터 처리 방식 자체가 상당한 성능 향상을 가져왔다는 증거로 해석했다.
FlexiViT는 패치 크기 변동을 처리하여, 훈련된 모델이 재훈련 없이 다양한 이미지 규모의 작업에 적응할 수 있게 한다.
벤치마크와 저자들이 밝힌 한계
팀은 100미터 및 1미터 규모의 크레이터 탐지, 극지방 얼음 퇴적물 예측, 불규칙한 마레 패치(irregular mare patches) 분할 작업에서 모델을 테스트했다. 사전 훈련된 모델은 일반적인 기준 모델과 무작위 초기화 대조 모델을 따라잡거나 능가했다. 얼음 예측에서 가장 큰 향상이 나타났다.
기술 보고서는 모델이 할 수 없는 일을 명확히 밝히고 있다. 절대 측지 위치 결정에는 적합하지 않다. 생성 테스트에서 위도와 경도가 일부 경우 수십 도나 어긋났으며, 형태 재구성이 정확한 경우에도 고도 구조가 이동된 절대 높이 값으로 나타났다. IBM Research Europe의 후안 베르나베-모레노는 이 모델을 물리적 측정을 대체하는 것이 아니라 후속 달 연구를 위한 재사용 가능한 기반으로 설명했다.
이 구분은 전체 공개 내용에 일관되게 적용된다. 이 모델은 분석을 가속화한다. 영구 음영 지역에서 물얼음이 안정적으로 남을 수 있는 곳을 추정하고, 크레이터를 지도화하여 표면 연대를 추정하며, 화산 연구를 위해 불규칙한 마레 패치를 표시한다. 하지만 개발 가능한 자원이 존재한다는 것을 확인하거나 특정 지점이 착륙하기 안전하다는 것을 보장하지는 않는다.
할 수 없는 것
보고서의 한계 섹션은 주의 깊게 읽을 가치가 있다. 연구 도구와 계측기 사이의 경계를 정의하기 때문이다. 이 모델은 절대 측지 위치 결정에 적합하지 않다. 생성 테스트에서 위도와 경도가 일부 경우 수십 도나 어긋났고, 재구성된 형태가 정확한 경우에도 고도 구조가 이동된 절대 높이 값으로 나타났다.
실제로 옮기면, 이 모델은 지형지를 찾고 특성화하는 데 유용하지만, 그것들이 정확히 어디에 있는지 높은 정밀도로 말하는 데는 신뢰할 수 없다는 뜻이다. 임무 계획자는 이를 사용해 극지방 얼음의 후보 지역을 좁힌 뒤, 표적 측정으로 확인할 수 있다. 모델 출력을 측량 등급 좌표로 취급하는 팀은 이를 오용하는 것이다.
저자들은 이번 공개를 같은 방식으로 규정한다. 물리적 측정을 대체하는 것이 아니라 후속 연구를 위한 재사용 가능한 기반이라는 것이다. 범위에 대한 이런 솔직함이 이 공개를 유용하게 만든다. 후속 팀에게 어떤 작업은 모델에 맡기고 어떤 작업은 어려운 방식으로 계속해야 하는지 알려주기 때문이다.
지구 모델 적응이 중요한 이유
TerraMind는 지구 관측을 위해 만들어졌으며, 여기서 영상은 대기, 식생 주기, 인간 활동에 의해 형성된다. 아키텍처를 차용하면서 처음부터 훈련하는 것은 의도적인 중간 경로다. 팀은 일반화되는 요소, 즉 다중 모달의 공간 정렬 데이터를 처리하는 기계 장치를 유지하고, 그렇지 않은 요소, 즉 표면이 어떻게 보여야 하는지에 대한 모든 가정을 버렸다.
조명을 입력으로 사용하는 결정은 그 구분이 왜 중요한지 보여준다. 지구에서는 위성 영상에 충분한 시각적 중복성이 있어 모델이 질감과 그림자로부터 조명을 종종 추론할 수 있다. 달에서는 표면이 대체로 균일하고 그림자가 곧 신호다. 태양 각도와 조명 기하를 모델이 재구성하도록 요구하는 대신 직접 제공함으로써, 이미 주어진 물리 법칙을 다시 도출하는 데 쓰는 대신 과학 작업에 모델의 역량을 쓸 수 있게 했다.
이것은 전이 가능한 패턴이다. 물리적 측정이 계산하기는 쉽지만 모델이 추론하기에는 비용이 많이 드는 모든 영역이 명시적 조건화의 후보가 된다. 스테레오로부터의 깊이, 대기 보정, 센서 캘리브레이션 등이다. 달은 교란 변수가 거의 없어 이 사례를 깔끔하게 보여줄 수 있었다.
여기서 오픈 공개가 의미하는 것
모델과 데이터셋을 오픈소스로 공개하는 것은 누가 참여할 수 있는지를 바꾼다. NASA와 IBM 외부의 연구팀은 게시된 결과를 재현하고, 자체 문제에 모델을 미세 조정하며, 데이터 접근을 협상하지 않고도 미래 임무용 애플리케이션을 만들 수 있다. 라벨링된 달 데이터를 생산하는 데 비용이 많이 들 때, 몇 개의 예시만 필요로 하는 사전 훈련 모델은 연구가 이루어지느냐 마느냐의 차이를 만든다.
이번 공개는 하나의 템플릿이기도 하다. 달은 특정 종류의 영상을 위해 만들어진 모델로 인덱싱되었고, 그 영상이 어떻게 보이는지를 결정하는 물리 법칙을 입력받았으며, 17년 동안 처리되기를 기다리며 아카이브에 잠들어 있던 데이터로 훈련되었다. 같은 패턴은 라벨 없는 관측은 풍부하고 라벨은 부족한 모든 영역에 적용된다. 대부분의 과학 원격 탐사가 그렇다.
관련 글
BOSSFIGHT, 프런티어 모델을 24주간 커피숍 사장으로 돌려보았다. 대부분은 '아무것도 하지 않기'에 졌다.
퀴즈에서 뇌물을 거절하는 것과 실제 분기에서 흔들리지 않는 것은 서로 다른 두 가지 능력이며, 현재의 평가는 더 쉬운 쪽을 측정하는 경향이 있다.
40단계 대신 4단계: 증류가 오픈 이미지 모델을 소비자용 GPU로 압축하는 방법
저단계 증류는 공짜 점심이 아니라 트레이드오프다. 텍스트 충실도, 편집 정밀도, 다중 참조 일관성이 가장 먼저 희생된다.
이번 주, 에이전트들이 단편 영화를 연출하기 시작했다. 병목은 품질 관리로 옮겨갔다.
생성은 저렴하고, 오케스트레이션이 제품이며, 파이프라인이 유용한지를 결정하는 것은 실패했을 때를 알아차릴 수 있는지 여부다.
Reka Rho-1, 이해와 생성을 동일한 KV 캐시에 담다
카메라 이미지를 예측하는 동일한 가중치가 로봇 움직임도 구동합니다. 둘 다 같은 표현 공간에 존재하기 때문입니다.