NASAとIBM、17年分の周回機データで訓練した月基盤モデルをオープンソース化

17年間月を見続けたことで、NASAの他のすべての惑星ミッションを合わせたよりも多くのデータが生み出された。それを機械学習に使える形にする方が難しい問題だった。
10月5日、NASAとIBM Researchは、複数の学術機関と協力して、NASA-IBM Lunar Foundation Modelを公開した。モデルはオープンソースで、Hugging Faceに公開され、コードはGitHubにあり、オープンソースのTerraTorchツールキットに統合されている。事前学習データセットとベンチマークコレクションも同時に公開された。
このモデルは、最良のベースラインであるSwinV2-Bと比較して、極域氷堆積物予測の誤差を最大22パーセント削減し、粗いスケールのクレーター検出を約19パーセント改善しつつ、ラベル付きデータは半分しか使用しない。
なぜタスク特化型ではなく基盤モデルなのか
月科学には奇妙なデータ問題がある。観測データは豊富だ。ラベルは乏しい。あるスケールのクレーター検出用、別の氷安定性用、また別の表面セグメンテーション用にモデルを構築することは、毎回ゼロから、小さなラベル付きセットで、基盤となる共有表現もなく作ることを意味する。
基盤モデルはそれを逆転させる。大量のラベルなしデータで事前学習し、少数のラベル付き例だけで特定のタスクに適応する。NASAの首席科学データ責任者であるケビン・マーフィーは、まさにその文脈で今回の公開を位置づけた。NASAは数十年をかけて月の科学的記録を築いてきたが、データを集めることは仕事の一部にすぎない。残りは、科学者がそれを使いやすくすることだ。
訓練コーパスはSomBenchで、これまでに構築された中で最大の位置合わせ済みマルチモーダル月データセットと説明されている。11のモダリティ、2つの空間スケールにわたる約200万のタイルバンドルを含む。約100万枚の高解像度画像は、1ピクセル約1メートルの狭角カメラ(Narrow Angle Camera)から来ている。約964,000枚のマルチスペクトル画像は、1ピクセル100メートルの広角カメラ(Wide Angle Camera)から来ている。大部分はルナー・リコネッサンス・オービターに由来し、GRAIL、ルナ・プロスペクター、JAXAのかぐや探査機からのデータで補完されている。4つのミッションにわたる9つの機器からの、空間的に整列された30以上のデータ層である。

作業の大半を担った設計上の選択
アーキテクチャはマルチモーダル地球観測モデルであるTerraMindを適応させたものだが、チームは既存モデルを微調整するのではなく、月版をゼロから訓練した。月には大気も天候もないため、地球モデルから受け継いだ仮定は役に立たないどころか、積極的に誤解を招くものになる。月では、物がどう見えるかは主にどのように照らされているかで決まる。
その観察が第二の重要な決定を導いた。モデルは各タイルについて撮像幾何を明示的なコンテキストとして受け取る。照明角度、太陽位置、タイル範囲だ。生のピクセルから照明を推測するのではなく、与えられる。より示唆的な発見の一つは、ランダム初期化を施したアーキテクチャ上同一の対照モデルが、氷予測では依然として競争力のある性能を示したことだ。研究者たちはこれを、データ処理方法そのものが利得の多くを担っている証拠と捉えた。
FlexiViTがパッチサイズの変動を扱い、訓練済みモデルが再訓練なしに異なる画像スケールのタスクへ適応できるようにする。
ベンチマークと著者らが挙げた限界
チームは100メートルおよび1メートルスケールでのクレーター検出、極域氷堆積物予測、不規則海斑のセグメンテーションでモデルをテストした。事前学習済みモデルは一般的なベースラインとランダム初期化対照に匹敵するか、それを上回った。氷予測で最大の改善が見られた。
技術報告書は、モデルにできないことを明確にしている。絶対的な測地測位には適していない。生成テストでは、緯度と経度が数十度ずれる場合があり、形状再構成が正しくても、標高構造が絶対高さの値がずれた状態で現れた。IBM Research Europeのフアン・ベルナベ=モレノは、このモデルを物理測定の代替ではなく、下流の月研究のための再利用可能な基盤と表現した。
その区別は公開全体を通底している。モデルは分析を加速する。永久影領域で水氷が安定して存在しうる場所を推定し、クレーターを地図化して表面年代を見積もり、火山研究のために不規則海斑をフラグ立てする。しかし、採掘可能な資源が存在することを確認するものでも、着陸地点が安全であることを保証するものでもない。
できないこと
報告書自身の限界セクションは注意深く読む価値がある。なぜなら、研究ツールと計測器の境界を定義しているからだ。モデルは絶対測地測位には適していない。生成テストでは、緯度と経度が数十度ずれる場合があり、再構成された形状が正しくても、標高構造は絶対高さの値がずれて現れた。
実践に置き換えると、モデルは特徴を見つけて特徴づけるには有用だが、それらが正確にどこにあるかを高精度で述べるには信頼できない。ミッション計画者は、極域氷の候補領域を絞り込むために使い、その後、的を絞った測定で確認できる。その出力を測量グレードの座標として扱うチームは、それを誤用していることになる。
著者らも同じように今回の公開を位置づけている。物理測定の代替ではなく、下流研究のための再利用可能な基盤として。範囲についてのこの正直さが、この公開を使い物にする。なぜなら、どのタスクをモデルに任せるべきか、どのタスクを大変な方法で続けるべきかを、下流チームに示しているからだ。
地球モデルの適応が重要な理由
TerraMindは地球観測向けに作られた。そこでは画像は大気、植生の周期、人間活動によって形作られる。アーキテクチャを適応させつつゼロから訓練することは、意図的な中間路だ。チームは一般化するもの、すなわちマルチモーダルで空間的に整列したデータを扱う仕組みを残し、一般化しないもの、すなわち表面がどう見えるべきかに関するあらゆる仮定を捨てた。
照明を入力にする決定は、その区別がなぜ重要かを示している。地球上では、衛星画像には十分な視覚的冗長性があり、モデルはテクスチャと影から照明をしばしば推測できる。月では、表面は大部分が均一で、影が信号だ。太陽角度と照明幾何を、モデルに再構成させるのではなく直接渡すことで、すでに与えられている物理を再導出するのではなく、科学タスクに能力を使えるようになった。
これは転用できるパターンだ。物理測定が計算は容易でもモデルが推測するには高コストな領域は、明示的な条件付けの候補になる。ステレオからの深度、大気補正、センサー校正などだ。月は交絡変数が非常に少ないため、都合よくこの事例を示した。
ここでオープン公開が意味するもの
モデルとそのデータセットをオープンソース化することは、参加できる人を変える。NASAとIBMの外の研究チームが、公開された結果を再現し、自分たちの問題でモデルを微調整し、データアクセスを交渉することなく将来ミッション向けのアプリケーションを構築できる。ラベル付き月データの作成が高コストなとき、少数の例だけを必要とする事前学習済みモデルは、研究が行われるか行われないかの差になる。
今回の公開はテンプレートでもある。月は、特定の種類の画像向けに作られたモデルによって索引付けされ、その画像がどう見えるかを決める物理を与えられ、17年間アーカイブで処理されるのを待っていたデータで訓練された。同じパターンは、ラベルなし観測が豊富でラベルが乏しいあらゆる領域に当てはまる。それは科学リモートセンシングのほとんどだ。
関連記事
Cloudflare、Jevの得意分野でJevを凌ぐ27B意思決定モデルを投入
一部のモデル呼び出しは、段落ではなく数値を返すべきだ。その考えを中心にカテゴリーが形成されつつある。
BOSSFIGHTはフロンティアモデルを24週間コーヒーショップのオーナーとして走らせた。大半は「何もしない」に敗れた。
クイズで賄賂を断ることと、実際の四半期で屈しないことは、二つの異なるスキルであり、現在の評価はより易しい方を測りがちだ。
40ステップではなく4ステップ:蒸留はいかにしてオープン画像モデルをコンシューマー向けGPUに押し込んでいるか
低ステップ蒸留はトレードオフであり、ただで得られるものではない。テキストの忠実度、編集の精度、マルチリファレンスの一貫性が最初に犠牲になる。
エージェントが今週、短編映画を監督し始めた。ボトルネックは品質管理に移った。
生成は安価であり、オーケストレーションが製品であり、パイプラインが有用かどうかを決めるのは、自らが失敗したときにそれを認識できるかどうかだ。