发生了什么
NASA 与 IBM Research 于 9 月 10 日联合发布 NASA-IBM 月球基础模型,在 Hugging Face 上以 Apache 2.0 许可开放权重,完整微调代码同步在 GitHub 上线并集成进 TerraTorch 工具链。这是首批专门面向月球科学构建的开源 AI 模型之一,训练数据主要来自 NASA 月球勘测轨道飞行器(LRO)17 年的观测记录,并融合 NASA 圣杯号重力探测器、月球勘探者号以及日本 SELENE/Kaguya 的数据。
关键数据
- 配套数据集 SomBench 汇聚约 200 万块配准瓦片,覆盖四个任务的九类仪器、30 余个空间对齐数据层
- 包含逾 100 万张 1 米分辨率高分辨率相机影像,以及近 96.4 万张 100 米分辨率多光谱影像
- 在月极区冰潜势估计上,相对 SwinV2-B 基线误差最高降低约 22%
- 在 100 米尺度陨石坑识别上,相对同一基线提升近 19%,且仅使用约一半的标注样本
为什么重要
LRO 单一任务产生的数据量就超过 NASA 其他所有行星探测任务的总和,但这些影像、激光测高、雷达反射率与光谱数据长期分属不同格式、分辨率与拍摄角度,过去需要研究人员手工对齐与换算。该模型把「多源异构观测转化为可复用数据资产」做成了标准件:先在大规模无标注数据上预训练,再以少量标注微调迁移到具体任务,当前可服务极区水冰探测、陨石坑测绘与着陆区选择、以及不规则月海斑块这类疑似年轻火山地貌的识别。对企业侧而言,真正可迁移的是方法论——把分散的专业数据统一为可训练的底座,是 AI 在垂直行业落地的先决条件。
仍需观察
官方口径明确该模型是模式识别助手,不替代实地测量,水冰潜势结果仍需后续探测任务验证。模型效果高度依赖 SomBench 的数据质量与覆盖度,跨机构复现能力与长期维护成本尚未公开披露。此外,月球表面缺少大气散射,阴影边缘锐利且像素不含信息,团队为此把太阳入射角与飞船位置等元数据显式注入模型结构,这一处理方式能否推广到火星等其他天体仍待验证。

