# DeepGraph 第一轮交付 · NASA 光谱数据建模与无标签瓶颈

**提交方向**: 利用 NASA 等机构的光谱数据建立模型  
**目标档位**: 文献查新和方向判断 · **投稿目标**: 未填写  
**交付时间**: 2026-08-16

---

## 0. 先说一个判断：数据源不是题目，“没有标签”也不能靠换模型自动解决

当前命题与可执行实验尚不完全匹配：NASA 光谱可能指地球高光谱影像、行星实验室光谱、恒星光谱或质谱，四者的数据结构、标签和评估标准都不同；在没有预测对象和真值定义时，模型精度没有可解释含义。

两条出路：

1. 补齐具体仪器/产品、预测目标、样本单位和可获得真值，再设计正式科学实验。
2. 在补齐前，先做一个不替用户选题的“低标签可行性诊断”：用 NASA/JPL 公开光谱库的目录元数据作为代理标签，检验无标签预训练是否真的比 PCA 加线性模型更省标签。它只能回答方法可行性，不能代替真实研究结论。

正式立项前必须补齐：①光谱类型及公开产品 URL/版本；②分类、回归、异常检测还是反演；③目标变量的物理定义；④一个样本究竟是像元、地点、天体还是实验样品；⑤真值来源及可人工标注数量；⑥按地点、样品、时间或仪器划分训练测试集的规则；⑦最终应用范围与可接受误差。

## 1. 领域现状：宽口径下已经很拥挤，但各分支不存在统一的“NASA 光谱模型”基线

仅近 12–18 个月的代表性公开工作，就已经覆盖三条不同路线：

- 地球高光谱方向已有 2025 年 TPAMI 的 **HyperSIGMA**，预训练集约 45 万幅高光谱影像，模型可扩展至十亿参数；CVPR 2025 的 **HyperFree** 又直接处理跨传感器、通道数变化的问题。该分支已经不是“把深度学习用于高光谱”本身即可构成贡献的阶段。
- 天文一维光谱方向，2025 年出现了跨 LAMOST/Gaia XP 的 **SpecCLIP**，以及联合 SDSS、DESI、GALAH、APOGEE 的 **Universal Spectral Tokenization**。后者明确比较了任务专用模型，并使用 4 张 A100 训练约 48 小时，不能在本轮 CPU 预算内复现。
- NASA/IBM 的 **Prithvi-EO-2.0** 已成为地球观测基础模型的重要公开参照：它使用约 420 万个 HLS 时序样本，提供 3 亿和 6 亿参数版本。但它处理的是六通道、多时相地球观测影像，不是通用的一维实验室或天文光谱模型，不能仅因数据来自 NASA 就当作公平基线。

已经进入 NASA 数据产品链的代表不是端到端神经分类器，而是带物理和不确定度定义的产品。例如 EMIT L2B 矿物产品使用 Tetracorder 光谱匹配，围绕 10 种核心矿物输出矿物标识、谱带深度、拟合分数和不确定度。这意味着只要研究目标涉及 EMIT 矿物识别，审稿人会要求与官方 L2B 产品或其物理匹配流程比较，而不只与另一个神经网络比较。

因此，目前无法给出一个可信的“赛道论文数量”：提交方向横跨至少地球遥感、行星科学和天文光谱三个独立文献群。把它们合并计数会制造虚假的拥挤度。

## 2. 查新去重与仍未覆盖的部分

近 18 个月已经明确被覆盖的内容包括：

- 用大规模无标签高光谱影像进行自监督预训练，再迁移到分类、解混、异常检测等任务；
- 适配不同传感器通道数和波长配置的高光谱基础模型；
- 跨天文巡天、跨分辨率学习统一光谱表征；
- 在有限标签条件下使用主动学习、降维或自监督表征提升高光谱分类；
- 由 NASA 官方处理链直接产生矿物类型、拟合度和不确定度等高层产品。

“没有标签”不等于“没有任何可用监督信息”。NASA/JPL 的 ECOSTRESS 光谱库包含 3400 余条自然及人造材料光谱，并带有类别、样品和来源等辅助信息；NASA PDS 也有专门描述实验室光谱及样品分类的 Spectral Library 数据字典。必须先区分三种情况：

- 完全没有目标变量：不能训练或验证监督模型，只能做聚类、异常排序或表征学习；
- 有目录、物理反演结果或弱标签：可以做弱监督，但必须审计标签是否由输入光谱本身推导，避免循环验证；
- 有少量独立真值：可以研究标签效率、主动学习或迁移，但测试真值必须与训练标签独立。

目前仍未覆盖的不是某个已确认的算法组合，而是提交信息中的科学定义：尚不知道要预测什么、对谁预测、如何判定正确。因此不能据此宣称存在“文献空白”，也不能自行把方向改写成矿物分类、恒星参数回归或作物识别。

## 3. 评审会打你的三个点（提前堵）

1. **“模型预测的到底是什么？”**  
   “建立模型”不是研究问题。必须把输出写成可核验变量，并交代真值来自实验测量、专家标注、官方反演产品还是目录元数据。若标签由同一条光谱的规则匹配生成，模型只能证明能模仿该规则，不能证明发现了新的物理关系。

2. **“随机切分是否把同一样品或地点泄漏到了测试集？”**  
   光谱库常包含同一样品的重复测量、不同粒径、不同仪器或相邻像元。按单条光谱随机切分会显著高估泛化能力。正式实验必须按样品、地点、观测批次或天体分组切分，并单独报告跨仪器、跨区域或跨时间性能。

3. **“复杂模型是否真的比简单光谱方法有用？”**  
   在几千条光谱和极少标签下，PCA、光谱角、正则化线性模型、SVM 或官方物理匹配流程可能比小型神经网络更稳。必须加入多数类零模型、PCA 加线性分类器以及任务相关的物理基线；负结果不能只归因于“数据太少”。

## 4. 我们这一轮真去跑的对照矩阵

由于正式科学目标尚未定义，这一轮只运行**低标签方法诊断**，不把“材质分类”替用户确定为研究题目。

使用 NASA/JPL ECOSTRESS Spectral Library 1.0。下载六个样本量相对充足的目录：mineral、rock、soil、vegetation、non-photosynthetic vegetation、man-made。目录名仅作为代理标签；训练前对模型隐藏测试标签。

预处理固定为：

- 仅保留覆盖 0.4–2.5 μm 至少 80% 且元数据可解析的反射光谱；
- 插值到共同的 256 点波长网格；
- 每条光谱做中位数缩放，再按训练集统计量标准化；
- 同一样品编号、同一基础文件名或可识别的重复测量作为一个 group；
- 70% group 作为训练池、30% group 作为测试集；PCA、自编码器及标准化参数均不得接触测试集；
- 若任一类别清洗后不足 30 个独立 group，保留并报告数据审计结果，但不对该类别作模型优劣结论。

对照臂：

| 实验臂 | 作用 | 公平性约束 |
|---|---|---|
| 多数类预测 | 平凡零模型，判断指标是否只是类别不平衡造成 | 使用训练标签估计多数类 |
| 原始光谱 + L2 Logistic Regression | 检验不做表征学习时的线性可分性 | 与其他监督臂使用完全相同的标签子集 |
| PCA + L2 Logistic Regression | 低样本光谱分析的简单强基线 | PCA 只在无标签训练池拟合 |
| 掩码浅层自编码器 + 线性探针 | 检验无标签预训练是否增加标签效率 | 仅使用无标签训练池预训练，分类头使用相同标签子集 |

浅层自编码器使用 `256→64→latent→64→256` 的 MLP，ReLU，随机遮挡 15% 波长点，最多 50 epoch，early stopping patience 为 5；不使用 Transformer、卷积基础模型或外部预训练权重。该规模在约 3400 条光谱、2 核 CPU 上应远低于单次 15 分钟限制。

**可被推翻的预测**：在该小型光谱库和极低标签预算下，掩码自编码器的 macro-F1 不会稳定超过 PCA 加 Logistic Regression 0.05；若它在每类 5 个和 20 个标签两个档位上均提高超过 0.05，且三个种子的差值全部为正，则该预测被推翻。

需要扫描的自变量：

- 每类人工标签数：1、5、20；
- PCA 维数：8、16、32；
- 自编码器 latent 维数：8、16；
- Logistic Regression 的 `C`：0.1、1、10，只能在训练池内部交叉验证选择。

主指标：

| 指标 | 口径 | 为什么 |
|---|---|---|
| Macro-F1 | 六类 F1 的非加权平均；若类别因审计被排除，明确列出剩余类别 | 不让 mineral 等大类掩盖小类失败 |
| Balanced accuracy | 各类别召回率平均 | 便于解释每类是否均有可用识别率 |
| 标签效率曲线面积 | 对 1、5、20 labels/class 下的 macro-F1 按对数标签数积分并归一化 | 回答无标签预训练是否真的节省标注 |
| 训练时间 | 单臂 wall-clock 秒数，不含下载 | 防止用明显更高计算成本换取微小提升 |

统计口径：

- 使用随机种子 0、1、2；每个种子重新完成 group 划分和标签抽样；
- 报告三个种子的均值、标准差及每个种子的原始值，不用 `n=3` 强行宣称显著性；
- 同一种子内所有模型共享测试集和已标注样本；
- 超参数只能在训练池内部选择，测试集只评估一次；
- 额外运行标签随机置乱对照；其 macro-F1 应接近随机水平，否则优先排查泄漏；
- 负结果、清洗后样本数、失败类别、训练日志和耗时全部保留。

这一轮做不到：

- 不能证明无监督聚类对应真实物质、天体类型或科学机制；
- 不能评估目标 NASA 航天数据，因为具体任务和产品尚未给出；
- 不能证明实验室光谱模型能迁移到轨道影像或其他仪器；
- 不能复现 HyperSIGMA、HyperFree、Prithvi 或大型天文光谱模型的预训练；
- 不能在完全没有独立标签时报告“准确率”；
- 不能据代理任务替用户确定论文题目、科学假设或解释。

## 5. 参考来源

- [ECOSTRESS Spectral Library — Version 1.0（NASA/JPL，3400 余条光谱）](https://speclib.jpl.nasa.gov/)
- [ECOSTRESS Spectral Library Download（NASA/JPL，各类别及文件数量）](https://speclib.jpl.nasa.gov/download)
- [EMIT L2B Estimated Mineral Identification and Band Depth and Uncertainty 60 m V001（NASA Open Data Portal）](https://data.nasa.gov/dataset/emit-l2b-estimated-mineral-identification-and-band-depth-and-uncertainty-60-m-v001-7fe29)
- [Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications（NASA NTRS）](https://ntrs.nasa.gov/citations/20240015391)
- [HyperSIGMA: Hyperspectral Intelligence Comprehension Foundation Model（论文与官方代码）](https://github.com/whu-sigma/hypersigma)
- [HyperFree: A Channel-adaptive and Tuning-free Foundation Model for Hyperspectral Remote Sensing Imagery（CVPR 2025）](https://openaccess.thecvf.com/content/CVPR2025/html/Li_HyperFree_A_Channel-adaptive_and_Tuning-free_Foundation_Model_for_Hyperspectral_Remote_CVPR_2025_paper.html)
- [SpecCLIP: Aligning and Translating Spectroscopic Measurements for Stars（2025）](https://arxiv.org/abs/2507.01939)
- [Universal Spectral Tokenization via Self-Supervised Panchromatic Representation Learning（2025）](https://arxiv.org/abs/2510.17959)
- [An End-to-End Active Learning Framework for Limited Labelled Hyperspectral Image Classification（2025）](https://doi.org/10.1080/01431161.2025.2467294)
- [NASA PDS Data Dictionaries — Spectral Library and Spectral Metadata](https://pds.nasa.gov/datastandards/dictionaries/index-1.20.0.0.shtml)

---

*本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索，已标注出处；判断部分是我们的观点，可以被反驳。*

```json
{
  "task_slug": "ecostress-low-label-diagnostic",
  "question": "在NASA/JPL ECOSTRESS光谱库的代理材质分类中，无标签掩码自编码预训练能否在每类仅有1、5或20个标签时稳定优于PCA加线性分类器？",
  "falsifiable_prediction": "掩码自编码器的macro-F1不会稳定超过PCA加Logistic Regression 0.05；若其在每类5个和20个标签两个档位均提高超过0.05且三个种子的差值全部为正，则预测被推翻。",
  "dataset": "NASA/JPL ECOSTRESS Spectral Library Version 1.0；从 https://speclib.jpl.nasa.gov/download 下载mineral、rock、soil、vegetation、non-photosynthetic vegetation和man-made类别，解析光谱及辅助元数据。",
  "arms": [
    {
      "name": "baseline-majority",
      "is_baseline": true,
      "what": "始终预测训练标签中的多数类别，作为平凡零模型。"
    },
    {
      "name": "baseline-raw-logreg",
      "is_baseline": true,
      "what": "共同波长网格上的标准化原始反射率输入L2正则Logistic Regression。"
    },
    {
      "name": "baseline-pca-logreg",
      "is_baseline": true,
      "what": "仅在无标签训练池拟合PCA，再用相同标签子集训练L2正则Logistic Regression。"
    },
    {
      "name": "proposed-masked-ae-linear",
      "is_baseline": false,
      "what": "在无标签训练池上训练256-64-latent-64-256浅层掩码自编码器，冻结编码器后使用相同标签子集训练线性探针。"
    },
    {
      "name": "control-shuffled-labels",
      "is_baseline": true,
      "what": "保持光谱和划分不变，在训练池内置乱标签后训练PCA加Logistic Regression，用于检测泄漏或错误评估。"
    }
  ],
  "metrics": [
    {
      "name": "macro_f1",
      "higher_is_better": true,
      "what": "各保留类别F1的非加权平均；同时输出逐类F1。"
    },
    {
      "name": "balanced_accuracy",
      "higher_is_better": true,
      "what": "各类别召回率的算术平均。"
    },
    {
      "name": "label_efficiency_auc",
      "higher_is_better": true,
      "what": "对1、5、20 labels/class下的macro-F1按对数标签数积分并归一化。"
    },
    {
      "name": "wall_time_seconds",
      "higher_is_better": false,
      "what": "每个实验臂的CPU墙钟运行时间，不含数据下载。"
    }
  ],
  "sweep": {
    "labels_per_class": [1, 5, 20],
    "pca_components": [8, 16, 32],
    "autoencoder_latent_dim": [8, 16],
    "logistic_c": [0.1, 1, 10],
    "masked_fraction": [0.15]
  },
  "seeds": [0, 1, 2],
  "budget_minutes": 45,
  "cpu_feasible": true,
  "out_of_scope": [
    "替用户选择正式科学题目、预测变量或物理解释",
    "将目录代理标签视为目标NASA数据的真实科学标签",
    "在轨EMIT、天文或行星任务上的跨仪器泛化结论",
    "大型基础模型预训练或GPU复现",
    "完全无独立标签条件下的准确率声明",
    "论文投稿档位与发表可能性判断"
  ]
}
```