{
 "task_slug": "ecostress-low-label-diagnostic",
 "question": "在NASA/JPL ECOSTRESS光谱库的代理材质分类中，无标签掩码自编码预训练能否在每类仅有1、5或20个标签时稳定优于PCA加线性分类器？",
 "falsifiable_prediction": "掩码自编码器的macro-F1不会稳定超过PCA加Logistic Regression 0.05；若其在每类5个和20个标签两个档位均提高超过0.05且三个种子的差值全部为正，则预测被推翻。",
 "dataset": "NASA/JPL ECOSTRESS Spectral Library Version 1.0；从 https://speclib.jpl.nasa.gov/download 下载mineral、rock、soil、vegetation、non-photosynthetic vegetation和man-made类别，解析光谱及辅助元数据。",
 "arms": [
  {
   "name": "baseline-majority",
   "is_baseline": true,
   "what": "始终预测训练标签中的多数类别，作为平凡零模型。"
  },
  {
   "name": "baseline-raw-logreg",
   "is_baseline": true,
   "what": "共同波长网格上的标准化原始反射率输入L2正则Logistic Regression。"
  },
  {
   "name": "baseline-pca-logreg",
   "is_baseline": true,
   "what": "仅在无标签训练池拟合PCA，再用相同标签子集训练L2正则Logistic Regression。"
  },
  {
   "name": "proposed-masked-ae-linear",
   "is_baseline": false,
   "what": "在无标签训练池上训练256-64-latent-64-256浅层掩码自编码器，冻结编码器后使用相同标签子集训练线性探针。"
  },
  {
   "name": "control-shuffled-labels",
   "is_baseline": true,
   "what": "保持光谱和划分不变，在训练池内置乱标签后训练PCA加Logistic Regression，用于检测泄漏或错误评估。"
  }
 ],
 "metrics": [
  {
   "name": "macro_f1",
   "higher_is_better": true,
   "what": "各保留类别F1的非加权平均；同时输出逐类F1。"
  },
  {
   "name": "balanced_accuracy",
   "higher_is_better": true,
   "what": "各类别召回率的算术平均。"
  },
  {
   "name": "label_efficiency_auc",
   "higher_is_better": true,
   "what": "对1、5、20 labels/class下的macro-F1按对数标签数积分并归一化。"
  },
  {
   "name": "wall_time_seconds",
   "higher_is_better": false,
   "what": "每个实验臂的CPU墙钟运行时间，不含数据下载。"
  }
 ],
 "sweep": {
  "labels_per_class": [
   1,
   5,
   20
  ],
  "pca_components": [
   8,
   16,
   32
  ],
  "autoencoder_latent_dim": [
   8,
   16
  ],
  "logistic_c": [
   0.1,
   1,
   10
  ],
  "masked_fraction": [
   0.15
  ]
 },
 "seeds": [
  0,
  1,
  2
 ],
 "budget_minutes": 45,
 "cpu_feasible": true,
 "out_of_scope": [
  "替用户选择正式科学题目、预测变量或物理解释",
  "将目录代理标签视为目标NASA数据的真实科学标签",
  "在轨EMIT、天文或行星任务上的跨仪器泛化结论",
  "大型基础模型预训练或GPU复现",
  "完全无独立标签条件下的准确率声明",
  "论文投稿档位与发表可能性判断"
 ]
}