{
 "task_slug": "mosi-modality-dropout-robustness",
 "question": "在固定预提取特征、分类器和调参预算下，训练期整模态丢弃能否提高CMU-MOSI二分类模型面对未知模态缺失时的稳健性？",
 "falsifiable_prediction": "模态丢弃训练相对完整样本早期融合基线将使macro-F1缺失率曲线下面积提高至少0.02，且完整模态macro-F1下降不超过0.02；任一条件不满足即推翻预测。",
 "dataset": "CMU-MOSI word-aligned预处理特征aligned_50.pkl；按MultiBench下载说明获取，公开文件页：https://huggingface.co/datasets/tamb2203579/CMU-MOSI/tree/main/Processed；使用文件内官方train/valid/test划分",
 "arms": [
  {
   "name": "baseline-complete-early-fusion",
   "is_baseline": true,
   "what": "对文本、音频、视觉有效时间步分别计算均值和标准差后拼接，仅用完整训练样本拟合L2逻辑回归。"
  },
  {
   "name": "proposed-group-modality-dropout",
   "is_baseline": false,
   "what": "使用相同池化特征和L2逻辑回归，训练时随机遮蔽整组模态并追加三个模态存在指示变量；禁止三模态同时为空。"
  }
 ],
 "metrics": [
  {
   "name": "macro_f1",
   "higher_is_better": true,
   "what": "排除标签为0的样本后，对正负两类F1取非加权平均。"
  },
  {
   "name": "balanced_accuracy",
   "higher_is_better": true,
   "what": "正负两类召回率的算术平均。"
  },
  {
   "name": "robustness_auc",
   "higher_is_better": true,
   "what": "在测试缺失率0、0.25、0.50、0.75上的macro-F1做归一化梯形积分。"
  },
  {
   "name": "clean_macro_f1_delta",
   "higher_is_better": true,
   "what": "缺失率为0时实验臂macro-F1减去基线macro-F1，用于检查稳健性是否以清洁性能为代价。"
  }
 ],
 "sweep": {
  "logistic_C": [
   0.1,
   1,
   10
  ],
  "train_modality_dropout": [
   0.25,
   0.5
  ],
  "test_missing_rate": [
   0,
   0.25,
   0.5,
   0.75
  ]
 },
 "seeds": [
  0,
  1,
  2
 ],
 "budget_minutes": 45,
 "cpu_feasible": true,
 "out_of_scope": [
  "训练或调用LLM及多模态大模型",
  "重新提取原始视频、语音或文本深度特征",
  "真实噪声、遮挡和ASR错误模拟",
  "跨语料、跨语言与跨文化验证",
  "真实患者数据及任何临床有效性结论",
  "诊断、治疗建议或生产部署"
 ]
}