# DeepGraph 免费层交付 · 缺失模态下的稳健情感识别

**提交方向**: 多模态情感识别（关键词：LLM、sentiment analysis、medical）  
**目标档位**: 端到端实验交付 · **投稿目标**: 未填写  
**交付时间**: 2026-08-01

---

## 0. 先说一个判断：原命题过宽，且“LLM + 医疗”与本轮 CPU 环境不匹配

不能在 60 分钟 CPU 预算内训练或系统评测多模态大模型，也不能用影评数据证明医疗有效性；提交表中的 L40 也与实际“无 GPU”环境冲突。  
出路一是本轮完成一个可复现的缩小版：在 CMU-MOSI 上检验“整模态缺失时，训练期模态丢弃能否提高稳健性”。它能回答融合机制问题，不能推出临床有效性。  
出路二是后续取得有伦理审批、患者同意和外部验证集的临床音视频数据，再研究医疗场景；在此之前，成果必须定位为方法验证，不能写成诊断或临床决策系统。

## 1. 领域现状：标准榜单已经拥挤，真正没有解决的是可靠性与域外有效性

CMU-MOSI、CMU-MOSEI、IEMOCAP、MELD 已是审稿人默认认识的基准。CMU-MOSI 只有 93 段原始视频、2,199 个话语片段；规模不大，因此复杂网络很容易把数据划分、预训练特征或说话人信息带来的收益误写成模型创新。MultiBench 已统一覆盖 15 个数据集、10 种模态、20 个任务，并实现约 20 种方法；MERBench 又系统比较特征、融合、跨语料和噪声稳健性。传统方法至少应报告 text-only、简单早期融合和 MulT 一类序列融合参照，不能只与自制弱基线比较。

近一轮工作明显转向多模态大模型、开放词汇情绪和可解释描述：MER2025 已是该系列第三届挑战，设置半监督、细粒度、情绪描述和人格关联四个赛道；AffectGPT 则把任务扩展到生成式情绪理解。规模扩张没有消除可靠性问题：MME-Emotion 同时测试了 20 个多模态大模型，报告最佳模型的识别得分仍只有 39.3%。

缺失模态仍是一条活跃支线。2024 ACL 工作在 CMU-MOSI 的六种不完整条件上报告了明显改进，2025 年仍有专门面向缺失模态重建和动态融合的方法。这说明“再做一个复杂融合层”已经很拥挤，但用严格、低成本对照回答“简单训练策略是否足够”仍有复现价值。

医疗方向尚未形成可直接照搬的标准生产基线。2025 年 NLP-AI4Health 的相关工作仍使用 CREMA-D 表演情绪数据构造“医疗相关”表达，而不是真实患者结局；这恰好说明普通情感基准到临床应用之间仍有明显域差距。现有公开证据不足以把任何影评或表演数据上的高分称为临床部署结果。

## 2. 还开着的缺口（按可行性排序）

1. **同预算下的缺失模态稳健性。** 很多论文同时更换编码器、融合器和训练目标，无法判断收益究竟来自哪里。固定预提取特征和分类器，只改变是否进行整模态丢弃，可以给出干净、可反驳的因果对照。本轮即可完成；若扩展到第二数据集、更多真实噪声和显著性检验，可形成普通国际会议或应用型期刊的扎实实验部分。

2. **跨语料、跨场景泛化。** MERBench 已显示多模态融合在跨语料时的增益小于同语料评测，说明融合器可能学习数据集特有线索。该方向比继续刷单数据集分数更有价值，但至少需要两个标签可对齐的数据集，不适合本轮下载和计算预算。补齐跨语料实验后，适合作为普通期刊的主体问题。

3. **医疗场景的校准、拒识与人群分层。** 临床辅助系统不能只报告准确率，还应回答模型何时不确定、不同人群是否失效。这个缺口重要，但必须有真实临床数据、伦理与隐私流程，并按患者划分训练和测试；用 CMU-MOSI 无法替代。具备真实外部验证后才适合医疗信息学投稿。

## 3. 评审会打你的三个点（提前堵）

1. **“你做的是影评情感二分类，不是医学情绪识别。”** 正面限定结论：本轮只验证缺失模态下的融合稳健性，不声称识别疾病、患者情绪或临床风险。标题、摘要和结论都不得使用“临床有效”。

2. **“人工置零不等于真实摄像头、麦克风或转写故障。”** 同时报告三类结果：完整模态、随机整模态缺失、指定单模态缺失；明确这是机制压力测试。后续应加入音频噪声、视觉遮挡、ASR 错误等真实退化，不能把置零实验包装成生产验证。

3. **“提升可能来自数据泄漏、文本主导或不公平调参。”** 使用官方按原始视频划分的 train/validation/test，确保同一视频片段不跨集合；标准化参数只在训练集拟合。两臂使用完全相同的池化特征、逻辑回归、正则网格、验证准则和测试缺失掩码，并额外报告 text-only 诊断结果。

## 4. 我们这一轮真去跑的实验

选择第 2 节第 1 个缺口，因为它不需要重新提取视频特征或训练大模型，能用 367 MB 左右的 CMU-MOSI 对齐特征在 CPU 上完成，同时产生明确的正结果或负结果。

**科学问题**：在固定特征、固定分类器和固定调参预算下，训练期整模态丢弃是否能提高测试期未知模态缺失时的二分类稳健性？

**可被推翻的预测**：相对只用完整样本训练的早期融合基线，模态丢弃训练会把缺失率曲线下面积提高至少 0.02，同时完整模态 macro-F1 下降不超过 0.02；任一条件不满足，预测即被推翻。

### 数据与预处理

使用 CMU-MOSI 官方标准划分的 word-aligned 预提取特征，不下载原始视频、不运行 BERT、视觉网络或音频编码器。优先从 MultiBench 指向的预处理数据入口取得 `aligned_50.pkl`；下载后记录文件大小和 SHA-256。

每个话语片段分别对文本、音频、视觉的有效时间步计算均值和标准差，再拼成固定长度向量。连续标签大于 0 记为正类、小于 0 记为负类，等于 0 的样本排除，并记录排除数量。标准化器只在训练集拟合。

### 实验臂

- **baseline-complete-early-fusion**：完整训练样本的三模态统计特征直接拼接，训练带 L2 正则的逻辑回归。
- **proposed-group-modality-dropout**：分类器、特征和训练样本与基线相同，但训练时以概率 \(q\) 独立遮蔽整组文本、音频或视觉特征，并追加三个模态存在指示变量；若三种模态同时被遮蔽则重采样掩码。
- **text-only 诊断项**：不是主对照臂，只用于判断多模态模型是否实际上退化成文本分类器。

测试时分别设置缺失率 \(p=0,0.25,0.50,0.75\)。每个样本独立遮蔽整种模态，禁止三模态同时为空；同一随机种子下，两臂必须使用完全相同的测试掩码。

### 主指标

| 指标 | 口径 | 为什么 |
|---|---|---|
| Macro-F1 | 正、负两类 F1 的非加权平均 | 避免多数类别掩盖少数类别失败，作为主指标 |
| Balanced accuracy | 两类召回率的平均值 | 检查收益是否只是阈值或类别比例造成 |
| Robustness AUC | 对 \(p=0,0.25,0.50,0.75\) 的 macro-F1 做归一化梯形积分 | 用一个数概括整条缺失率曲线，而不是挑最好看的缺失点 |
| Clean macro-F1 delta | 实验臂与基线在 \(p=0\) 的差值 | 防止用完整数据性能的大幅损失换取表面稳健性 |

### 扫描与统计口径

逻辑回归两臂共同扫描 `C ∈ {0.1, 1, 10}`；实验臂另扫训练缺失概率 `q ∈ {0.25, 0.50}`。所有选择仅使用验证集，选择目标为四个缺失率上的平均 macro-F1，基线享有相同验证信息和正则搜索预算。

运行随机种子 0、1、2。每个种子同时控制训练增强和测试掩码；两臂做配对比较。报告每个缺失率下的均值、标准差和逐种子原始值，并报告实验臂减基线的配对差值。负结果、清洁性能损失和失败运行全部保留在结果表与日志中。

预计下载、校验和解析不超过 15 分钟；全部小模型拟合与评估不超过 25 分钟；生成 CSV、图和日志预留 5 分钟，总预算设为 45 分钟。任一单次“种子 × 参数 × 实验臂”拟合都应远低于 15 分钟；若超过则立即记录并停止该配置。

### 这一轮做不到

- 不训练、微调或调用 LLM/多模态大模型。
- 不重新提取视频、语音或文本深度特征。
- 不评估真实麦克风噪声、遮挡或 ASR 错误。
- 不做跨数据集、跨语言或跨文化泛化。
- 不使用真实患者数据，不评价诊断、治疗或临床决策价值。
- 不把三种随机种子解释为跨人群或跨机构外部验证。

## 5. 参考来源

- [MER 2025: When Affective Computing Meets Large Language Models](https://arxiv.org/abs/2504.19423)
- [AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models](https://arxiv.org/abs/2501.16566)
- [MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models](https://arxiv.org/abs/2508.09210)
- [Multimodal GRU with Directed Pairwise Cross-Modal Attention for Sentiment Analysis](https://www.nature.com/articles/s41598-025-93023-3)
- [Multimodal Prompt Learning with Missing Modalities for Sentiment](https://aclanthology.org/2024.acl-long.94/)
- [MERBench: A Unified Evaluation Benchmark for Multimodal Emotion Recognition](https://arxiv.org/abs/2401.03429)
- [MultiBench: Multiscale Benchmarks for Multimodal Representation Learning](https://pmc.ncbi.nlm.nih.gov/articles/PMC11106632/)
- [CMU Multimodal SDK：CMU-MOSI 数据与预提取特征说明](https://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK)
- [MultiBench：CMU-MOSI 下载与加载说明](https://multibench.readthedocs.io/en/latest/start/datadownload.html)
- [CMU-MOSI aligned_50.pkl 公开文件页](https://huggingface.co/datasets/tamb2203579/CMU-MOSI/tree/main/Processed)
- [Enhancing Patient-Centric Healthcare Communication Through Multimodal Emotion Recognition: A Transformer-Based Framework for Clinical Decision Support](https://aclanthology.org/2025.nlpai4health-main.1/)

---

*本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索，已标注出处；判断部分是我们的观点，可以被反驳。*

```json
{
  "task_slug": "mosi-modality-dropout-robustness",
  "question": "在固定预提取特征、分类器和调参预算下，训练期整模态丢弃能否提高CMU-MOSI二分类模型面对未知模态缺失时的稳健性？",
  "falsifiable_prediction": "模态丢弃训练相对完整样本早期融合基线将使macro-F1缺失率曲线下面积提高至少0.02，且完整模态macro-F1下降不超过0.02；任一条件不满足即推翻预测。",
  "dataset": "CMU-MOSI word-aligned预处理特征aligned_50.pkl；按MultiBench下载说明获取，公开文件页：https://huggingface.co/datasets/tamb2203579/CMU-MOSI/tree/main/Processed；使用文件内官方train/valid/test划分",
  "arms": [
    {
      "name": "baseline-complete-early-fusion",
      "is_baseline": true,
      "what": "对文本、音频、视觉有效时间步分别计算均值和标准差后拼接，仅用完整训练样本拟合L2逻辑回归。"
    },
    {
      "name": "proposed-group-modality-dropout",
      "is_baseline": false,
      "what": "使用相同池化特征和L2逻辑回归，训练时随机遮蔽整组模态并追加三个模态存在指示变量；禁止三模态同时为空。"
    }
  ],
  "metrics": [
    {
      "name": "macro_f1",
      "higher_is_better": true,
      "what": "排除标签为0的样本后，对正负两类F1取非加权平均。"
    },
    {
      "name": "balanced_accuracy",
      "higher_is_better": true,
      "what": "正负两类召回率的算术平均。"
    },
    {
      "name": "robustness_auc",
      "higher_is_better": true,
      "what": "在测试缺失率0、0.25、0.50、0.75上的macro-F1做归一化梯形积分。"
    },
    {
      "name": "clean_macro_f1_delta",
      "higher_is_better": true,
      "what": "缺失率为0时实验臂macro-F1减去基线macro-F1，用于检查稳健性是否以清洁性能为代价。"
    }
  ],
  "sweep": {
    "logistic_C": [0.1, 1, 10],
    "train_modality_dropout": [0.25, 0.5],
    "test_missing_rate": [0, 0.25, 0.5, 0.75]
  },
  "seeds": [0, 1, 2],
  "budget_minutes": 45,
  "cpu_feasible": true,
  "out_of_scope": [
    "训练或调用LLM及多模态大模型",
    "重新提取原始视频、语音或文本深度特征",
    "真实噪声、遮挡和ASR错误模拟",
    "跨语料、跨语言与跨文化验证",
    "真实患者数据及任何临床有效性结论",
    "诊断、治疗建议或生产部署"
  ]
}
```