# DeepGraph 第一轮交付 · 缺失模态下的稳健情感识别

**提交方向**: 多模态情感识别  
**交付时间**: 2026-08-16  
**这一轮真跑了**: CMU-MOSI `aligned_50.pkl` 官方划分（train=1284、valid=229、test=686）+ 2 个实验臂 + 3 个种子（0、1、2）+ 总耗时 22.560879468917847 秒，代码与日志随附

---

## 0. 结论（先说结果）

预测是：训练期整模态丢弃相对完整样本早期融合基线，将使 macro-F1 缺失率曲线下面积至少提高 0.02，同时完整模态 macro-F1 下降不超过 0.02。  
这一预测在本轮设定下得到证实：robustness-AUC 从 0.6487108053617566 到 0.6829093915154713，差值为 0.03419858615371463。  
完整模态 macro-F1 的平均差值为 -0.009403910115443578，下降幅度没有超过预测设定的 0.02 边界。  
这支持继续核验“固定特征与分类器时，模态丢弃能否改善未知模态缺失下的稳健性”；下一步最值得投入的是扩大随机重复并补真实退化与跨语料核验，而不是据此转向临床有效性叙事。

## 1. 我们替你跑了什么

本轮在 CMU-MOSI 官方划分上做了同预算对照：基线把各模态时间步的均值与标准差池化后拼接，只用完整训练样本拟合 L2 逻辑回归；实验臂保持相同池化特征与 L2 逻辑回归，对每个训练样本独立抽取整模态遮蔽、加入模态存在指示，并禁止全模态同时缺失。公平性来自两臂共享数据划分、特征表达和分类器，主要变化限定在训练期整模态丢弃及其存在指示。

| 臂 | 指标 | 各种子原始值（0 / 1 / 2） | 均值 ± 离散度 |
|---|---|---|---|
| baseline-complete-early-fusion | macro-F1 | 0.7587848731414348 / 0.7587848731414348 / 0.7587848731414348 | 0.7587848731414347 ± 1.1102230246251565e-16 |
| baseline-complete-early-fusion | balanced accuracy | 0.7621329167579513 / 0.7621329167579513 / 0.7621329167579513 | 0.7621329167579513 ± 0.0 |
| baseline-complete-early-fusion | robustness-AUC | 0.6512849663569132 / 0.6450955232710702 / 0.6497519264572864 | 0.6487108053617566 ± 0.00263188795099517 |
| baseline-complete-early-fusion | clean macro-F1 delta | 0.0 / 0.0 / 0.0 | 0.0 ± 0.0 |
| proposed-group-modality-dropout | macro-F1 | 0.7542359103407814 / 0.7503664449205096 / 0.7435405338166827 | 0.7493809630259912 ± 0.004421624940477424 |
| proposed-group-modality-dropout | balanced accuracy | 0.7576893401788861 / 0.7551889353514378 / 0.7449158435175218 | 0.7525980396826153 ± 0.005527212046744353 |
| proposed-group-modality-dropout | robustness-AUC | 0.688676624929105 / 0.6749293439717574 / 0.6851222056455514 | 0.6829093915154713 ± 0.00582633922863945 |
| proposed-group-modality-dropout | clean macro-F1 delta | -0.004548962800653422 / -0.0084184282209252 / -0.01524433932475211 | -0.009403910115443578 ± 0.004421624940477424 |

## 2. 怎么读这个结果

这些数支持的结论是：在本轮官方划分、预提取特征、L2 逻辑回归和既定测试机制下，模态丢弃实验臂的 robustness-AUC 高于完整样本早期融合基线，同时 clean macro-F1 的平均损失没有超过预设边界。结论上限只是该设定下的 robustness-AUC 差异。

这些数不支持“统计显著”、优于未实测方法、适用于真实设备故障，或具有跨语料、跨语言、跨文化及临床有效性。种子只有 0、1、2，放大随机重复后均值和离散度都可能变化；数据也只来自 CMU-MOSI 官方 train=1284、valid=229、test=686 划分。`SCOPE.md` 规划的 text-only 诊断、指定单模态缺失、真实噪声、遮挡和 ASR 错误没有进入 `results.json`，因此本报告不把它们写成已完成对比。

`results.json` 的 `deviations` 为空，本轮没有记录实验方案偏离。

## 3. 你现在可以拿它做什么

最短路径是把这份结果作为“简单训练策略的可反驳机制对照”：先投入扩大随机重复、统计检验，并补上真实退化和跨语料核验；在这些证据出现前，先不要投入“临床有效”或生产部署叙事。

结合 `SCOPE.md` 第 2、3 节，审稿人最可能追问：影评情感二分类为何能代表医学情绪识别；人工整模态遮蔽是否代表真实摄像头、麦克风或转写故障；收益是否受数据泄漏、文本主导或调参不公平影响。现有结果只能回应固定对照中的稳健性差异，不能替代临床数据、伦理流程、外部验证或未完成的诊断项。

## 4. 随附材料

- `work/run_experiment.py`：实验代码。
- `work/run.sh`：一条命令复现入口；在工作目录执行 `bash run.sh` 可重跑。
- `work/logs/run.log`：完整运行日志与逐种子记录。
- `work/figs/macro_f1_missingness.png`：macro-F1 随缺失变化的图。
- `work/results.json`：本报告全部实验数值的回查源。
- `work/NOTES.md`：执行过程记录。

运行环境为 Python 3.12.3、CPU 版 torch 2.13.0+cpu，无额外包；种子固定为 0、1、2。证据使用公开 CMU-MOSI 数据集生成，不需要收件人的数据、代码或稿子；代码、日志、图和原始结果一并提供，任何人都能复查。

## 5. 方向判断与文献（摘自随附的 SCOPE.md）

- 标准榜单已经拥挤；在 CMU-MOSI 上继续叠复杂融合层的增量价值有限，可靠性与域外有效性仍是缺口。
- 当前可行且可反驳的切口，是固定预提取特征和分类器，只改变训练期是否进行整模态丢弃。
- 多模态情感研究正在转向大模型、开放词汇情绪和解释性描述，但规模扩张没有自动解决可靠性。
- 缺失模态仍是活跃支线；严格、低成本的同预算对照有复现价值。
- 跨语料泛化需要标签可对齐的数据集；医疗场景还需要真实临床数据、伦理与隐私流程以及患者级划分。
- 本轮只验证缺失模态下的融合稳健性，不声称疾病识别、患者情绪识别、临床风险判断或生产部署。
- 人工置零属于机制压力测试，不等于真实摄像头、麦克风或 ASR 故障。
- 后续证据应优先排查数据泄漏、文本主导和调参公平性，并补真实退化与外部验证。

参考来源：

- [MER 2025: When Affective Computing Meets Large Language Models](https://arxiv.org/abs/2504.19423)
- [AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models](https://arxiv.org/abs/2501.16566)
- [MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models](https://arxiv.org/abs/2508.09210)
- [Multimodal GRU with Directed Pairwise Cross-Modal Attention for Sentiment Analysis](https://www.nature.com/articles/s41598-025-93023-3)
- [Multimodal Prompt Learning with Missing Modalities for Sentiment](https://aclanthology.org/2024.acl-long.94/)
- [MERBench: A Unified Evaluation Benchmark for Multimodal Emotion Recognition](https://arxiv.org/abs/2401.03429)
- [MultiBench: Multiscale Benchmarks for Multimodal Representation Learning](https://pmc.ncbi.nlm.nih.gov/articles/PMC11106632/)
- [CMU Multimodal SDK：CMU-MOSI 数据与预提取特征说明](https://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK)
- [MultiBench：CMU-MOSI 下载与加载说明](https://multibench.readthedocs.io/en/latest/start/datadownload.html)
- [CMU-MOSI aligned_50.pkl 公开文件页](https://huggingface.co/datasets/tamb2203579/CMU-MOSI/tree/main/Processed)
- [Enhancing Patient-Centric Healthcare Communication Through Multimodal Emotion Recognition: A Transformer-Based Framework for Clinical Decision Support](https://aclanthology.org/2025.nlpai4health-main.1/)

---

*本文档由 JouleBeat · DeepGraph 出具。实验代码、日志与原始结果随附，结论可被复查与反驳。*
