判定:正结果
数据源与对照规模:CMU-MOSI aligned_50.pkl 官方划分(train=1284 / valid=229 / test=686),2 个实验臂 × 3 个随机种子,纯 CPU 21.75 秒。注:报告正文写的 22.56 秒取自 run.log 里的另一次运行,results.json 记录的 runtime_sec 是 21.75 秒,以后者为准;两个数都在随附材料里,可自行核对。
主要结论:预注册预测被证实:训练期整模态丢弃相对完整样本早期融合基线,把 macro-F1 缺失率曲线下面积从 0.6487 提到 0.6829(+0.0342,预注册门槛 +0.02),同时完整模态 macro-F1 的下降没有超过 0.02 的上限。
这些结果不支持:不支持统计显著性——只有 3 个随机种子,本轮没做任何显著性检验。不支持任何跨数据集结论(只跑了 CMU-MOSI 官方划分),不支持这套做法在真实缺失模式下同样有效(本轮的缺失是人为整模态丢弃),也不支持任何与 SOTA 多模态模型的排名比较。
代码 / 原始结果 / 日志:代码、原始 results.json、运行日志、图与一键复现脚本齐全。
提交方向: 多模态情感识别 交付时间: 2026-08-16 这一轮真跑了: CMU-MOSI aligned_50.pkl 官方划分(train=1284、valid=229、test=686)+ 2 个实验臂 + 3 个种子(0、1、2)+ 总耗时 22.560879468917847 秒,代码与日志随附
预测是:训练期整模态丢弃相对完整样本早期融合基线,将使 macro-F1 缺失率曲线下面积至少提高 0.02,同时完整模态 macro-F1 下降不超过 0.02。 这一预测在本轮设定下得到证实:robustness-AUC 从 0.6487108053617566 到 0.6829093915154713,差值为 0.03419858615371463。 完整模态 macro-F1 的平均差值为 -0.009403910115443578,下降幅度没有超过预测设定的 0.02 边界。 这支持继续核验“固定特征与分类器时,模态丢弃能否改善未知模态缺失下的稳健性”;下一步最值得投入的是扩大随机重复并补真实退化与跨语料核验,而不是据此转向临床有效性叙事。
本轮在 CMU-MOSI 官方划分上做了同预算对照:基线把各模态时间步的均值与标准差池化后拼接,只用完整训练样本拟合 L2 逻辑回归;实验臂保持相同池化特征与 L2 逻辑回归,对每个训练样本独立抽取整模态遮蔽、加入模态存在指示,并禁止全模态同时缺失。公平性来自两臂共享数据划分、特征表达和分类器,主要变化限定在训练期整模态丢弃及其存在指示。
| 臂 | 指标 | 各种子原始值(0 / 1 / 2) | 均值 ± 离散度 |
|---|---|---|---|
| baseline-complete-early-fusion | macro-F1 | 0.7587848731414348 / 0.7587848731414348 / 0.7587848731414348 | 0.7587848731414347 ± 1.1102230246251565e-16 |
| baseline-complete-early-fusion | balanced accuracy | 0.7621329167579513 / 0.7621329167579513 / 0.7621329167579513 | 0.7621329167579513 ± 0.0 |
| baseline-complete-early-fusion | robustness-AUC | 0.6512849663569132 / 0.6450955232710702 / 0.6497519264572864 | 0.6487108053617566 ± 0.00263188795099517 |
| baseline-complete-early-fusion | clean macro-F1 delta | 0.0 / 0.0 / 0.0 | 0.0 ± 0.0 |
| proposed-group-modality-dropout | macro-F1 | 0.7542359103407814 / 0.7503664449205096 / 0.7435405338166827 | 0.7493809630259912 ± 0.004421624940477424 |
| proposed-group-modality-dropout | balanced accuracy | 0.7576893401788861 / 0.7551889353514378 / 0.7449158435175218 | 0.7525980396826153 ± 0.005527212046744353 |
| proposed-group-modality-dropout | robustness-AUC | 0.688676624929105 / 0.6749293439717574 / 0.6851222056455514 | 0.6829093915154713 ± 0.00582633922863945 |
| proposed-group-modality-dropout | clean macro-F1 delta | -0.004548962800653422 / -0.0084184282209252 / -0.01524433932475211 | -0.009403910115443578 ± 0.004421624940477424 |

figs/ 目录。这些数支持的结论是:在本轮官方划分、预提取特征、L2 逻辑回归和既定测试机制下,模态丢弃实验臂的 robustness-AUC 高于完整样本早期融合基线,同时 clean macro-F1 的平均损失没有超过预设边界。结论上限只是该设定下的 robustness-AUC 差异。
这些数不支持“统计显著”、优于未实测方法、适用于真实设备故障,或具有跨语料、跨语言、跨文化及临床有效性。种子只有 0、1、2,放大随机重复后均值和离散度都可能变化;数据也只来自 CMU-MOSI 官方 train=1284、valid=229、test=686 划分。SCOPE.md 规划的 text-only 诊断、指定单模态缺失、真实噪声、遮挡和 ASR 错误没有进入 results.json,因此本报告不把它们写成已完成对比。
results.json 的 deviations 为空,本轮没有记录实验方案偏离。
最短路径是把这份结果作为“简单训练策略的可反驳机制对照”:先投入扩大随机重复、统计检验,并补上真实退化和跨语料核验;在这些证据出现前,先不要投入“临床有效”或生产部署叙事。
结合 SCOPE.md 第 2、3 节,审稿人最可能追问:影评情感二分类为何能代表医学情绪识别;人工整模态遮蔽是否代表真实摄像头、麦克风或转写故障;收益是否受数据泄漏、文本主导或调参不公平影响。现有结果只能回应固定对照中的稳健性差异,不能替代临床数据、伦理流程、外部验证或未完成的诊断项。
work/run_experiment.py:实验代码。work/run.sh:一条命令复现入口;在工作目录执行 bash run.sh 可重跑。work/logs/run.log:完整运行日志与逐种子记录。work/figs/macro_f1_missingness.png:macro-F1 随缺失变化的图。work/results.json:本报告全部实验数值的回查源。work/NOTES.md:执行过程记录。运行环境为 Python 3.12.3、CPU 版 torch 2.13.0+cpu,无额外包;种子固定为 0、1、2。证据使用公开 CMU-MOSI 数据集生成,不需要收件人的数据、代码或稿子;代码、日志、图和原始结果一并提供,任何人都能复查。
参考来源:
本文档由 JouleBeat · DeepGraph 出具。实验代码、日志与原始结果随附,结论可被复查与反驳。