案例 · 用户提交方向,已匿名
核心问题:在固定预提取特征、分类器和调参预算下,训练期整模态丢弃能否提高CMU-MOSI二分类模型面对未知模态缺失时的稳健性?
本轮判定:confirmed · Modality-dropout robustness-AUC difference under the stated official-split experiment.
数据:CMU-MOSI aligned_50.pkl official splits: train=1284, valid=229, test=686
真跑了:3 个噪声种子 · 纯 CPU 22 秒 · 代码/日志/原始结果全部随附

案例速览

判定:正结果

数据源与对照规模:CMU-MOSI aligned_50.pkl 官方划分(train=1284 / valid=229 / test=686),2 个实验臂 × 3 个随机种子,纯 CPU 21.75 秒。注:报告正文写的 22.56 秒取自 run.log 里的另一次运行,results.json 记录的 runtime_sec 是 21.75 秒,以后者为准;两个数都在随附材料里,可自行核对。

主要结论:预注册预测被证实:训练期整模态丢弃相对完整样本早期融合基线,把 macro-F1 缺失率曲线下面积从 0.6487 提到 0.6829(+0.0342,预注册门槛 +0.02),同时完整模态 macro-F1 的下降没有超过 0.02 的上限。

这些结果不支持:不支持统计显著性——只有 3 个随机种子,本轮没做任何显著性检验。不支持任何跨数据集结论(只跑了 CMU-MOSI 官方划分),不支持这套做法在真实缺失模式下同样有效(本轮的缺失是人为整模态丢弃),也不支持任何与 SOTA 多模态模型的排名比较。

代码 / 原始结果 / 日志:代码、原始 results.json、运行日志、图与一键复现脚本齐全。

DeepGraph 第一轮交付 · 缺失模态下的稳健情感识别

提交方向: 多模态情感识别 交付时间: 2026-08-16 这一轮真跑了: CMU-MOSI aligned_50.pkl 官方划分(train=1284、valid=229、test=686)+ 2 个实验臂 + 3 个种子(0、1、2)+ 总耗时 22.560879468917847 秒,代码与日志随附


0. 结论(先说结果)

预测是:训练期整模态丢弃相对完整样本早期融合基线,将使 macro-F1 缺失率曲线下面积至少提高 0.02,同时完整模态 macro-F1 下降不超过 0.02。 这一预测在本轮设定下得到证实:robustness-AUC 从 0.6487108053617566 到 0.6829093915154713,差值为 0.03419858615371463。 完整模态 macro-F1 的平均差值为 -0.009403910115443578,下降幅度没有超过预测设定的 0.02 边界。 这支持继续核验“固定特征与分类器时,模态丢弃能否改善未知模态缺失下的稳健性”;下一步最值得投入的是扩大随机重复并补真实退化与跨语料核验,而不是据此转向临床有效性叙事。

1. 我们替你跑了什么

本轮在 CMU-MOSI 官方划分上做了同预算对照:基线把各模态时间步的均值与标准差池化后拼接,只用完整训练样本拟合 L2 逻辑回归;实验臂保持相同池化特征与 L2 逻辑回归,对每个训练样本独立抽取整模态遮蔽、加入模态存在指示,并禁止全模态同时缺失。公平性来自两臂共享数据划分、特征表达和分类器,主要变化限定在训练期整模态丢弃及其存在指示。

指标各种子原始值(0 / 1 / 2)均值 ± 离散度
baseline-complete-early-fusionmacro-F10.7587848731414348 / 0.7587848731414348 / 0.75878487314143480.7587848731414347 ± 1.1102230246251565e-16
baseline-complete-early-fusionbalanced accuracy0.7621329167579513 / 0.7621329167579513 / 0.76213291675795130.7621329167579513 ± 0.0
baseline-complete-early-fusionrobustness-AUC0.6512849663569132 / 0.6450955232710702 / 0.64975192645728640.6487108053617566 ± 0.00263188795099517
baseline-complete-early-fusionclean macro-F1 delta0.0 / 0.0 / 0.00.0 ± 0.0
proposed-group-modality-dropoutmacro-F10.7542359103407814 / 0.7503664449205096 / 0.74354053381668270.7493809630259912 ± 0.004421624940477424
proposed-group-modality-dropoutbalanced accuracy0.7576893401788861 / 0.7551889353514378 / 0.74491584351752180.7525980396826153 ± 0.005527212046744353
proposed-group-modality-dropoutrobustness-AUC0.688676624929105 / 0.6749293439717574 / 0.68512220564555140.6829093915154713 ± 0.00582633922863945
proposed-group-modality-dropoutclean macro-F1 delta-0.004548962800653422 / -0.0084184282209252 / -0.01524433932475211-0.009403910115443578 ± 0.004421624940477424
主结果图
主结果图(本轮实验的关键对比)。原图见随附 figs/ 目录。

2. 怎么读这个结果

这些数支持的结论是:在本轮官方划分、预提取特征、L2 逻辑回归和既定测试机制下,模态丢弃实验臂的 robustness-AUC 高于完整样本早期融合基线,同时 clean macro-F1 的平均损失没有超过预设边界。结论上限只是该设定下的 robustness-AUC 差异。

这些数不支持“统计显著”、优于未实测方法、适用于真实设备故障,或具有跨语料、跨语言、跨文化及临床有效性。种子只有 0、1、2,放大随机重复后均值和离散度都可能变化;数据也只来自 CMU-MOSI 官方 train=1284、valid=229、test=686 划分。SCOPE.md 规划的 text-only 诊断、指定单模态缺失、真实噪声、遮挡和 ASR 错误没有进入 results.json,因此本报告不把它们写成已完成对比。

results.jsondeviations 为空,本轮没有记录实验方案偏离。

3. 你现在可以拿它做什么

最短路径是把这份结果作为“简单训练策略的可反驳机制对照”:先投入扩大随机重复、统计检验,并补上真实退化和跨语料核验;在这些证据出现前,先不要投入“临床有效”或生产部署叙事。

结合 SCOPE.md 第 2、3 节,审稿人最可能追问:影评情感二分类为何能代表医学情绪识别;人工整模态遮蔽是否代表真实摄像头、麦克风或转写故障;收益是否受数据泄漏、文本主导或调参不公平影响。现有结果只能回应固定对照中的稳健性差异,不能替代临床数据、伦理流程、外部验证或未完成的诊断项。

4. 随附材料

运行环境为 Python 3.12.3、CPU 版 torch 2.13.0+cpu,无额外包;种子固定为 0、1、2。证据使用公开 CMU-MOSI 数据集生成,不需要收件人的数据、代码或稿子;代码、日志、图和原始结果一并提供,任何人都能复查。

5. 方向判断与文献(摘自随附的 SCOPE.md)

参考来源:


本文档由 JouleBeat · DeepGraph 出具。实验代码、日志与原始结果随附,结论可被复查与反驳。

随附材料(点开即看,不用下载)

打包下载全部材料(.zip)
口径与边界。这些限制与负结果均保留在原始材料中。
本案例源自一位研究者通过公开表单提交的方向,已隐去其姓名、单位与一切可定位信息。结论与代码可复查、可反驳。
← 全部案例 · JouleBeat · DeepGraph