{
  "task_slug": "mosi-modality-dropout-robustness",
  "question": "\u5728\u56fa\u5b9a\u9884\u63d0\u53d6\u7279\u5f81\u3001\u5206\u7c7b\u5668\u548c\u8c03\u53c2\u9884\u7b97\u4e0b\uff0c\u8bad\u7ec3\u671f\u6574\u6a21\u6001\u4e22\u5f03\u80fd\u5426\u63d0\u9ad8CMU-MOSI\u4e8c\u5206\u7c7b\u6a21\u578b\u9762\u5bf9\u672a\u77e5\u6a21\u6001\u7f3a\u5931\u65f6\u7684\u7a33\u5065\u6027\uff1f",
  "falsifiable_prediction": "\u6a21\u6001\u4e22\u5f03\u8bad\u7ec3\u76f8\u5bf9\u5b8c\u6574\u6837\u672c\u65e9\u671f\u878d\u5408\u57fa\u7ebf\u5c06\u4f7fmacro-F1\u7f3a\u5931\u7387\u66f2\u7ebf\u4e0b\u9762\u79ef\u63d0\u9ad8\u81f3\u5c110.02\uff0c\u4e14\u5b8c\u6574\u6a21\u6001macro-F1\u4e0b\u964d\u4e0d\u8d85\u8fc70.02\uff1b\u4efb\u4e00\u6761\u4ef6\u4e0d\u6ee1\u8db3\u5373\u63a8\u7ffb\u9884\u6d4b\u3002",
  "prediction_outcome": "confirmed",
  "negative_result": false,
  "dataset": "CMU-MOSI aligned_50.pkl official splits: train=1284, valid=229, test=686",
  "env": {
    "python": "3.12.3",
    "torch": "2.13.0+cpu",
    "extra_packages": []
  },
  "seeds": [
    0,
    1,
    2
  ],
  "arms": [
    {
      "name": "baseline-complete-early-fusion",
      "is_baseline": true,
      "what": "Pooled per-modality mean and standard deviation concatenated; L2 logistic regression fit only on complete training examples.",
      "metrics": {
        "macro_f1": {
          "per_seed": [
            0.7587848731414348,
            0.7587848731414348,
            0.7587848731414348
          ],
          "mean": 0.7587848731414347,
          "std": 1.1102230246251565e-16
        },
        "balanced_accuracy": {
          "per_seed": [
            0.7621329167579513,
            0.7621329167579513,
            0.7621329167579513
          ],
          "mean": 0.7621329167579513,
          "std": 0.0
        },
        "robustness_auc": {
          "per_seed": [
            0.6512849663569132,
            0.6450955232710702,
            0.6497519264572864
          ],
          "mean": 0.6487108053617566,
          "std": 0.00263188795099517
        },
        "clean_macro_f1_delta": {
          "per_seed": [
            0.0,
            0.0,
            0.0
          ],
          "mean": 0.0,
          "std": 0.0
        }
      }
    },
    {
      "name": "proposed-group-modality-dropout",
      "is_baseline": false,
      "what": "Same pooled features and L2 logistic regression; each training sample has independently sampled whole-modality masking and three presence indicators, resampling forbidden all-missing masks.",
      "metrics": {
        "macro_f1": {
          "per_seed": [
            0.7542359103407814,
            0.7503664449205096,
            0.7435405338166827
          ],
          "mean": 0.7493809630259912,
          "std": 0.004421624940477424
        },
        "balanced_accuracy": {
          "per_seed": [
            0.7576893401788861,
            0.7551889353514378,
            0.7449158435175218
          ],
          "mean": 0.7525980396826153,
          "std": 0.005527212046744353
        },
        "robustness_auc": {
          "per_seed": [
            0.688676624929105,
            0.6749293439717574,
            0.6851222056455514
          ],
          "mean": 0.6829093915154713,
          "std": 0.00582633922863945
        },
        "clean_macro_f1_delta": {
          "per_seed": [
            -0.004548962800653422,
            -0.0084184282209252,
            -0.01524433932475211
          ],
          "mean": -0.009403910115443578,
          "std": 0.004421624940477424
        }
      }
    }
  ],
  "headline": {
    "metric": "robustness_auc",
    "baseline_mean": 0.6487108053617566,
    "proposed_mean": 0.6829093915154713,
    "delta": 0.03419858615371463,
    "claim": "Modality-dropout robustness-AUC difference under the stated official-split experiment."
  },
  "deviations": [],
  "runtime_sec": 21.749803066253662
}
