SEED_RESULT {"baseline": {"auc": 0.6512849663569132, "bal": 0.7621329167579513, "c": 0.1, "f1": 0.7587848731414348}, "baseline_curve": [0.7587848731414348, 0.6722370564545178, 0.6193720462308736, 0.5657067196292618], "proposed": {"auc": 0.688676624929105, "bal": 0.7576893401788861, "c": 1.0, "drop": 0.25, "f1": 0.7542359103407814}, "proposed_curve": [0.7542359103407814, 0.701056113052956, 0.6805992509363296, 0.6145131112552769], "seed": 0} SEED_RESULT {"baseline": {"auc": 0.6450955232710702, "bal": 0.7621329167579513, "c": 0.1, "f1": 0.7587848731414348}, "baseline_curve": [0.7587848731414348, 0.6722187749106991, 0.6148640904551057, 0.5376225357533768], "proposed": {"auc": 0.6749293439717574, "bal": 0.7551889353514378, "c": 1.0, "drop": 0.25, "f1": 0.7503664449205096}, "proposed_curve": [0.7503664449205096, 0.680494674205366, 0.6603116320670339, 0.6175970063652347], "seed": 1} SEED_RESULT {"baseline": {"auc": 0.6497519264572864, "bal": 0.7621329167579513, "c": 0.1, "f1": 0.7587848731414348}, "baseline_curve": [0.7587848731414348, 0.6874121078995385, 0.6036086675472865, 0.5576851347086335], "proposed": {"auc": 0.6851222056455514, "bal": 0.7449158435175218, "c": 1.0, "drop": 0.25, "f1": 0.7435405338166827}, "proposed_curve": [0.7435405338166827, 0.7049852723381311, 0.6542151316020663, 0.6487918921762306], "seed": 2} FINAL_RESULTS {"arms": [{"is_baseline": true, "metrics": {"balanced_accuracy": {"mean": 0.7621329167579513, "per_seed": [0.7621329167579513, 0.7621329167579513, 0.7621329167579513], "std": 0.0}, "clean_macro_f1_delta": {"mean": 0.0, "per_seed": [0.0, 0.0, 0.0], "std": 0.0}, "macro_f1": {"mean": 0.7587848731414347, "per_seed": [0.7587848731414348, 0.7587848731414348, 0.7587848731414348], "std": 1.1102230246251565e-16}, "robustness_auc": {"mean": 0.6487108053617566, "per_seed": [0.6512849663569132, 0.6450955232710702, 0.6497519264572864], "std": 0.00263188795099517}}, "name": "baseline-complete-early-fusion", "what": "Pooled per-modality mean and standard deviation concatenated; L2 logistic regression fit only on complete training examples."}, {"is_baseline": false, "metrics": {"balanced_accuracy": {"mean": 0.7525980396826153, "per_seed": [0.7576893401788861, 0.7551889353514378, 0.7449158435175218], "std": 0.005527212046744353}, "clean_macro_f1_delta": {"mean": -0.009403910115443578, "per_seed": [-0.004548962800653422, -0.0084184282209252, -0.01524433932475211], "std": 0.004421624940477424}, "macro_f1": {"mean": 0.7493809630259912, "per_seed": [0.7542359103407814, 0.7503664449205096, 0.7435405338166827], "std": 0.004421624940477424}, "robustness_auc": {"mean": 0.6829093915154713, "per_seed": [0.688676624929105, 0.6749293439717574, 0.6851222056455514], "std": 0.00582633922863945}}, "name": "proposed-group-modality-dropout", "what": "Same pooled features and L2 logistic regression; each training sample has independently sampled whole-modality masking and three presence indicators, resampling forbidden all-missing masks."}], "dataset": "CMU-MOSI aligned_50.pkl official splits: train=1284, valid=229, test=686", "deviations": [], "env": {"extra_packages": [], "python": "3.12.3", "torch": "2.13.0+cpu"}, "falsifiable_prediction": "\u6a21\u6001\u4e22\u5f03\u8bad\u7ec3\u76f8\u5bf9\u5b8c\u6574\u6837\u672c\u65e9\u671f\u878d\u5408\u57fa\u7ebf\u5c06\u4f7fmacro-F1\u7f3a\u5931\u7387\u66f2\u7ebf\u4e0b\u9762\u79ef\u63d0\u9ad8\u81f3\u5c110.02\uff0c\u4e14\u5b8c\u6574\u6a21\u6001macro-F1\u4e0b\u964d\u4e0d\u8d85\u8fc70.02\uff1b\u4efb\u4e00\u6761\u4ef6\u4e0d\u6ee1\u8db3\u5373\u63a8\u7ffb\u9884\u6d4b\u3002", "headline": {"baseline_mean": 0.6487108053617566, "claim": "Modality-dropout robustness-AUC difference under the stated official-split experiment.", "delta": 0.03419858615371463, "metric": "robustness_auc", "proposed_mean": 0.6829093915154713}, "negative_result": false, "prediction_outcome": "confirmed", "question": "\u5728\u56fa\u5b9a\u9884\u63d0\u53d6\u7279\u5f81\u3001\u5206\u7c7b\u5668\u548c\u8c03\u53c2\u9884\u7b97\u4e0b\uff0c\u8bad\u7ec3\u671f\u6574\u6a21\u6001\u4e22\u5f03\u80fd\u5426\u63d0\u9ad8CMU-MOSI\u4e8c\u5206\u7c7b\u6a21\u578b\u9762\u5bf9\u672a\u77e5\u6a21\u6001\u7f3a\u5931\u65f6\u7684\u7a33\u5065\u6027\uff1f", "runtime_sec": 22.560879468917847, "seeds": [0, 1, 2], "task_slug": "mosi-modality-dropout-robustness"}