{
 "task_slug": "flat-maxima-transferability-compute-matched",
 "question": "在固定梯度调用预算(而非固定迭代数)下,PGN 式平坦极值攻击相对 MI-FGSM 的迁移性增益还剩多少?平坦度本身是否是中介变量?",
 "falsifiable_prediction": "预测:相同迭代数下平坦化臂对 MI-FGSM 的平均迁移成功率优势 >=5 个百分点;改为相同梯度调用预算后优势缩到 <=2 个百分点或反转。若在相同梯度调用预算下平坦化臂在两个预算档 x 3 个种子的平均值仍领先 >=5 个百分点且每个种子都为正,则预测被推翻。",
 "dataset": "CIFAR-10 测试集,torchvision.datasets.CIFAR10(download=True);每个种子随机抽 128 张、且必须被代理模型与全部 4 个目标模型同时分类正确。模型权重:torch.hub.load('chenyaofo/pytorch-cifar-models', 'cifar10_resnet20'|'cifar10_vgg11_bn'|'cifar10_mobilenetv2_x1_0'|'cifar10_shufflenetv2_x1_0'|'cifar10_repvgg_a0', pretrained=True)。代理=cifar10_resnet20,目标=其余 4 个。",
 "arms": [
  {
   "name": "baseline-mi-equal-steps",
   "is_baseline": true,
   "what": "MI-FGSM(动量 decay=1.0),迭代数 T = grad_budget/6,与平坦化臂迭代数相同但只消耗 grad_budget/6 次 fwd+bwd。复现文献惯用的『相同迭代数』不公平对照,用来确认能复现出文献报的增益方向。步长 alpha = 2.5*eps/T。"
  },
  {
   "name": "baseline-mi-equal-budget",
   "is_baseline": true,
   "what": "MI-FGSM(动量 decay=1.0),迭代数 T = grad_budget,消耗与平坦化臂完全相同的 fwd+bwd 次数。这是真正的算力对齐对照。步长 alpha = 2.5*eps/T。"
  },
  {
   "name": "pgn-flat-maxima",
   "is_baseline": false,
   "what": "PGN 式平坦极值攻击(arXiv:2306.05225 的一阶近似):每次迭代对 3 个邻域随机采样点各算 2 次梯度(采样点处 + 沿其 sign 方向的预测点处)后加权合成,故每迭代耗 6 次 fwd+bwd,迭代数 T = grad_budget/6。内层采样数 3(原文用 20,CPU 限制下的明确偏离)。步长 alpha = 2.5*eps/T。"
  }
 ],
 "metrics": [
  {
   "name": "transfer_success_rate",
   "higher_is_better": true,
   "what": "无目标攻击在 4 个留出目标模型上的平均 top-1 误分类率;仅在被代理与全部目标原本都分类正确的样本上统计。同时保留每个目标模型的分项数值。"
  },
  {
   "name": "whitebox_success_rate",
   "higher_is_better": true,
   "what": "同一批 AE 在代理 ResNet-20 上的 top-1 误分类率。完整性检查:白盒未打透的臂,其迁移数字不可解读。"
  },
  {
   "name": "neighborhood_grad_norm",
   "higher_is_better": false,
   "what": "最终 AE 周围 L-inf 半径 2/255 球内均匀采 5 个点,代理模型上输入梯度的 L2 范数均值(越小越平坦)。用于检验平坦度是否为中介变量。"
  }
 ],
 "sweep": {
  "grad_budget": [
   "36",
   "72"
  ]
 },
 "seeds": [
  0,
  1,
  2
 ],
 "budget_minutes": 45,
 "cpu_feasible": true,
 "out_of_scope": [
  "ImageNet 及任何高分辨率数据集",
  "ViT / Swin 等 Transformer 目标模型",
  "对抗训练或其他防御模型作为代理或目标",
  "复现 PGN 原文的 20 采样 x 10 迭代配置(本轮用 3 采样,不构成对 PGN 论文数字的复现或反驳)",
  "模型集成攻击(只用 1 个代理),因此与 DRAP / CWA 等集成侧结论无关",
  "逐臂步长网格搜索(统一用 alpha=2.5*eps/T),不能排除换步长后结论变化",
  "有目标攻击、生成式攻击、语义分割/VLM 等其他任务",
  "显著性检验的强声明(3 种子只报均值与标准差)",
  "把结论外推到 ImageNet 或大容量模型;claim 严格限定在 CIFAR-10 + 小容量 CNN"
 ],
 "implementation_notes": [
  "先跑一次计时探针:测 128 张图在 ResNet-20 上单次 fwd+bwd 的耗时。若 >2.5s,把图数降到 64 并在报告中注明。",
  "按种子切分 run(每 run 约 8 分钟),满足单 run <=15 分钟。",
  "预算记账必须显式:每臂输出实际消耗的 fwd+bwd 次数,写进结果表,便于核对算力是否真对齐。",
  "torch.set_num_threads(2);torch.hub 权重下载失败时改用仓库 GitHub Releases 直链。"
 ]
}