
=== attempt 1 (timeout=False) ===
All required deliverables present, no stray files in the work directory. This is complete.

## 小结

用 CIFAR-10 + 5 个预训练小模型(代理 resnet20,目标 vgg11_bn/mobilenetv2/shufflenetv2/repvgg)真跑了 MI-FGSM 两个对照臂(相同迭代数/相同梯度调用预算)vs PGN 式平坦极值攻击,3 seeds × 2 档梯度预算(36/72),128 张双重过滤(代理+4目标全对)的图,全程 CPU、234 秒跑完。

关键数字(gb=72,主对比):equal-budget MI-FGSM 迁移成功率 65.5%,PGN 73.0%,领先 7.5pp;但 gb=36 时两者几乎打平(65.6% vs 66.1%),方差把差异淹没(PGN std 高达 4.3pp)。

预测结论:**inconclusive**,不是 confirmed 也不是 refuted。原因是预测的前提(相同迭代数下 PGN 领先 ≥5pp)本身没成立——6 次(预算×种子)组合池化后只领先 3.29pp,没过 5pp 门槛。这大概率是因为按 CPU 预算把内层采样数从原论文的 20 砍到 3(计划里已声明的偏离范围),PGN 的优势本来就被削弱了大半,导致"等预算后优势是否消失"这个更尖锐的问题没法干净检验。

意外的次要发现:PGN 生成的对抗样本周围梯度范数(越小越平坦)反而比 MI-FGSM 更大(77.7/71.0 vs 57-63),跟"平坦极值提升迁移性"的机制说法方向相反——不过这只是 N=3 简化版下的观察,不能推翻 PGN 论文本身。另外 PGN 白盒成功率没打到 100%(98-99%),按计划自己的标准这类臂的迁移数字解读要打折扣。

踩的坑:torchvision 官方 CIFAR10 下载源慢到 34 分钟量级(实测 80KB/s),换成 HuggingFace parquet 镜像后 1 秒下完,顺手装了 pyarrow。

所有文件已落盘:`run.sh`、`attack_experiment.py`、`logs/run.log`、`results.json`、`figs/transfer_and_flatness.png`、`NOTES.md`。
