提交方向: 实时 MRI 引导放疗中的三维形变重建:在两切片观测预算下,比较正交双切片与平行双切片的观测几何 交付时间: 2026-08-07 这一轮真跑了: ETH Zurich CVL 4DMRI 公开集(受试者 A 8219 点 × 4 个呼吸周期、受试者 B 10125 点 × 5 个呼吸周期,5mm 各向同性网格点轨迹),5 个实验臂,3 个种子(0/1/2),留一周期交叉验证 9 折 × 3 种子 = 27 个配对样本,总耗时 6 秒(纯 CPU)。代码、日志、图与原始 results.json 随附。
这条路我们替您试了,不成立。 我们预测的是"正交和平行在整体三维 RMSE 上差不多,但机制上双矢状看不见 LR(穿层)方向,所以它的 LR 误差应该是正交臂的 ≥1.5 倍"。前半句对了,后半句错了,预测判定为推翻(refuted)。
oracle-full-dvf(看全场三维真值、无噪声、无切片限制)的 LR RMSE 仍有 0.529mm,和两个切片臂的 0.565 / 0.579mm 同一量级。LR 方向的误差被 K=3 低秩截断卡住,不是被"看不看得见"卡住。 呼吸运动跨轴相关性够强,矢状面的 AP/SI 面内观测已经间接锁定了同一批低秩系数。oracle-full-dvf 0.700mm 与最好的切片臂 0.719mm 已经贴得很近。详见第 3 节。实验设计一句话:在同一份真实 4D-MRI 三维真值形变场上,固定同一套 K=3 低秩(PCA)运动模型、同一份留出划分、同一个正则化先验,只改切片摆位,比较各摆位驱动下的三维形变场重建误差。
baseline 是什么、为什么公平:baseline-single-sagittal(单矢状切片,过 ROI 中心,层厚 5mm)是真机上实际在采的配置,不是我们自己造的弱对手,它是半预算参照,用来回答"第二层切片到底买到了什么"。等 2 切片预算的头对头对照发生在 parallel-2sag(d=50mm)与 orthogonal-sag-cor 之间;parallel-2cor 是对称性检查,防止结论只是"矢状本来就好";oracle-full-dvf 是上界臂,用来把模型截断误差和观测几何误差分开。平行臂的间距在进入主对比之前,先用 4 档候选的池化 RMSE 选优(PASS1,全折全种子池化,不按折挑),避免事后调参嫌疑;parallel-2sag 与 parallel-2cor 各自独立选,最终都选中 d=50mm。
dvf_rmse3d_mm(首要指标,越低越好,单位 mm)| 臂 | seed 0 | seed 1 | seed 2 | 均值 ± 标准差 |
|---|---|---|---|---|
baseline-single-sagittal(基线,半预算) | 0.761 | 0.760 | 0.763 | 0.762 ± 0.00134 |
parallel-2sag(d=50mm) | 0.720 | 0.719 | 0.719 | 0.719 ± 0.000356 |
parallel-2cor(d=50mm) | 0.725 | 0.726 | 0.726 | 0.726 ± 0.000438 |
orthogonal-sag-cor | 0.736 | 0.736 | 0.736 | 0.736 ± 0.000308 |
oracle-full-dvf(上界) | 0.700 | 0.700 | 0.700 | 0.700 ± 0.0 |
work/results.json)| 臂 | dvf_p95_mm | rmse_ap_mm | rmse_si_mm | rmse_lr_mm | log10_cond_obs | n_observations(9 折均值) |
|---|---|---|---|---|---|---|
baseline-single-sagittal | 1.558 | 0.346 | 0.320 | 0.598 | 0.381 | 1160.4 |
parallel-2sag | 1.447 | 0.318 | 0.312 | 0.565 | 0.189 | 2071.1 |
parallel-2cor | 1.462 | 0.347 | 0.323 | 0.549 | 0.451 | 1619.1 |
orthogonal-sag-cor | 1.498 | 0.334 | 0.308 | 0.579 | 0.292 | 2092.7 |
oracle-full-dvf | 1.407 | 0.312 | 0.336 | 0.529 | ≈0 | 27833.7 |
roi_centroid_err_mm(3 种子均值,三个 ROI 位置均已算出)| 臂 | liver_dome | liver_inferior | liver_lateral |
|---|---|---|---|
baseline-single-sagittal | 0.434 | 0.395 | 0.613 |
parallel-2sag | 0.470 | 0.364 | 0.519 |
parallel-2cor | 0.444 | 0.403 | 0.587 |
orthogonal-sag-cor | 0.443 | 0.373 | 0.575 |
oracle-full-dvf | 0.472 | 0.359 | 0.506 |
注:ROI 位置不进入任何结论,只作参考——oracle-full-dvf 在 liver_dome 上反而是所有臂里最高的 0.472,说明这个指标在本轮设定下同样被模型截断主导,而不是被观测几何主导。

figs/ 目录。这些数支持三条结论:
baseline-single-sagittal 的 0.762mm 到三个双切片臂的 0.719 / 0.726 / 0.736mm,加第二层都有改善;而三个双切片臂彼此之间的差距,远小于它们和单层之间的差距。这句话比"正交更好"更站得住,也更容易让临床物理师买账。oracle-full-dvf——它看得见全部三维真值、没有噪声、没有切片限制,LR RMSE 仍有 0.529mm,和切片臂的 0.565 / 0.579mm 差不多;而 AP/SI 各臂都在 0.308–0.347mm。LR 误差对所有臂(含 oracle)都远大于 AP/SI,这不可能是观测几何造成的。这些数不支持的: 不支持任何临床摆位推荐;不支持外推到图像域(我们用的是已有配准点轨迹,不是真实 cine 图像,得到的误差是临床误差的下界);不支持外推到非线性/深度运动模型、其他部位、其他 K;3 个种子的一致性只说明数值稳定,不构成"显著性"的统计声称。
规模限制,放大后可能变的: 只有 2 例成人受试者、9 个呼吸周期、只有肝脏;27 个配对样本来自 9 折 × 3 种子,折之间并不独立。种子间标准差极小(1e-4 量级),说明本轮的不确定性主要来自受试者/周期,而不是随机种子——要动摇这个负结论,该加的是受试者数,不是种子数。
另一个读结果时要注意的点(审稿人会问): 等预算是按"切片数 = 2、层厚相同"对齐的,但各臂实际参与拟合的观测标量数并不相等——parallel-2sag 2071.1、orthogonal-sag-cor 2092.7、parallel-2cor 1619.1。前两者接近(所以这不是主对比结论的解释),但 parallel-2cor 明显少,读它的数时要带上这一点。
results.json.deviations 里的三条偏离,逐条交代:
parallel_spacing_mm 做了 4 档穷举池化选优。这不是算力不够(全流程 6 秒),是我们主动收窄,把 30 分钟预算用在保证核心预测的统计功效和复核结果上。直接后果:缺口 B(冠状配准惩罚 α)这一轮没有产出,α 只固定在 1.0 这个对正交最有利的取值上。interleave=true(双切片分时交替采集)完全没有实现,因为需要额外的时间插值建模。所以本轮结论只适用于双切片同帧并发观测的理想化场景——真机正交 cine 是交错采的,这一条是本轮与临床之间最实的一道缝。parallel-2sag 和 parallel-2cor 用同一套池化流程各自独立选间距,两者都选中 4 档里的最大值 50mm(见 figs/spacing_sweep.png),说明在本数据集的网格跨度内,间距越大对低秩模型越有利;我们没有外推到 >50mm。这个方向对平行臂有利,也就是说,如果间距还能再放大,平行臂只会更好一点,不会让正交翻盘——这一条不威胁负结论,但必须写在论文里。最短路径:先动模型,别先动摆位。 oracle-full-dvf(0.700mm)和最好的切片臂(0.719mm)之间只剩很窄的一段,而所有臂的 LR 误差都被压在 0.529–0.598mm 这个带里。在 K=3 线性 PCA 这个模型下,观测几何已经不是瓶颈了。 值得投的下一步是把模型阶数 K 和模型类当自变量扫开(SCOPE 第 3 节③里预留的那个回应,这一轮反而变成了主结果):先确认 LR 误差随 K 增大到什么程度才掉下来,再决定要不要上非线性/深度模型。
先别投的: 图像域仿真和 GPU 那一段(第二段),在几何这条线上先别投——既然两切片臂之间的差异只有 -1.1%,再花力气把图像域仿真做逼真,也只是给一个本来就很小的差异加噪声。5070 该留给"换模型"那条线,不是"换摆位"那条线。
这个负结果怎么变成论文里的正资产: SCOPE 第 2 节的缺口 A 是"没人在等预算下把正交和平行头对头比过",这一轮把它填了,答案是"填了,没差别"——而全领域(Seregni / Paganelli / Jassar / Ginn)默认用正交却从没验证过这个默认。写成"我们检验了这条被普遍默认的前提,在低秩模型下它不成立,并给出了它为什么不成立的机制(瓶颈在模型截断而非可观测性)",这比一个 +5% 的正结果更难被拒。缺口 B(α 扫描)的意义也随之变了:既然在最有利的 α=1 下正交都没赢,α 扫描的结论会更强——"即使给正交最有利的配准质量假设,它也没有优势"。
审稿人最可能打的四个点,按威胁度排:
全部在本目录下,work/ 是可独立重跑的完整工作区。
| 文件 | 内容 |
|---|---|
work/run.sh | 一条命令复现全部结果:bash run.sh。脚本自己从 ETH 公开地址下载数据集(34MB),不需要任何账号或密钥 |
work/experiment.py | 数据加载、轴向校验闸门、PCA/低秩拟合与重建(9 折 × 3 种子 × 5 臂 × 4 档间距) |
work/analyze.py | 池化各臂指标、跑 27 个配对样本上的可推翻预测判定、写 results.json 与 figs/*.png |
work/mriio.py | ETH .txt 运动场解析(含首行元数据剥离) |
work/results.json | 原始结果。本报告每个数字都可在此回查 |
work/logs/run.log | 完整运行日志,含轴向校验闸门输出、间距选优、预测判定的逐条 cond_a/b/c 结果 |
work/logs/run_experiment.log | 实验步骤日志 |
work/figs/arms_rmse3d.png | 各臂 dvf_rmse3d_mm 对比 |
work/figs/paired_diff_27.png | 27 个配对差值(正交 − 平行)的逐样本分布 |
work/figs/axis_breakdown.png | 各臂分轴 RMSE——看这张图最快理解本轮结论:LR 误差对每个臂(含 oracle)都远高于 AP/SI |
work/figs/spacing_sweep.png | 平行臂间距选优曲线(边界解证据) |
work/data/ | ETH 原始 .txt 运动场文件缓存 |
work/NOTES.md | 实现决策记录:计划没有完全钉死的地方我们怎么定的、以及本轮如何排查了 bug 才接受这个负结果 |
SCOPE.md | 前一段的方向判断与文献查新全文 |
环境与可复现性:Python 3.12,torch 2.13.0+cpu(纯 CPU,无额外依赖包,不需要 GPU),随机种子固定为 0/1/2,总耗时 6 秒。bash run.sh 可从零重跑到同样的 results.json。
关于数据与知识产权:我们不需要您的数据、代码或稿子。全部证据用公开数据集(ETH Zurich CVL 4DMRI,无需注册即可下载,学术用途)自己造,任何人拿到这个目录都能独立复查、也能独立反驳。
参考来源(原样保留):
本文档由 JouleBeat · DeepGraph 出具。实验代码、日志与原始结果随附,结论可被复查与反驳。