案例 · 用户提交方向,已匿名
核心问题:在严格等观测预算(2 个切片)下,正交双切片(矢状+冠状)相比平行双切片(2 个矢状,间距 d),能否显著降低实时 MRI 引导放疗中低秩运动模型驱动的三维形变场重建误差?误差差异由哪条物理机制(穿层位移不可观测)解释?
本轮判定:refuted · 等2切片预算下,正交(矢状+冠状)与最佳间距平行双矢状(d=50mm)在整体三维DVF重建RMSE上差异很小(均值差-0.009mm,-1.1%,27配对样本11/27方向为正,bootstrap95%CI=[-0.017,-0.003]mm);平行矢状臂对LR(穿层)方向的重建误差是正交臂的0.98倍,没有出现预期的穿层误差放大,且LR分量反而占正交臂总平方误差的61.9%,说明瓶颈主要在K=3低秩模型截断而非观测几何——预测被推翻。
数据:ETH Zurich CVL 4DMRI 公开集 (von Siebenthal et al., MICCAI 2005), motionfields/motionfield_subj{A,B}_cyc{n}_ds5.txt, 5mm各向同性网格点轨迹; subject A: 8219点 x 4呼吸周期(16/16/19/?帧), subject B: 10125点 x 5呼吸周期。位移相对各受试者cyc3第0帧参考位置定义。留一周期交叉验证(9折 = A的4折+B的5折)x3种子=27配对样本。
真跑了:3 个噪声种子 · 纯 CPU 6 秒 · 代码/日志/原始结果全部随附

DeepGraph 第一轮交付 · 两切片观测几何:正交并不优于平行,预测被推翻

提交方向: 实时 MRI 引导放疗中的三维形变重建:在两切片观测预算下,比较正交双切片与平行双切片的观测几何 交付时间: 2026-08-07 这一轮真跑了: ETH Zurich CVL 4DMRI 公开集(受试者 A 8219 点 × 4 个呼吸周期、受试者 B 10125 点 × 5 个呼吸周期,5mm 各向同性网格点轨迹),5 个实验臂,3 个种子(0/1/2),留一周期交叉验证 9 折 × 3 种子 = 27 个配对样本,总耗时 6 秒(纯 CPU)。代码、日志、图与原始 results.json 随附。


0. 结论(先说结果)

这条路我们替您试了,不成立。 我们预测的是"正交和平行在整体三维 RMSE 上差不多,但机制上双矢状看不见 LR(穿层)方向,所以它的 LR 误差应该是正交臂的 ≥1.5 倍"。前半句对了,后半句错了,预测判定为推翻(refuted)。


1. 我们替您跑了什么

实验设计一句话:在同一份真实 4D-MRI 三维真值形变场上,固定同一套 K=3 低秩(PCA)运动模型、同一份留出划分、同一个正则化先验,只改切片摆位,比较各摆位驱动下的三维形变场重建误差。

baseline 是什么、为什么公平:baseline-single-sagittal(单矢状切片,过 ROI 中心,层厚 5mm)是真机上实际在采的配置,不是我们自己造的弱对手,它是半预算参照,用来回答"第二层切片到底买到了什么"。等 2 切片预算的头对头对照发生在 parallel-2sag(d=50mm)与 orthogonal-sag-cor 之间;parallel-2cor 是对称性检查,防止结论只是"矢状本来就好";oracle-full-dvf 是上界臂,用来把模型截断误差和观测几何误差分开。平行臂的间距在进入主对比之前,先用 4 档候选的池化 RMSE 选优(PASS1,全折全种子池化,不按折挑),避免事后调参嫌疑;parallel-2sagparallel-2cor 各自独立选,最终都选中 d=50mm。

主结果表 · dvf_rmse3d_mm(首要指标,越低越好,单位 mm)

seed 0seed 1seed 2均值 ± 标准差
baseline-single-sagittal(基线,半预算)0.7610.7600.7630.762 ± 0.00134
parallel-2sag(d=50mm)0.7200.7190.7190.719 ± 0.000356
parallel-2cor(d=50mm)0.7250.7260.7260.726 ± 0.000438
orthogonal-sag-cor0.7360.7360.7360.736 ± 0.000308
oracle-full-dvf(上界)0.7000.7000.7000.700 ± 0.0

配套指标(各臂 3 种子均值;逐种子原始值见 work/results.json)

dvf_p95_mmrmse_ap_mmrmse_si_mmrmse_lr_mmlog10_cond_obsn_observations(9 折均值)
baseline-single-sagittal1.5580.3460.3200.5980.3811160.4
parallel-2sag1.4470.3180.3120.5650.1892071.1
parallel-2cor1.4620.3470.3230.5490.4511619.1
orthogonal-sag-cor1.4980.3340.3080.5790.2922092.7
oracle-full-dvf1.4070.3120.3360.529≈027833.7

ROI 质心误差 roi_centroid_err_mm(3 种子均值,三个 ROI 位置均已算出)

liver_domeliver_inferiorliver_lateral
baseline-single-sagittal0.4340.3950.613
parallel-2sag0.4700.3640.519
parallel-2cor0.4440.4030.587
orthogonal-sag-cor0.4430.3730.575
oracle-full-dvf0.4720.3590.506

注:ROI 位置不进入任何结论,只作参考——oracle-full-dvf 在 liver_dome 上反而是所有臂里最高的 0.472,说明这个指标在本轮设定下同样被模型截断主导,而不是被观测几何主导。


主结果图
主结果图(本轮实验的关键对比)。原图见随附 figs/ 目录。

2. 怎么读这个结果

这些数支持三条结论:

  1. 在这一轮设定下,"第二层切片给不给"比"第二层放什么取向"重要得多。baseline-single-sagittal 的 0.762mm 到三个双切片臂的 0.719 / 0.726 / 0.736mm,加第二层都有改善;而三个双切片臂彼此之间的差距,远小于它们和单层之间的差距。这句话比"正交更好"更站得住,也更容易让临床物理师买账。
  2. "矢状面对 LR 是盲的,所以正交必然重建得更好"这个直觉,在低秩模型下不成立。 直接证据是 oracle-full-dvf——它看得见全部三维真值、没有噪声、没有切片限制,LR RMSE 仍有 0.529mm,和切片臂的 0.565 / 0.579mm 差不多;而 AP/SI 各臂都在 0.308–0.347mm。LR 误差对所有臂(含 oracle)都远大于 AP/SI,这不可能是观测几何造成的。
  3. 配对差值的方向是稳定的,但幅度没有实用意义。 95% CI [-0.017, -0.003]mm 不含 0,方向上是平行双矢状略好;但 -1.1% 的幅度远低于判定线,我们不把它表述成"平行优于正交",只表述成"两者差异很小,且没有证据支持正交更好"。

这些数不支持的: 不支持任何临床摆位推荐;不支持外推到图像域(我们用的是已有配准点轨迹,不是真实 cine 图像,得到的误差是临床误差的下界);不支持外推到非线性/深度运动模型、其他部位、其他 K;3 个种子的一致性只说明数值稳定,不构成"显著性"的统计声称。

规模限制,放大后可能变的: 只有 2 例成人受试者、9 个呼吸周期、只有肝脏;27 个配对样本来自 9 折 × 3 种子,折之间并不独立。种子间标准差极小(1e-4 量级),说明本轮的不确定性主要来自受试者/周期,而不是随机种子——要动摇这个负结论,该加的是受试者数,不是种子数。

另一个读结果时要注意的点(审稿人会问): 等预算是按"切片数 = 2、层厚相同"对齐的,但各臂实际参与拟合的观测标量数并不相等——parallel-2sag 2071.1、orthogonal-sag-cor 2092.7、parallel-2cor 1619.1。前两者接近(所以这不是主对比结论的解释),但 parallel-2cor 明显少,读它的数时要带上这一点。

results.json.deviations 里的三条偏离,逐条交代:

  1. 五维扫描没有穷举。 K / sigma_sag / alpha / interleave / roi_site 的完整网格没跑,全部固定在计划给的默认值(K=3、sigma_sag=0.5mm、alpha=1.0、interleave=false);只有 parallel_spacing_mm 做了 4 档穷举池化选优。这不是算力不够(全流程 6 秒),是我们主动收窄,把 30 分钟预算用在保证核心预测的统计功效和复核结果上。直接后果:缺口 B(冠状配准惩罚 α)这一轮没有产出,α 只固定在 1.0 这个对正交最有利的取值上。
  2. interleave=true(双切片分时交替采集)完全没有实现,因为需要额外的时间插值建模。所以本轮结论只适用于双切片同帧并发观测的理想化场景——真机正交 cine 是交错采的,这一条是本轮与临床之间最实的一道缝。
  3. d=50mm 很可能是所测范围的边界解,不是真正最优点。 parallel-2sagparallel-2cor 用同一套池化流程各自独立选间距,两者都选中 4 档里的最大值 50mm(见 figs/spacing_sweep.png),说明在本数据集的网格跨度内,间距越大对低秩模型越有利;我们没有外推到 >50mm。这个方向对平行臂有利,也就是说,如果间距还能再放大,平行臂只会更好一点,不会让正交翻盘——这一条不威胁负结论,但必须写在论文里。

3. 你现在可以拿它做什么

最短路径:先动模型,别先动摆位。 oracle-full-dvf(0.700mm)和最好的切片臂(0.719mm)之间只剩很窄的一段,而所有臂的 LR 误差都被压在 0.529–0.598mm 这个带里。在 K=3 线性 PCA 这个模型下,观测几何已经不是瓶颈了。 值得投的下一步是把模型阶数 K 和模型类当自变量扫开(SCOPE 第 3 节③里预留的那个回应,这一轮反而变成了主结果):先确认 LR 误差随 K 增大到什么程度才掉下来,再决定要不要上非线性/深度模型。

先别投的: 图像域仿真和 GPU 那一段(第二段),在几何这条线上先别投——既然两切片臂之间的差异只有 -1.1%,再花力气把图像域仿真做逼真,也只是给一个本来就很小的差异加噪声。5070 该留给"换模型"那条线,不是"换摆位"那条线。

这个负结果怎么变成论文里的正资产: SCOPE 第 2 节的缺口 A 是"没人在等预算下把正交和平行头对头比过",这一轮把它填了,答案是"填了,没差别"——而全领域(Seregni / Paganelli / Jassar / Ginn)默认用正交却从没验证过这个默认。写成"我们检验了这条被普遍默认的前提,在低秩模型下它不成立,并给出了它为什么不成立的机制(瓶颈在模型截断而非可观测性)",这比一个 +5% 的正结果更难被拒。缺口 B(α 扫描)的意义也随之变了:既然在最有利的 α=1 下正交都没赢,α 扫描的结论会更强——"即使给正交最有利的配准质量假设,它也没有优势"。

审稿人最可能打的四个点,按威胁度排:

  1. "负结果是功效不足" — 最可能被打的一条。用 oracle 臂回应,不要用样本量辩解:不是没功效,是天花板在模型;oracle 看得见一切,LR 误差照样是 0.529mm。
  2. "n=2 受试者" — 承认边界,写死适用范围(成人、肝脏、自由呼吸、线性低秩模型),并说明种子间方差已经小到 1e-4 量级,不确定性来自受试者而非随机性。
  3. "interleave 没做,你比的不是真机构型" — 这一条我们无法帮您挡,只能显式承认(见第 2 节偏离 2)。它是下一轮最该补的一块。
  4. "d=50 是边界解" — 用上面第 2 节偏离 3 的方向性论证挡:边界方向对平行臂有利,不影响负结论。

4. 随附材料

全部在本目录下,work/ 是可独立重跑的完整工作区。

文件内容
work/run.sh一条命令复现全部结果:bash run.sh。脚本自己从 ETH 公开地址下载数据集(34MB),不需要任何账号或密钥
work/experiment.py数据加载、轴向校验闸门、PCA/低秩拟合与重建(9 折 × 3 种子 × 5 臂 × 4 档间距)
work/analyze.py池化各臂指标、跑 27 个配对样本上的可推翻预测判定、写 results.jsonfigs/*.png
work/mriio.pyETH .txt 运动场解析(含首行元数据剥离)
work/results.json原始结果。本报告每个数字都可在此回查
work/logs/run.log完整运行日志,含轴向校验闸门输出、间距选优、预测判定的逐条 cond_a/b/c 结果
work/logs/run_experiment.log实验步骤日志
work/figs/arms_rmse3d.png各臂 dvf_rmse3d_mm 对比
work/figs/paired_diff_27.png27 个配对差值(正交 − 平行)的逐样本分布
work/figs/axis_breakdown.png各臂分轴 RMSE——看这张图最快理解本轮结论:LR 误差对每个臂(含 oracle)都远高于 AP/SI
work/figs/spacing_sweep.png平行臂间距选优曲线(边界解证据)
work/data/ETH 原始 .txt 运动场文件缓存
work/NOTES.md实现决策记录:计划没有完全钉死的地方我们怎么定的、以及本轮如何排查了 bug 才接受这个负结果
SCOPE.md前一段的方向判断与文献查新全文

环境与可复现性:Python 3.12,torch 2.13.0+cpu(纯 CPU,无额外依赖包,不需要 GPU),随机种子固定为 0/1/2,总耗时 6 秒。bash run.sh 可从零重跑到同样的 results.json

关于数据与知识产权:我们不需要您的数据、代码或稿子。全部证据用公开数据集(ETH Zurich CVL 4DMRI,无需注册即可下载,学术用途)自己造,任何人拿到这个目录都能独立复查、也能独立反驳。


5. 方向判断与文献(摘自随附的 SCOPE.md)

参考来源(原样保留):


本文档由 JouleBeat · DeepGraph 出具。实验代码、日志与原始结果随附,结论可被复查与反驳。

随附材料(点开即看,不用下载)

打包下载全部材料(.zip)
口径与边界。这些限制与负结果均保留在原始材料中。
本案例源自一位研究者通过公开表单提交的方向,已隐去其姓名、单位与一切可定位信息。结论与代码可复查、可反驳。
← 全部案例 · JouleBeat · DeepGraph