# DeepGraph 免费验证案例 · 结直肠癌腹膜转移文献的两期主题变化

**提交方向**：结直肠癌腹膜转移的候选基因与通路（提交人选定「文献计量子集对比」）
**交付时间**：2026-08-27
**这一轮真跑了**：PubMed 检索 1792 篇带 MeSH 标注的文献（2015–2019 共 606 篇 /
2020–2026 共 1186 篇），115 个主题词做两期对比 + 1000 次年份打乱零模型 + 一版校正分析。纯 CPU。

---

## 0. 结论（这一轮最有用的不是那些变化，而是它们不可信）

直接跑，我们得到 **55 个主题词的两期占比显著变化**（FDR<0.05），
零模型 1000 次打乱里 963 次一个都挑不出来，经验 p<0.001。统计本身没问题。

**但交付前的复核发现，这些"变化"里有相当大一部分是索引假象，不是研究重心转移。**
两个混杂，都足以单独制造出一整套假结论：

**一、索引完整度在下滑。** 每篇文献的 MeSH 标注数从 2016 年的 16.1 个掉到 2023 年的 9.5 个
（前期均值 15.3，后期 12.0）。**这会系统性压低后期所有词的出现率。**
证据很直接：降幅最大的六个词是 Male、Middle Aged、Female、Aged、Adult、Young Adult ——
全是与研究内容无关的人口学检索标签。研究重心不可能整体"去人口学化"，是标注变少了。

**二、MeSH 词表在改版。** 升幅第一名 "Hyperthermic Intraperitoneal Chemotherapy" 从 0.0% 跳到 29.1%，
看着像爆发式增长。但它在整个语料里**首次出现于 2020 年** —— 这是 MeSH 那年新增的词条，
在此之前同样的研究被挂在别的词下面。把词表新增当成研究方向新增，是这类分析最常见的错法。

## 1. 我们做了校正，但校正没能通过自己的内部对照

扣掉两个混杂重跑：只保留 2018 年前就在语料里出现过的词（排除新增词条），
并用「该词占本篇 MeSH 总数的份额」代替出现率（抵消标注数漂移）。

校正后仍有 55 个词显著，其中内容词 41 个、
**人口学检索标签 14 个**。（显著性判据是逐词的 FDR<0.05，见下表；这一步没有再跑一次整体置换检验，所以这三个计数不带整体经验 p 值。）

**这就是问题所在。** 我们把检索标签当作内部对照——它们与研究内容无关，
如果校正彻底，它们应当不再显著。**实际仍有 14 个显著，说明校正不彻底，
残余的索引漂移还在。因此下面那张表里的内容词，我们同样不建议直接采信。**

## 2. 校正后的变化（供参考，不作结论）

**份额上升：**

| 主题词 | 前期份额 | 后期份额 | FDR |
|---|---:|---:|---:|
| Colorectal Neoplasms | 0.0520 | 0.0746 | 4.1e-22 |
| Peritoneal Neoplasms | 0.0656 | 0.0808 | 9.2e-14 |
| Cytoreduction Surgical Procedures | 0.0273 | 0.0402 | 8.6e-06 |
| Peritoneum | 0.0058 | 0.0127 | 3.7e-02 |
| Mice | 0.0037 | 0.0078 | 6.7e-03 |
| Tumor Microenvironment | 0.0004 | 0.0042 | 1.2e-04 |

**份额下降：**

| 主题词 | 前期份额 | 后期份额 | FDR |
|---|---:|---:|---:|
| Carcinoma | 0.0095 | 0.0028 | 3.2e-14 |
| Chemotherapy, Cancer, Regional Perfusion | 0.0096 | 0.0039 | 4.6e-12 |
| Chemotherapy, Adjuvant | 0.0080 | 0.0026 | 6.3e-10 |
| Lymphatic Metastasis | 0.0066 | 0.0020 | 4.1e-10 |
| Liver Neoplasms | 0.0107 | 0.0066 | 6.4e-06 |
| Infusions, Parenteral | 0.0045 | 0.0006 | 6.7e-16 |
| Adenocarcinoma | 0.0091 | 0.0053 | 1.1e-05 |
| Neoplasm Staging | 0.0088 | 0.0053 | 2.2e-07 |

方向上看，这和领域常识一致（细胞减灭术、肿瘤微环境上升；辅助化疗、淋巴转移、肝转移下降）。
但"和常识一致"不是证据——它同样可能是我们和常识犯了同一个错。

## 3. 这些数**不**支持什么

1. **不支持"研究重心发生了 X 变化"这类结论。** 内部对照没通过，残余混杂未量化。
2. **不支持任何单个词的解读。** 尤其 HIPEC 那条，是词表新增造成的。
3. **只用了 MeSH 与年份**，没用标题/摘要全文，没有引文网络，没有非英文文献。
4. **没有做提交方向里的实证分析**（候选基因与通路），那是另一件事。

## 4. 下一步：把这条分析做成可信的

这一轮真正的价值，是把三个坑提前挖出来了。要让结论站得住，接下来该做的：

1. **用固定版本的 MeSH 词表重新映射全部文献**，把新增词条回溯合并到它的上位词。
   这是消除"词表改版"混杂的唯一干净做法。
2. **按索引完整度分层或加权**，并把人口学检索标签作为常设内部对照——**校正之后它们必须不显著，
   这一条通不过就不发结论**。这一轮我们就是卡在这里。
3. **换成标题/摘要的词频与共现分析**，绕开 MeSH 索引本身的漂移，与 MeSH 结果互为交叉验证。

做完这三步，才会是一套**能通过内部对照**的文献计量结论，可以写进论文的背景与创新点论证。
这三条属于付费轮。

## 5. 随附材料

`work/fetch_corpus.py`（PubMed 公开接口取数）、`work/experiment.py`（原始两期对比 + 零模型）、
`work/adversarial_check.py`（第 0 节那五项复核）、`work/corrected.py`（校正版与内部对照）、
`claims.json`（跑前预测）、`work/results.json` / `corrected.json` / `adversarial.json`、`work/logs/run.log`。

数据来源为 PubMed 公开 E-utilities 接口，检索式写在 `fetch_corpus.py` 顶部，可原样复现。
