案例 · 用户提交方向,已匿名
核心问题:结直肠癌腹膜转移的文献里,2015–2019 与 2020–2026 两个时间段的研究重心有没有系统性转移?哪些主题词的占比变化超出了随机波动?
本轮判定:统计层面显著(经验 p < 0.001),但校正后内部对照未通过,本轮不给结论
数据:PubMed 公开 E-utilities 接口检索到的 1792 篇带 MeSH 标注的文献(2015–2019 共 606 篇 / 2020–2026 共 1186 篇),检索式写在取数脚本顶部
真跑了:115 个主题词两期 Fisher 精确检验 + BH 校正 · 1000 次年份打乱零模型 · 一版扣除索引混杂的校正分析与内部对照 · 纯 CPU · 代码/日志/原始结果全部随附

案例速览

判定:尚不确定(统计成立,但分析自己的内部对照没通过,这一问本轮答不了)

数据源与对照规模:PubMed 公开接口,1792 篇带 MeSH 标注的文献,115 个主题词,1000 次年份打乱零模型,外加一版校正分析,纯 CPU

主要结论:直接跑:55 个主题词两期占比显著变化(FDR<0.05),1000 次打乱里 963 次一个都挑不出来,经验 p < 0.001,统计本身没问题。但复核发现两个足以单独制造整套假结论的混杂:每篇文献的 MeSH 标注数从 2016 年的 16.1 个掉到 2023 年的 9.5 个(降幅最大的六个词全是与研究内容无关的人口学检索标签),以及 MeSH 词表改版(升幅第一名的词首次出现于 2020 年,是那年新增的词条)。扣掉两个混杂重跑,仍有 55 个词显著,其中人口学检索标签 14 个——它们与研究内容无关,本该被校正掉,仍显著说明校正不彻底。

这些结果不支持:不支持「研究重心发生了 X 变化」这类结论——内部对照没通过,残余混杂未量化。不支持任何单个词的解读。只用了 MeSH 与年份,没用标题/摘要全文,没有引文网络,没有非英文文献。校正后的那些计数是逐词 FDR<0.05 的判据,这一步没有再跑整体置换检验,不带整体经验 p 值。

代码 / 原始结果 / 日志:PubMed 取数脚本(检索式可原样复现)、原始两期对比 + 零模型、五项敌意复核、校正版与内部对照脚本、results.json / corrected.json / adversarial.json 与运行日志全部随附。

DeepGraph 免费验证案例 · 结直肠癌腹膜转移文献的两期主题变化

提交方向:结直肠癌腹膜转移的候选基因与通路(提交人选定「文献计量子集对比」) 交付时间:2026-08-27 这一轮真跑了:PubMed 检索 1792 篇带 MeSH 标注的文献(2015–2019 共 606 篇 / 2020–2026 共 1186 篇),115 个主题词做两期对比 + 1000 次年份打乱零模型 + 一版校正分析。纯 CPU。


0. 结论(这一轮最有用的不是那些变化,而是它们不可信)

直接跑,我们得到 55 个主题词的两期占比显著变化(FDR<0.05), 零模型 1000 次打乱里 963 次一个都挑不出来,经验 p<0.001。统计本身没问题。

但交付前的复核发现,这些"变化"里有相当大一部分是索引假象,不是研究重心转移。 两个混杂,都足以单独制造出一整套假结论:

一、索引完整度在下滑。 每篇文献的 MeSH 标注数从 2016 年的 16.1 个掉到 2023 年的 9.5 个 (前期均值 15.3,后期 12.0)。这会系统性压低后期所有词的出现率。 证据很直接:降幅最大的六个词是 Male、Middle Aged、Female、Aged、Adult、Young Adult —— 全是与研究内容无关的人口学检索标签。研究重心不可能整体"去人口学化",是标注变少了。

二、MeSH 词表在改版。 升幅第一名 "Hyperthermic Intraperitoneal Chemotherapy" 从 0.0% 跳到 29.1%, 看着像爆发式增长。但它在整个语料里首次出现于 2020 年 —— 这是 MeSH 那年新增的词条, 在此之前同样的研究被挂在别的词下面。把词表新增当成研究方向新增,是这类分析最常见的错法。

主结果图
主结果图(本轮实验的关键对比)。原图见随附材料。

1. 我们做了校正,但校正没能通过自己的内部对照

扣掉两个混杂重跑:只保留 2018 年前就在语料里出现过的词(排除新增词条), 并用「该词占本篇 MeSH 总数的份额」代替出现率(抵消标注数漂移)。

校正后仍有 55 个词显著,其中内容词 41 个、 人口学检索标签 14 个。(显著性判据是逐词的 FDR<0.05,见下表;这一步没有再跑一次整体置换检验,所以这三个计数不带整体经验 p 值。)

这就是问题所在。 我们把检索标签当作内部对照——它们与研究内容无关, 如果校正彻底,它们应当不再显著。实际仍有 14 个显著,说明校正不彻底, 残余的索引漂移还在。因此下面那张表里的内容词,我们同样不建议直接采信。

2. 校正后的变化(供参考,不作结论)

份额上升:

主题词前期份额后期份额FDR
Colorectal Neoplasms0.05200.07464.1e-22
Peritoneal Neoplasms0.06560.08089.2e-14
Cytoreduction Surgical Procedures0.02730.04028.6e-06
Peritoneum0.00580.01273.7e-02
Mice0.00370.00786.7e-03
Tumor Microenvironment0.00040.00421.2e-04

份额下降:

主题词前期份额后期份额FDR
Carcinoma0.00950.00283.2e-14
Chemotherapy, Cancer, Regional Perfusion0.00960.00394.6e-12
Chemotherapy, Adjuvant0.00800.00266.3e-10
Lymphatic Metastasis0.00660.00204.1e-10
Liver Neoplasms0.01070.00666.4e-06
Infusions, Parenteral0.00450.00066.7e-16
Adenocarcinoma0.00910.00531.1e-05
Neoplasm Staging0.00880.00532.2e-07

方向上看,这和领域常识一致(细胞减灭术、肿瘤微环境上升;辅助化疗、淋巴转移、肝转移下降)。 但"和常识一致"不是证据——它同样可能是我们和常识犯了同一个错。

3. 这些数支持什么

  1. 不支持"研究重心发生了 X 变化"这类结论。 内部对照没通过,残余混杂未量化。
  2. 不支持任何单个词的解读。 尤其 HIPEC 那条,是词表新增造成的。
  3. 只用了 MeSH 与年份,没用标题/摘要全文,没有引文网络,没有非英文文献。
  4. 没有做提交方向里的实证分析(候选基因与通路),那是另一件事。

4. 下一步:把这条分析做成可信的

这一轮真正的价值,是把三个坑提前挖出来了。要让结论站得住,接下来该做的:

  1. 用固定版本的 MeSH 词表重新映射全部文献,把新增词条回溯合并到它的上位词。 这是消除"词表改版"混杂的唯一干净做法。
  2. 按索引完整度分层或加权,并把人口学检索标签作为常设内部对照——校正之后它们必须不显著, 这一条通不过就不发结论。这一轮我们就是卡在这里。
  3. 换成标题/摘要的词频与共现分析,绕开 MeSH 索引本身的漂移,与 MeSH 结果互为交叉验证。

做完这三步,才会是一套能通过内部对照的文献计量结论,可以写进论文的背景与创新点论证。 这三条属于付费轮。

5. 随附材料

work/fetch_corpus.py(PubMed 公开接口取数)、work/experiment.py(原始两期对比 + 零模型)、 work/adversarial_check.py(第 0 节那五项复核)、work/corrected.py(校正版与内部对照)、 claims.json(跑前预测)、work/results.json / corrected.json / adversarial.jsonwork/logs/run.log

数据来源为 PubMed 公开 E-utilities 接口,检索式写在 fetch_corpus.py 顶部,可原样复现。

随附材料(点开即看,不用下载)

打包下载全部材料(.zip)
包里不含体积大的原始下载数据(取数脚本会自动重新下载)。
本案例源自一位研究者通过公开表单提交的方向,已隐去其姓名、单位与一切可定位信息。结论与代码可复查、可反驳。
← 全部案例 · JouleBeat · DeepGraph