判定:尚不确定(统计成立,但分析自己的内部对照没通过,这一问本轮答不了)
数据源与对照规模:PubMed 公开接口,1792 篇带 MeSH 标注的文献,115 个主题词,1000 次年份打乱零模型,外加一版校正分析,纯 CPU
主要结论:直接跑:55 个主题词两期占比显著变化(FDR<0.05),1000 次打乱里 963 次一个都挑不出来,经验 p < 0.001,统计本身没问题。但复核发现两个足以单独制造整套假结论的混杂:每篇文献的 MeSH 标注数从 2016 年的 16.1 个掉到 2023 年的 9.5 个(降幅最大的六个词全是与研究内容无关的人口学检索标签),以及 MeSH 词表改版(升幅第一名的词首次出现于 2020 年,是那年新增的词条)。扣掉两个混杂重跑,仍有 55 个词显著,其中人口学检索标签 14 个——它们与研究内容无关,本该被校正掉,仍显著说明校正不彻底。
这些结果不支持:不支持「研究重心发生了 X 变化」这类结论——内部对照没通过,残余混杂未量化。不支持任何单个词的解读。只用了 MeSH 与年份,没用标题/摘要全文,没有引文网络,没有非英文文献。校正后的那些计数是逐词 FDR<0.05 的判据,这一步没有再跑整体置换检验,不带整体经验 p 值。
代码 / 原始结果 / 日志:PubMed 取数脚本(检索式可原样复现)、原始两期对比 + 零模型、五项敌意复核、校正版与内部对照脚本、results.json / corrected.json / adversarial.json 与运行日志全部随附。
提交方向:结直肠癌腹膜转移的候选基因与通路(提交人选定「文献计量子集对比」) 交付时间:2026-08-27 这一轮真跑了:PubMed 检索 1792 篇带 MeSH 标注的文献(2015–2019 共 606 篇 / 2020–2026 共 1186 篇),115 个主题词做两期对比 + 1000 次年份打乱零模型 + 一版校正分析。纯 CPU。
直接跑,我们得到 55 个主题词的两期占比显著变化(FDR<0.05), 零模型 1000 次打乱里 963 次一个都挑不出来,经验 p<0.001。统计本身没问题。
但交付前的复核发现,这些"变化"里有相当大一部分是索引假象,不是研究重心转移。 两个混杂,都足以单独制造出一整套假结论:
一、索引完整度在下滑。 每篇文献的 MeSH 标注数从 2016 年的 16.1 个掉到 2023 年的 9.5 个 (前期均值 15.3,后期 12.0)。这会系统性压低后期所有词的出现率。 证据很直接:降幅最大的六个词是 Male、Middle Aged、Female、Aged、Adult、Young Adult —— 全是与研究内容无关的人口学检索标签。研究重心不可能整体"去人口学化",是标注变少了。
二、MeSH 词表在改版。 升幅第一名 "Hyperthermic Intraperitoneal Chemotherapy" 从 0.0% 跳到 29.1%, 看着像爆发式增长。但它在整个语料里首次出现于 2020 年 —— 这是 MeSH 那年新增的词条, 在此之前同样的研究被挂在别的词下面。把词表新增当成研究方向新增,是这类分析最常见的错法。

扣掉两个混杂重跑:只保留 2018 年前就在语料里出现过的词(排除新增词条), 并用「该词占本篇 MeSH 总数的份额」代替出现率(抵消标注数漂移)。
校正后仍有 55 个词显著,其中内容词 41 个、 人口学检索标签 14 个。(显著性判据是逐词的 FDR<0.05,见下表;这一步没有再跑一次整体置换检验,所以这三个计数不带整体经验 p 值。)
这就是问题所在。 我们把检索标签当作内部对照——它们与研究内容无关, 如果校正彻底,它们应当不再显著。实际仍有 14 个显著,说明校正不彻底, 残余的索引漂移还在。因此下面那张表里的内容词,我们同样不建议直接采信。
份额上升:
| 主题词 | 前期份额 | 后期份额 | FDR |
|---|---|---|---|
| Colorectal Neoplasms | 0.0520 | 0.0746 | 4.1e-22 |
| Peritoneal Neoplasms | 0.0656 | 0.0808 | 9.2e-14 |
| Cytoreduction Surgical Procedures | 0.0273 | 0.0402 | 8.6e-06 |
| Peritoneum | 0.0058 | 0.0127 | 3.7e-02 |
| Mice | 0.0037 | 0.0078 | 6.7e-03 |
| Tumor Microenvironment | 0.0004 | 0.0042 | 1.2e-04 |
份额下降:
| 主题词 | 前期份额 | 后期份额 | FDR |
|---|---|---|---|
| Carcinoma | 0.0095 | 0.0028 | 3.2e-14 |
| Chemotherapy, Cancer, Regional Perfusion | 0.0096 | 0.0039 | 4.6e-12 |
| Chemotherapy, Adjuvant | 0.0080 | 0.0026 | 6.3e-10 |
| Lymphatic Metastasis | 0.0066 | 0.0020 | 4.1e-10 |
| Liver Neoplasms | 0.0107 | 0.0066 | 6.4e-06 |
| Infusions, Parenteral | 0.0045 | 0.0006 | 6.7e-16 |
| Adenocarcinoma | 0.0091 | 0.0053 | 1.1e-05 |
| Neoplasm Staging | 0.0088 | 0.0053 | 2.2e-07 |
方向上看,这和领域常识一致(细胞减灭术、肿瘤微环境上升;辅助化疗、淋巴转移、肝转移下降)。 但"和常识一致"不是证据——它同样可能是我们和常识犯了同一个错。
这一轮真正的价值,是把三个坑提前挖出来了。要让结论站得住,接下来该做的:
做完这三步,才会是一套能通过内部对照的文献计量结论,可以写进论文的背景与创新点论证。 这三条属于付费轮。
work/fetch_corpus.py(PubMed 公开接口取数)、work/experiment.py(原始两期对比 + 零模型)、 work/adversarial_check.py(第 0 节那五项复核)、work/corrected.py(校正版与内部对照)、 claims.json(跑前预测)、work/results.json / corrected.json / adversarial.json、work/logs/run.log。
数据来源为 PubMed 公开 E-utilities 接口,检索式写在 fetch_corpus.py 顶部,可原样复现。