# DeepGraph 免费层交付 · 中药海马(Hippocampus spp.)防治阿尔茨海默病

**提交方向**: 中药海马防治阿尔茨海默病(关键词:阿尔茨海默病、海洋中药、神经炎症、神经突触、神经递质)
**目标档位**: 要我们把实验跑完、给数据和结果 · **投稿目标**: 未填写(本文按 **中文核心 / SCI 三四区** 校准;若你实际要冲一区或顶会,第 2、3 节的结论要重写)
**交付时间**: 2026-08-07

---

## 0. 先说一个判断:方向成立,但"海马 × AD 的网络药理学"在 2026 年 4 月已经被人发了,你不能再做同一篇

这个方向本身是干净的:海马是《中国药典》收载的动物药,AD 是刚需,神经炎症/突触/神经递质三条线也确实是它最可能的落点。问题在**具体命题**:Song P 等人 2026 年 4 月已在 *Naunyn-Schmiedeberg's Arch Pharmacol* 发表了整合综述,做完了 5 个药典物种、329 个成分、276 个结构明确化合物对 AD 基因模块的网络药理学,并报出 **APP、JUN、PPARγ** 为核心模块([PMID 41922822](https://pubmed.ncbi.nlm.nih.gov/41922822/))。该文作者单位是山东中医药大学**海洋中药研究院**+澳门科技大学——和你的关键词"海洋中药"高度重合,所以有两种情况:**如果这是你们组的**,这一轮正好帮你补上审稿人一定会问的对照;**如果不是**,你必须先解决"重复"这一关。

另一件必须直说的:你要的"把实验跑完给数据结果",在药效学层面我们做不了——**AD 的中药实验需要细胞/动物/湿实验,我们只有 CPU**。所以这一轮交付的是**计算侧能站住的那部分**,并且明确标出它推不出什么。

**两条出路**:①(本轮采用)把可计算的部分做到别人没做的深度——给那套流水线加上**空模型对照 + 疾病特异性对照 + 阈值敏感性**,让你的靶点结论从"预测"变成"经过特异性检验的选靶依据";② 承认小分子网络药理学抓不到海马的主体活性(海马约七成是蛋白/肽),把命题挪到**肽组学**——这需要你的质谱数据,我们不能凭空生成,但拿到数据后可以算。

## 1. 领域现状:网络药理学在爆炸式增长,而它的"同质化"已经被系统量化,成了新的评审武器

**拥挤程度(PubMed 实测,2026-08-07 检索)**:`"network pharmacology"[tiab]` 共 17,794 篇;年产量从 2020 年的 719 篇涨到 2026 年(至 8 月)的 4,039 篇。与 AD 交叉 614 篇,其中 **282 篇集中在 2025–2026 两年**;再加"molecular docking"333 篇,加"neuroinflammation"150 篇。中药 × AD(MeSH 交叉)711 篇。**结论:这条线极度拥挤,而且拥挤的方式高度雷同。**

**审稿人默认的 baseline 是一条固定流水线**:TCMSP / HERB / SymMap 取成分-靶点 → OB≥30%、DL≥0.18 筛选 → GeneCards/DisGeNET 取疾病基因 → 取交集 → STRING 建 PPI → Cytoscape+CytoHubba 按 degree 挑 hub → DAVID/Metascape 跑 KEGG/GO → AutoDock Vina 补几个对接。你交上去的稿子会被默认拿去和这条流水线比。

**过去 12 个月最关键的变化**:Diao 等人在 *Front Pharmacol*(2026;17:1748478)**系统分析了 1,038 篇网络分析研究**,把这条流水线的产出总结成一个三层"同质化"结构——**Flavonoid Centrality(总是槲皮素那几个)→ Hub-Target Core(总是那几个中心蛋白)→ Canonical Pathways(总是那几条通路)**,并指出这是"数据库偏倚被上下文不敏感的分析方法放大"的自我强化循环([PMID 41800093](https://pubmed.ncbi.nlm.nih.gov/41800093/))。这篇出来之后,"你的核心靶点是数据库假象"从模糊质疑变成了**有 1,038 篇样本量支撑的、可以直接引用来毙稿的意见**。

海马这一侧的实验证据反而很薄:AD 上目前主要是上述综述的计算工作;最接近的在体证据是抑郁/神经炎症模型——海马提取物抑制小鼠海马 CA1 区小胶质细胞、下调 pNF-κB 与 NLRP3、上调 BDNF 与 pNrf2/GPX4([Food Sci Nutr 2025, PMID 40552333](https://pubmed.ncbi.nlm.nih.gov/40552333/))。**这是好消息:你的神经炎症假说有落脚点,而 AD 在体证据的空位还开着。**

## 2. 还开着的缺口(按可行性排序)

**缺口 A:海马 × AD 的网络药理学结论,没有任何空模型对照。**
全领域都没做——这正是 1,038 篇综述指出的病根,但那篇只提出了框架,没给任何单味药算出"经验 p 值"。缺口开着的原因是:做对照不产生新靶点,不好写成"发现",所以没人愿意做。**可行性最高**:纯计算、数据全公开、今天就能跑完。做成了,它不是一篇独立的方法学论文,而是能**直接嵌进你正文的一节"靶点特异性验证"**——中文核心 / SCI 三四区的审稿人看到这一节,基本不会再问"是不是数据库偏倚"。若单独成文并扩展到多味海洋中药,可投中文核心或 SCI 四区的中药/信息学类期刊。

**缺口 B:海马的活性主体是蛋白与肽,而所有主流成分-靶点数据库只收小分子。**
海马干品蛋白占比高,已有活性报道也集中在肽段(如大腹海马来源降压肽,[Pharmaceutics 2025, PMID 41304787](https://pubmed.ncbi.nlm.nih.gov/41304787/))。这意味着**任何基于 TCMSP/HERB 的海马网络药理学,分析的都是它最不重要的那一小部分成分**,而且 OB/DL 那套口服生物利用度筛选规则是为植物小分子设计的,套到动物药上口径就错了。做成了(酶解-分离-活性肽鉴定 + 靶点归因)能发 SCI 三区,海洋药物/食品科学类期刊对这个组合友好。**门槛**:需要 UPLC-MS/MS 肽组学数据,我们跑不了,你有数据我们能算。

**缺口 C:神经炎症 / 突触 / 神经递质三条线上,海马缺剂量-效应与时序数据。**
现有在体证据是单剂量、单时间点、非 AD 模型。补上 3 个剂量 × 3 个时间点的 5xFAD 或 Aβ 注射模型数据,是最稳的发表路径。**但这必须做动物实验,我们做不了**,列在这里是让你知道计算部分该往哪个方向服务。

## 3. 评审会打你的三个点(提前堵)

**① "APP / JUN / PPARγ 是数据库假象,不是海马特有。"**
这是最致命的一条,而且现在有 1,038 篇的系统证据可以直接引来打你。APP 出现在 AD 网络里是同义反复(它就是 AD 的定义基因),JUN 和 PPARγ 是典型的高连接度promiscuous 节点。**怎么堵**:不要只报 FDR,要报**经验 p 值**——用规模和靶点度数都匹配的随机化合物集跑同一条流水线 1000 次,给出"随机集有多大比例也能捞到这几个核心靶点"。这正是本轮实验做的事。

**② "海马是动物药,你用植物药的筛选口径处理它。"**
OB≥30% / DL≥0.18 是为口服植物小分子定的规则;海马的主要成分是蛋白和肽,一过这个筛就被全部滤掉,剩下的是牛磺酸、胆固醇、次黄嘌呤、肌醇这类通用小分子——审稿人会问"你分析的到底是海马,还是任何海产品"。**怎么堵**:显式声明成分清单的来源与筛选口径,并**主动做一次"海产品共有成分 vs 海马特有成分"的拆分分析**;同时说明肽类成分在当前数据库中的缺失是已知边界,不是遗漏。

**③ "重复 + 缺乏实验验证。"**
PMID 41922822 已经占位。**怎么堵**:如果那篇不是你们组的,你的稿子必须在标题和摘要里就说清增量是什么(空模型对照 / 肽组学 / 在体验证),不能是"我们也做了海马 × AD 的网络药理学"。**中文核心 / SCI 三四区这个档位,最有效的增量不是 novelty,是"我做了别人没做的对照 + 我有一组自己的实验数据"**——哪怕只有一组细胞实验(BV2 小胶质细胞 LPS 模型测 NO/TNF-α/IL-1β),稿子的命运也完全不同。

## 4. 我们这一轮真去跑的实验

**选缺口 A**,理由:唯一在 CPU + 60 分钟内能做完且结论能站住的;它同时服务缺口 B 和 C——跑完你会拿到一张"哪些靶点值得花钱做湿实验验证、哪些是数据库噪声"的清单。

**可被推翻的预测**:
> 用规模与靶点度数都匹配的**随机小分子集**跑完全相同的标准流水线 1000 次,`APP / JUN / PPARγ` 中至少一个进入 top-10 PPI 度中心性 hub 的比例 **≥ 50%**;KEGG "Alzheimer disease"(hsa05010)达到 FDR<0.05 的比例 **≥ 80%**;因而海马成分集的 AD 富集**经验 p > 0.05(不显著)**。
> **推翻条件**:若随机集捞到这些 hub 的比例 < 20%、AD 通路显著比例 < 20%,且海马集的经验 p < 0.05,则预测被推翻——说明这条流水线是有判别力的,已发表的核心模块是真信号。两种结果对你都有用:前者告诉你必须加对照才能发,后者给你一个可以直接写进正文的强证据。

**主指标**

| 指标(机器名) | 口径 | 为什么要它 |
|---|---|---|
| `hub_recovery_rate` | 1000 个匹配随机集中,top-10 度中心性 hub 命中 {APP, JUN, PPARG, AKT1, TNF, IL6, TP53} 任一的比例(越高=越是假象) | 直接量化"核心靶点是不是任何药材都会出" |
| `hub_jaccard_null` | 任意两个互不相关随机集的 top-10 hub 列表 Jaccard 中位数 | 测这条流水线判别力的上限;>0.5 意味着它几乎不区分药材 |
| `emp_p_ad_overlap` | 海马靶点集 ∩ AD 基因集的大小,在空分布中的经验 p | 你论文里"命中 N 个 AD 靶点"那句话的真实显著性 |
| `emp_p_ad_kegg` | 海马集在 hsa05010 上的 −log10(p),在空分布中的经验 p | 通路富集结论的真实显著性 |
| `disease_rank_ad` | 同一套海马靶点集在 6 个疾病基因集上的富集强度排名(1=AD 最强) | 疾病特异性对照:若海马对高血压、结直肠癌一样"显著",AD 的说法就不成立 |

**要扫的自变量**:STRING 置信度阈值 {400, 700, 900}(直接回应"换个阈值 hub 就变了"的质疑);AD 基因集来源 {KEGG hsa05010 / DisGeNET Alzheimer's Disease / GWAS Catalog 2025 Alzheimer}。共 9 组配置。

**Baseline 是什么、为什么公平**:baseline 臂就是**文献里那条标准流水线本身**——海马成分集 → CTD 人类化合物-基因互作取靶点 → 与 AD 基因集取交集 → STRING(阈值内)建 PPI → degree 排序取 top-10 hub → 超几何检验 + BH 校正跑 KEGG/GO。它是公平对照,因为这就是审稿人默认的做法,我们没有把它做弱;实验臂只是给它加了一个它自己缺的东西:**同规模、同靶点度数分布的随机对照**。度数匹配这一步是关键——只匹配化合物个数会高估显著性,因为棕榈酸这类成分在 CTD 里挂着 868 个基因,而天冬氨酸只有 1 个。

**统计口径**:3 个随机种子(0/1/2)分别抽 1000 个空集,报**均值 ± 标准差**;所有臂共用同一份数据快照与同一段代码路径,预算对齐;**负结果照报**——如果跑出来是"海马的 AD 富集其实显著",我们会原样写上去,并说明这对你是好消息。

**这一轮做不到的部分(明确列出)**:
- **分子对接与 MD**:无 GPU,60 分钟内跑不完全成分 × 多靶点的 Vina + 动力学。
- **肽类成分**:CTD/STRING 只覆盖小分子与蛋白编码基因,海马的肽类活性成分在库里没有靶点记录。**本轮结论只对小分子成分有效**——而这个覆盖缺口本身就是我们要交给你的结论之一。
- **任何药效学判断**:没有细胞和动物数据,我们不会说海马有效或无效,只说"这条计算流水线给出的靶点,有多少经得起特异性检验"。
- **成分清单**:化合物列表是**输入参数,不是我们的发现**。脚本会把用到的每一个化合物、它的 CTD 靶点数和来源逐行打印,请你用自己实验室的 UPLC-MS/MS 成分表替换后重跑——代码、日志、数据快照会一并交付。

## 5. 参考来源

- [Medicinal seahorses (Hippocampus spp.) for Alzheimer's disease within species conservation framework](https://pubmed.ncbi.nlm.nih.gov/41922822/) — Song P 等,*Naunyn Schmiedebergs Arch Pharmacol* 2026;399(9):12873-12896,doi:10.1007/s00210-026-05246-4(329 成分、276 化合物、核心模块 APP/JUN/PPARγ)
- [Rethinking network analysis in ethnopharmacology: a multi-omics and AI roadmap to overcome conceptual and methodological biases](https://pmc.ncbi.nlm.nih.gov/articles/PMC12962898/) — Diao X 等,*Front Pharmacol* 2026;17:1748478,doi:10.3389/fphar.2026.1748478(系统分析 1,038 篇,提出三层"同质化")
- [Seahorse Attenuated DSS-Induced Depression in Mice by Inhibiting Neuroinflammation and Ferroptosis](https://pmc.ncbi.nlm.nih.gov/articles/PMC12183345/) — Chen PL 等,*Food Sci Nutr* 2025;13(6):e70482,doi:10.1002/fsn3.70482(海马在体抗神经炎症证据)
- [Therapeutic Potential of Big-Belly Seahorse Derived Peptide in Blood Pressure Regulation...](https://pubmed.ncbi.nlm.nih.gov/41304787/) — *Pharmaceutics* 2025;17(11):1449,doi:10.3390/pharmaceutics17111449(海马肽类活性成分证据)
- [The genus Hippocampus — a review on traditional medicinal uses, chemical constituents and pharmacological properties](https://pubmed.ncbi.nlm.nih.gov/25560669/) — *J Ethnopharmacol* 2015;162:104-11,doi:10.1016/j.jep.2014.12.032(海马化学成分基础综述)
- [Comparative Toxicogenomics Database's 20th anniversary: update 2025](https://pubmed.ncbi.nlm.nih.gov/39385618/) — *Nucleic Acids Res* 2025;53(D1):D1328-D1334,doi:10.1093/nar/gkae883 · [数据下载](https://ctdbase.org/downloads/)
- [The STRING database in 2023](https://pubmed.ncbi.nlm.nih.gov/36370105/) — *Nucleic Acids Res* 2023;51(D1):D638-D646,doi:10.1093/nar/gkac1000 · [数据下载](https://string-db.org/cgi/download)
- [Gene Set Knowledge Discovery with Enrichr](https://pubmed.ncbi.nlm.nih.gov/33780170/) — *Curr Protoc* 2021;1(3):e90,doi:10.1002/cpz1.90 · [Enrichr 基因集库](https://maayanlab.cloud/Enrichr/)

---

*本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索,已标注出处;判断部分是我们的观点,可以被反驳。*

```json
{
  "task_slug": "seahorse-ad-network-pharmacology-null-control",
  "question": "中药海马(Hippocampus spp.)小分子成分集在标准 TCM 网络药理学流水线下得到的 AD 核心靶点与通路富集,是否显著强于规模与靶点度数匹配的随机化合物集?即已发表的核心模块(APP/JUN/PPARγ)是海马特异信号还是数据库偏倚产物?",
  "falsifiable_prediction": "预测:1000 个 size+degree 匹配的随机化合物集中,top-10 PPI 度中心性 hub 命中 {APP,JUN,PPARG} 任一的比例 >= 50%,KEGG hsa05010 达 FDR<0.05 的比例 >= 80%,海马集经验 p > 0.05(不特异)。推翻条件:随机集 hub 命中比例 < 20% 且 AD 通路显著比例 < 20%,同时海马集 emp_p_ad_kegg < 0.05 与 emp_p_ad_overlap < 0.05 —— 则该流水线有判别力,已发表核心模块为真信号。",
  "dataset": "全部程序化下载,无需登录:(1) 化合物-基因互作 = CTD https://ctdbase.org/reports/CTD_chem_gene_ixns.tsv.gz (42MB gz, 实测 6s),按第 8 列 OrganismID==9606 过滤得 1,327,615 行 / 11,095 化合物 / 28,632 基因;(2) PPI = STRING v12 https://stringdb-downloads.org/download/protein.links.v12.0/9606.protein.links.v12.0.txt.gz (83MB, 实测 7s) + https://stringdb-downloads.org/download/protein.info.v12.0/9606.protein.info.v12.0.txt.gz 做 ENSP->gene symbol 映射;score>=700 时 473,860 边,>=900 时 201,712 边;(3) 基因集 = Enrichr GMT 纯文本 https://maayanlab.cloud/Enrichr/geneSetLibrary?mode=text&libraryName=<LIB>,LIB 取 KEGG_2021_Human(320 term, 'Alzheimer disease' 含 369 基因)、GO_Biological_Process_2025、DisGeNET、GWAS_Catalog_2025;(4) 海马成分集 = 输入参数,以 CTD ChemicalName 精确匹配,初始清单(括号内为实测 CTD 人类基因数,总计去重后数百个靶点):Taurine(79) Glycine(14) Cholesterol(109) 'Docosahexaenoic Acids'(83) 'Eicosapentaenoic Acid'(51) 'Palmitic Acid'(868) 'Oleic Acid'(278) 'Arachidonic Acid'(171) Hypoxanthine(7) Inositol(6) Sorbitol(22) Adenosine(68) Uridine(11) 'Glutamic Acid'(10) 'Aspartic Acid'(1) Lysine(2) Arginine(10) Alanine(1) Betaine(8) Creatine(5);Proline 在 CTD 无人类记录,须在日志中标注剔除。脚本必须逐条打印该清单与命中数,并支持外部 CSV 覆盖。",
  "arms": [
    {"name": "baseline-standard-pipeline", "is_baseline": true, "what": "文献默认流水线,不加任何对照:海马成分集 -> CTD 取靶点 -> 与 AD 基因集取交集 -> STRING(阈值内)建子网 -> degree 排序取 top-10 hub -> 对 KEGG_2021_Human + GO_BP_2025 做超几何检验 + BH FDR。输出 hub 列表与 FDR 表,即目前论文里会写进结果的那部分"},
    {"name": "null-size-matched", "is_baseline": false, "what": "弱空模型:从 CTD 11,095 个人类化合物中随机抽同样个数(20 个)的化合物集,跑完全相同的流水线 1000 次,得到 hub 与富集统计量的空分布"},
    {"name": "null-degree-matched", "is_baseline": false, "what": "强空模型(主对照):按每个海马成分的 CTD 靶点度数分箱(log2 分箱)抽取同分箱内的随机化合物,保证随机集的化合物个数与靶点度数分布都与海马集匹配,跑 1000 次。由此计算 emp_p_ad_overlap / emp_p_ad_kegg / hub_recovery_rate / hub_jaccard_null"},
    {"name": "disease-swap-control", "is_baseline": false, "what": "疾病特异性对照:固定海马靶点集,把 AD 基因集换成 5 个不相关疾病(Type 2 Diabetes / Hypertension / Colorectal Carcinoma / Asthma / Osteoarthritis,取自 DisGeNET 与 KEGG),比较富集强度并给出 AD 的排名 disease_rank_ad"}
  ],
  "metrics": [
    {"name": "hub_recovery_rate", "higher_is_better": false, "what": "null-degree-matched 的 1000 个随机集中,top-10 度中心性 hub 命中 {APP,JUN,PPARG,AKT1,TNF,IL6,TP53} 任一的比例;分别再报每个基因的单独命中率。越高说明核心靶点越是数据库假象"},
    {"name": "hub_jaccard_null", "higher_is_better": false, "what": "随机抽 200 对互不相关的空集,其 top-10 hub 列表 Jaccard 相似度的中位数与四分位数。>0.5 说明流水线几乎不区分药材"},
    {"name": "emp_p_ad_overlap", "higher_is_better": false, "what": "|海马靶点 ∩ AD 基因集| 在 null-degree-matched 空分布中的右尾经验 p = (#{null >= obs}+1)/(N+1)"},
    {"name": "emp_p_ad_kegg", "higher_is_better": false, "what": "海马集在 KEGG hsa05010 'Alzheimer disease' 上的 -log10(超几何 p) 在空分布中的右尾经验 p"},
    {"name": "disease_rank_ad", "higher_is_better": false, "what": "disease-swap-control 中 AD 在 6 个疾病上按 -log10(p) 排名,1 = AD 最强。排名靠后说明 AD 结论不特异"},
    {"name": "n_targets_seahorse", "higher_is_better": true, "what": "海马成分集在 CTD 中映射到的去重人类基因总数(记录用,不作优劣判断)"}
  ],
  "sweep": {
    "string_confidence_cutoff": ["400", "700", "900"],
    "ad_geneset_source": ["KEGG_2021_Human:Alzheimer disease", "DisGeNET:Alzheimer's Disease", "GWAS_Catalog_2025:Alzheimer"]
  },
  "seeds": [0, 1, 2],
  "budget_minutes": 45,
  "cpu_feasible": true,
  "out_of_scope": [
    "分子对接(AutoDock Vina)与分子动力学模拟 —— 无 GPU 且超时间预算",
    "海马的蛋白/肽类活性成分靶点 —— CTD/STRING 仅覆盖小分子与蛋白编码基因,库里没有记录;本轮结论仅对小分子成分成立,该覆盖缺口须作为交付结论之一明确写出",
    "任何药效学判断(不下'海马对 AD 有效/无效'的结论)—— 无细胞、无动物数据",
    "湿实验、质谱肽组学、动物行为学",
    "成分清单的正确性 —— 它是输入参数不是本轮发现,须逐条打印并支持用户用自己的 UPLC-MS/MS 成分表替换重跑"
  ],
  "env_notes": {
    "python": "必须用 /usr/bin/python3 (3.12.3);PATH 上默认的 python3 是 linuxbrew 3.14,缺 scipy/sklearn/matplotlib,直接用会失败",
    "preinstalled_in_usr_bin_python3": ["numpy 2.4.6", "scipy 1.18.0", "scikit-learn 1.9.0", "matplotlib 3.11.0", "requests 2.31.0"],
    "must_pip_install": "pip install --break-system-packages pandas networkx (PEP 668 环境,不加 --break-system-packages 会被拒;已实测可成功装到 python3.12)",
    "hardware": "2 核可用 / 30GB 内存 / 无 GPU;STRING 建议先用 awk 按 combined_score 过滤再进 pandas,避免全量 1200 万边入内存",
    "language": "按 Python 实现",
    "cached_downloads": "本轮探测已缓存 /tmp/ctd.tsv.gz、/tmp/string.gz、/tmp/kegg.gmt、/tmp/dis.gmt、/tmp/gwas.gmt,可直接复用以节省下载时间"
  },
  "deliverables": ["可重跑脚本", "各臂原始结果 CSV", "空分布直方图 + 观测值标注图", "完整运行日志", "数据快照版本号(CTD 报表日期 2026-07-30 / STRING v12.0 / Enrichr 库名)"]
}
```