# DeepGraph 免费层交付 · 中药活性成分 × 缺血性卒中

**提交方向**: 中药活性成分在缺血性卒中治疗中的应用及作用机制研究
**目标档位**: 把实验跑完、给数据和结果 · **投稿目标**: 未填写（下文按**中文核心 / SCI 三四区**校准，如果你实际是冲一区综述或顶刊，请告诉我们，判断会不一样）
**交付时间**: 2026-08-07

---

## 0. 先说一个判断:你的命题本体我们做不了,但你这条路上最容易被毙的那一环我们能替你做掉

"中药活性成分治缺血性卒中的作用机制"这个命题的核心证据必须来自 MCAO 动物模型、OGD/R 细胞模型、WB/qPCR/免疫组化——**这些我们一个都做不了**（只有 CPU，没有任何湿实验能力）。所以这一轮我们不碰机制本身。

我们碰的是你几乎一定会用到的那个前置环节：**网络药理学筛靶点**。理由是这条路现在的标准写法就是"网络药理学+分子对接预测机制 → 挑 3-5 个靶点做实验验证"，而这个模板正在被审稿人系统性怀疑。它缺的恰好是一个纯计算、CPU 就能做的东西：**空模型对照**——证明你选出的核心靶点不是"换任何一组化合物都会选出来的那几个"。

两条出路，我们推荐第一条：
- **(a) 湿实验为主，我们补计算侧的靶点优先级 + 空模型对照**：把候选靶点从几十个收敛到 3-5 个能做 WB 的，并给出"这几个靶点不是随机产物"的统计证据。这直接进你论文的方法学部分，堵住最常见的一条拒稿理由。**推荐这条。**
- **(b) 纯方法学文章**（"网络药理学在卒中方向的可重复性评估"）。数据量小、不需要湿实验，但单独发的难度反而更高，审稿人会问"那你的改进方法在真实药物上验证了吗"。

---

## 1. 领域现状:不是缺研究,是缺能被复现的研究——网络药理学模板已经严重过载

具体量级（2026-08-07 PubMed 实时检索，标题/摘要字段）：

- `"network pharmacology"` 全库 **17,792** 篇，其中 **8,636** 篇发表于 2025-2026 两年内——**近半数产出集中在最近两年**。
- `"network pharmacology" + "molecular docking"` 2025-2026 两年 **5,244** 篇。这个组合已经是一个批量生产的模板。
- 落到你的方向：`network pharmacology + (stroke OR cerebral ischemia)` 全库 **500** 篇，其中 **237** 篇在 2025-2026。也就是说**你这条细分线上，最近两年平均每三天出一篇同类文章**。
- `(TCM OR Chinese herbal) + (ischemic stroke OR cerebral ischemia)` 2025-2026 两年 **224** 篇。

审稿人默认你要和谁比 / 会预设你知道什么：

- **成分层面的"标准 baseline"**：丹参酮 IIA（磺酸钠注射液已有 2025 年的 RCT 系统评价与 meta 分析，J Ethnopharmacol）、黄芩苷/黄芩素、人参皂苷、川芎嗪、羟基红花黄色素 A、梓醇。你写一个新成分，审稿人第一反应是"比丹参酮 IIA 强在哪"。
- **方剂层面**：补阳还五汤是这条线的默认参照系，2026 年还在出"网络药理学+分子对接"的新文章（Medicine, PMID 42470003）。
- **机制层面**：铁死亡（Nrf2/GPX4）、神经炎症/小胶质细胞极化、血脑屏障、自噬、PI3K/Akt——这五个在 2025 年已经被写透了。2025 年 PLoS One 那篇直接就是"网络药理学+数据挖掘看中药调控铁死亡治缺血性卒中"。**你如果再写一个"XX 通过抑制铁死亡保护缺血性卒中"，novelty 几乎为零，但这不致命——三四区更看你做得扎不扎实。**
- **公认难点**：不是找不到靶点，是**候选靶点太多且不可证伪**。同一个方剂换个数据库、换个 OB/DL 阈值，核心靶点列表就变。2025 年 Pharmaceuticals 那篇 "Trends and Pitfalls" 和 J Adv Res 那篇现状评估都点了这件事：缺乏统一标准、缺乏对照、结果高度依赖数据库选择。

---

## 2. 还开着的缺口(按可行性排序)

**缺口 1：网络药理学几乎从不做空模型对照(可行性最高,我们这轮就做这个)**
现在的标准流程是：成分→靶点→与疾病靶点取交集→建 PPI→按 degree 排序→取 top hub→宣布这是核心靶点。问题在于 PPI 网络（STRING/BioGRID）的度分布极度偏斜，被研究得多的蛋白（TNF、IL6、AKT1、TP53、VEGFA）天然是 hub。**几乎没有论文验证过：换一组和中药毫无关系的、靶点数量相当的随机化合物，跑同一条流程，会不会选出同一批 hub。** 这个缺口还开着，是因为做它需要写一点代码、且结果可能否定自己的主结论——没人愿意做。做成了：够一篇中文核心或 SCI 四区的方法学改进文；更实际的用法是**作为你主论文的一个补充分析**，直接把审稿人的质疑变成你的加分项。

**缺口 2：成分-靶点数据库之间的一致性从没被量化(可行性中等)**
TCMSP、HERB、SymMap、CTD 对同一个化合物给出的人类靶点差异很大。一篇论文只用一个库，从不报告"换一个库结论还成不成立"。量化这个不一致性（对同一批中药成分，跨库靶点 Jaccard 相似度），可发中文核心。缺点：数据获取工程量比缺口 1 大（TCMSP 无稳定下载接口，需要抓取），我们这轮做不进 60 分钟。

**缺口 3：分期用药与靶点的对应关系(可行性最低,但价值最高)**
缺血性卒中急性期（0-24h，兴奋性毒性/氧化应激）、亚急性期（炎症/BBB 破坏）、恢复期（血管新生/神经再生）的治疗窗完全不同，但绝大多数网络药理学文章把靶点当成一个静态列表，不分期。2025 年 Ageing Res Rev 那篇按病理分期讲免疫细胞靶点，说明这个视角正在被认可。做成了能上 SCI 二三区。但这需要分期转录组数据（GEO 上的 MCAO 时间序列），数据筛选和批次校正的工作量超出本轮 60 分钟预算。

---

## 3. 评审会打你的三个点(提前堵)

**① "你的核心靶点是随机的吗？"——三四区最常见的实质性质疑。**
具体形式：审稿人（尤其是有生信背景的）会说"TNF、IL6、AKT1 出现在几乎每一篇中药网络药理学论文里，请说明它们是你研究对象的特异靶点，而非数据库偏倚的产物"。
怎么防：给出空模型对照——用靶点数匹配的随机化合物集跑同一条流程，报告经验 p 值。**这是本轮实验的直接产出，跑完你可以直接引用。**

**② "OB≥30%、DL≥0.18 这两个阈值的依据是什么？"**
这是 TCMSP 的默认值，被抄了十年，但对很多中药成分（尤其糖苷类，如人参皂苷、梓醇、天麻素）是错的——它们口服生物利用度极低，却在体内经肠道菌群代谢后起效，用 OB 卡会直接把真正起效的成分筛掉。
怎么防：**不要只用默认阈值**。做一个阈值敏感性分析（OB 取 20/30/40，DL 取 0.1/0.18/0.3），报告核心靶点列表的变化。如果不变，说明结论稳健；如果变了，如实报告并说明你选定阈值的理由（例如以已有药代文献支持的成分为准）。审稿人要的不是完美，是你知道这个问题存在。

**③ "分子对接分数能说明什么？"**
Vina 打分 -7 kcal/mol 以下被普遍当作"结合良好"，但对接分数和真实亲和力的相关性很弱，且没有阴性对照——你没跑过"随机蛋白 vs 同一化合物"的分数分布，就不知道 -7 到底算不算好。
怎么防：如果你做对接，**同时对 20-50 个无关蛋白做同样的对接，给出分数的背景分布**，然后说"我们的靶点位于背景分布的前 5%"。这一句能把对接从装饰变成证据。同样是纯 CPU 能做的事，但结构准备（受体去水、加氢、盒子定义）不稳定，我们这轮不放进来。

**关于 novelty**：如果你的目标确实是中文核心/SCI 三四区，**上面三点比 novelty 重要得多**。这个档位的审稿人一般不会因为"机制不新"毙你，但会因为"结果不可复现/无对照"毙你。所以我们把这一轮的资源全部投在③②①的第①点上。

---

## 4. 我们这一轮真去跑的实验

**选缺口 1**。理由：它是唯一一个在 CPU + 60 分钟内能得到确定结论的；而且不管结果朝哪边倒，对你都有用——支持标准流程，你就有了引用来堵审稿人；不支持标准流程，你就有了一个必须加进方法学的对照，同时这本身是可发表的发现。

### 可被推翻的预测

> **预测**：常规"degree-hub"网络药理学流程，用中药活性成分集跑出来的靶点排序，在**未参与流程的 hold-out 卒中疾病基因**上的富集程度（AUROC），**不显著高于**用"靶点数量匹配的随机化合物集"跑同一流程的零分布（经验 p > 0.05）。换句话说：核心靶点主要由 PPI 网络的度分布和数据库研究热度决定，而不是由化合物本身决定。

> **什么算这个预测被推翻**：3 个随机种子中至少 2 个给出经验 p < 0.05，且中药成分臂的 AUROC 相对零分布中位数的提升在 3 个种子中方向一致。此时结论反转为"常规流程确有成分特异性"，我们照样把它写成结果交给你。

### 数据（全部已实测可下载，无需注册）

| 数据 | 来源 | 实测体积 | 实测内容 |
|---|---|---|---|
| 化合物-基因互作 | `ctdbase.org/reports/CTD_chem_gene_ixns.tsv.gz` | 42.7 MB | 人类记录 1,327,615 行，覆盖 11,095 个化合物 |
| 疾病-基因（人工审编） | `ctdbase.org/reports/CTD_curated_genes_diseases.tsv.gz` | 564 KB | 5 个卒中相关 MeSH 合计 **131 个唯一基因** |
| PPI 网络 | STRING v12.0 `9606.protein.physical.links` | 8.95 MB | 人类物理互作 |
| 蛋白 ID 映射 | STRING v12.0 `9606.protein.info` | 2.0 MB | ENSP → gene symbol |

卒中疾病基因取 MeSH `D002545`(脑缺血) / `D020521`(卒中) / `D000083242`(缺血性卒中) / `D020244`(大脑中动脉梗死) / `D002546`(短暂性脑缺血发作)。

中药成分集：取 CTD 中有人类互作记录的活性成分，实测可用的包括丹参酮类(379 行)、黄芩素(241)、黄芩苷(68)、人参皂苷类(448)、小檗碱(572)、姜黄素(2303)、白藜芦醇(11937)、葛根素(157)、丹酚酸类(66)、黄芪甲苷(39)、淫羊藿苷(53)、梓醇(42)、天麻素(14)、羟基红花黄色素 A(23)、灯盏乙素(20)、槲皮素(6404)、山奈酚(459)、木犀草素(556)、三七皂苷 R1(55)、芍药苷(4)。**注意：川芎嗪、红景天苷、蛇床子素在 CTD 里查不到人类记录（实测 0 行），不进入本轮。**

### 三个臂

| 臂 | 是否 baseline | 做什么 |
|---|---|---|
| `baseline-degree-hub` | ✅ | 标准流程：中药成分靶点 ∩ D_seed → 取 STRING 子网 → 按 degree 排序全部候选基因 |
| `null-random-compounds` | 零分布 | 从 CTD 的 11,095 个人类化合物中抽取**靶点数量分布匹配**的随机化合物集，跑**完全相同**的流程，重复 1000 次 |
| `proposed-null-corrected` | ✕ | 用零分布对每个候选基因的 degree 做经验校正（z / empirical p），按校正后分数排序 |

**为什么这个 baseline 是公平的**：三个臂共用同一份 D_seed、同一张 PPI 网络、同一套阈值，唯一差别是输入的化合物集合。随机化合物按靶点数分层匹配（CTD 中靶点数 ≥20 的化合物有 1,986 个，≥50 的有 1,045 个，采样池足够），排除"随机组因为靶点少而吃亏"这种平凡解释。

### 主指标

| 指标 | 口径 | 为什么 |
|---|---|---|
| `holdout_auroc` | 把全部候选基因按流程分数排序，hold-out 卒中基因为正例、其余为负例，算 AUROC | **主指标**。131 个疾病基因分半后正例只有 ~65 个，precision@K 的统计功效太弱；AUROC 对小正例集稳健得多 |
| `precision_at_k` | top-K 中命中 hold-out 卒中基因的比例，K∈{10,20,50} | 更贴近你实际用法（"我只挑 5 个做 WB"），但功效弱，作为次指标报告并注明 |
| `topk_jaccard_vs_null` | 中药成分臂 top-K 与 1000 次随机臂 top-K 的 Jaccard 相似度中位数 | 直接量化"模板化"程度。这个数越高，说明核心靶点越不特异 |

**要扫的自变量**：K ∈ {10, 20, 50}；STRING combined_score 阈值 ∈ {400, 700, 900}（低/中/高置信度，检验结论是否依赖网络稀疏度）。

**统计口径**：3 个随机种子（种子同时控制 D_seed / D_hold 的分半和随机化合物抽样）；每个条件 1000 次置换；经验 p 用 (r+1)/(n+1)；报告 3 个种子的均值与标准差，不只报均值。**负结果照报**——如果背景校正流程（`proposed-null-corrected`）也没能超过 baseline，我们就如实写"背景校正无收益"，不做任何粉饰。

### 这一轮明确做不到的

- **任何湿实验**：MCAO、OGD/R、WB、qPCR、免疫荧光——一个都没有。这轮的产出是计算侧的靶点优先级和统计对照，不是机制证据。
- **分子对接**：受体结构准备在 CPU 上不稳定，且对接分数本身不是这轮要回答的问题。第 3 节③给的"背景分布"做法你可以自己补，我们这轮不做。
- **TCMSP/HERB 的成分覆盖**：CTD 只覆盖到约 20 个有人类实验记录的中药成分，而 TCMSP 一个方剂就能列出上百个成分。**这是本轮最大的外推限制**：我们的结论适用于"有明确文献支持的单体成分"，不能直接推广到 TCMSP 那种基于 OB/DL 筛选的全成分列表。反过来说，如果连证据最扎实的这 20 个成分都通不过空模型对照，TCMSP 全成分列表的情况只会更差——这个方向的推断是成立的。
- **因果性**：本实验只能回答"靶点排名是否超出随机基线"，不能回答"某个靶点是不是中药的真实作用靶点"。

---

## 5. 参考来源

- [Trends and Pitfalls in the Progress of Network Pharmacology Research on Natural Products. *Pharmaceuticals* 2025;18(4):538](https://pmc.ncbi.nlm.nih.gov/articles/PMC12030339/) — 天然产物网络药理学的方法学陷阱（PMID 40283973）
- [Evaluating current status of network pharmacology for herbal medicine focusing on identifying mechanisms and therapeutic effects. *J Adv Res* 2025](https://doi.org/10.1016/j.jare.2024.12.040) — 缺乏统一标准与对照的现状评估（PMID 39730024）
- [Ferroptosis regulation by traditional Chinese medicine for ischemic stroke intervention based on network pharmacology and data mining. *PLoS One* 2025](https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0321751) — 本方向 2025 年的典型模板文（PMID 40238820）
- [Elucidating the mechanism of Buyang Huanwu Decoction in the treatment of ischemic stroke: A network pharmacology and molecular docking study. *Medicine (Baltimore)* 2026](https://pubmed.ncbi.nlm.nih.gov/42470003/) — 补阳还五汤这条默认参照系仍在持续产出（PMID 42470003）
- [Traditional Chinese herbal medicines for the treatment of ischemic stroke in China. *Ageing Res Rev* 2025;108:102803](https://pubmed.ncbi.nlm.nih.gov/40516828/) — 国内中药治缺血性卒中的整体综述（PMID 40516828）
- [Application of Traditional Chinese Medicine in the different pathological stages of ischemic stroke: Target immune cells. *Ageing Res Rev* 2025;112:102866](https://pubmed.ncbi.nlm.nih.gov/40784530/) — 分期视角（对应第 2 节缺口 3）（PMID 40784530）
- [A systematic review and meta-analysis of RCTs on the efficacy and safety of tanshinone IIA sodium sulfonate injection as adjunctive therapy for stroke. *J Ethnopharmacol* 2025](https://pubmed.ncbi.nlm.nih.gov/40816584/) — 丹参酮 IIA 作为标准对照的临床证据（PMID 40816584）
- [Procedural and Methodological Quality in Preclinical Stroke Research — A Cohort Analysis of the Rat MCAO Model Comparing Periods Before and After STAIR/ARRIVE. *Front Neurol* 2022;13:834003](https://pubmed.ncbi.nlm.nih.gov/35707032/) — 卒中临床前研究的质量规范（PMID 35707032）
- [The STRING database in 2023. *Nucleic Acids Res* 2023;51:D638-D646](https://pubmed.ncbi.nlm.nih.gov/36370105/) — 本轮 PPI 网络来源（PMID 36370105）
- [Comparative Toxicogenomics Database's 20th anniversary: update 2025. *Nucleic Acids Res* 2025;53:D1328-D1334](https://pubmed.ncbi.nlm.nih.gov/39385618/) — 本轮化合物-基因、基因-疾病数据来源（PMID 39385618）
- 数据直链（均已实测可访问，2026-08-07）：[CTD downloads](https://ctdbase.org/downloads/) · [STRING v12.0 downloads](https://string-db.org/cgi/download)

---

*本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索，已标注出处；判断部分是我们的观点，可以被反驳。*

```json
{
  "task_slug": "tcm-stroke-network-pharm-null-control",
  "question": "常规网络药理学 degree-hub 流程从中药活性成分选出的核心靶点，是否比靶点数量匹配的随机化合物集选出的靶点更能命中未参与流程的缺血性卒中疾病基因？",
  "falsifiable_prediction": "预测:中药成分臂的 holdout_auroc 相对随机化合物零分布的经验 p > 0.05(即无成分特异性,核心靶点主要由 PPI 度分布决定)。推翻条件:3 个种子中至少 2 个给出经验 p < 0.05 且 AUROC 相对零分布中位数的提升方向在 3 个种子中一致。",
  "dataset": "CTD 化合物-基因互作 https://ctdbase.org/reports/CTD_chem_gene_ixns.tsv.gz (42.7MB gz, 人类记录 1,327,615 行 / 11,095 化合物); CTD 人工审编基因-疾病 https://ctdbase.org/reports/CTD_curated_genes_diseases.tsv.gz (564KB gz, 卒中 MeSH D002545/D020521/D000083242/D020244/D002546 合计 131 唯一基因); STRING v12.0 人类物理互作 https://stringdb-downloads.org/download/protein.physical.links.v12.0/9606.protein.physical.links.v12.0.txt.gz (8.95MB) + https://stringdb-downloads.org/download/protein.info.v12.0/9606.protein.info.v12.0.txt.gz (2.0MB, ENSP→symbol)。全部免注册,已于 2026-08-07 实测 HTTP 200。",
  "arms": [
    {
      "name": "baseline-degree-hub",
      "is_baseline": true,
      "what": "标准网络药理学流程:取 20 个已在 CTD 有人类互作记录的中药活性成分(丹参酮类/黄芩素/黄芩苷/人参皂苷类/小檗碱/姜黄素/白藜芦醇/葛根素/丹酚酸类/黄芪甲苷/淫羊藿苷/梓醇/天麻素/羟基红花黄色素A/灯盏乙素/槲皮素/山奈酚/木犀草素/三七皂苷R1/芍药苷)的人类靶点并集,与 D_seed(卒中基因的 50%)取交集作为种子节点,在 STRING 子网中对全部候选基因按 degree 打分排序。"
    },
    {
      "name": "null-random-compounds",
      "is_baseline": false,
      "what": "零分布臂:从 CTD 的 11,095 个人类化合物中按靶点数量分层匹配抽取同等规模的随机化合物集(靶点数 >=20 的采样池 1,986 个,>=50 的 1,045 个),跑与 baseline 完全相同的流程,重复 1000 次,生成各指标的零分布。"
    },
    {
      "name": "proposed-null-corrected",
      "is_baseline": false,
      "what": "背景校正臂:用 null-random-compounds 生成的零分布,对每个候选基因的 degree 分数做经验校正(z-score 与 empirical p),按校正后分数重新排序,考察是否比原始 degree 排序更能命中 hold-out 卒中基因。"
    }
  ],
  "metrics": [
    {
      "name": "holdout_auroc",
      "higher_is_better": true,
      "what": "主指标。将全部候选基因按流程分数排序,以 D_hold(未参与流程的 50% 卒中基因)为正例、其余基因为负例计算 AUROC。对小正例集(约 65 个)比 precision@K 稳健。"
    },
    {
      "name": "precision_at_k",
      "higher_is_better": true,
      "what": "次指标。top-K 中命中 D_hold 的比例,K∈{10,20,50}。贴近实际用法但统计功效弱,报告时须注明。"
    },
    {
      "name": "topk_jaccard_vs_null",
      "higher_is_better": false,
      "what": "中药成分臂 top-K 靶点与 1000 次随机化合物臂 top-K 靶点的 Jaccard 相似度中位数。越高说明核心靶点越不特异、越模板化。"
    }
  ],
  "sweep": {
    "top_k": ["10", "20", "50"],
    "string_score_threshold": ["400", "700", "900"]
  },
  "seeds": [0, 1, 2],
  "budget_minutes": 45,
  "cpu_feasible": true,
  "out_of_scope": [
    "任何湿实验验证(MCAO / OGD-R / WB / qPCR / 免疫荧光)",
    "分子对接与结合自由能计算(受体结构准备在 CPU 上不稳定,且不是本轮的科学问题)",
    "TCMSP / HERB 的成分-靶点数据(无稳定下载接口,抓取工程量超预算);本轮只覆盖 CTD 中有人类实验记录的约 20 个单体成分,结论不能直接外推到 OB/DL 筛出的全成分列表",
    "CTD 的 inferred(推断)基因-疾病关联(压缩包 3.1GB,下载+扫描超出 60 分钟预算),仅用人工审编子集",
    "因果性结论:只能回答靶点排名是否超出随机基线,不能回答某靶点是否为中药真实作用靶点",
    "OB/DL 阈值敏感性分析(第 3 节②建议的分析,本轮数据源不含 OB/DL 字段)"
  ]
}
```