{
 "task_slug": "seahorse-ad-network-pharmacology-null-control",
 "question": "中药海马(Hippocampus spp.)小分子成分集在标准 TCM 网络药理学流水线下得到的 AD 核心靶点与通路富集,是否显著强于规模与靶点度数匹配的随机化合物集?即已发表的核心模块(APP/JUN/PPARγ)是海马特异信号还是数据库偏倚产物?",
 "falsifiable_prediction": "预测:1000 个 size+degree 匹配的随机化合物集中,top-10 PPI 度中心性 hub 命中 {APP,JUN,PPARG} 任一的比例 >= 50%,KEGG hsa05010 达 FDR<0.05 的比例 >= 80%,海马集经验 p > 0.05(不特异)。推翻条件:随机集 hub 命中比例 < 20% 且 AD 通路显著比例 < 20%,同时海马集 emp_p_ad_kegg < 0.05 与 emp_p_ad_overlap < 0.05 —— 则该流水线有判别力,已发表核心模块为真信号。",
 "dataset": "全部程序化下载,无需登录:(1) 化合物-基因互作 = CTD https://ctdbase.org/reports/CTD_chem_gene_ixns.tsv.gz (42MB gz, 实测 6s),按第 8 列 OrganismID==9606 过滤得 1,327,615 行 / 11,095 化合物 / 28,632 基因;(2) PPI = STRING v12 https://stringdb-downloads.org/download/protein.links.v12.0/9606.protein.links.v12.0.txt.gz (83MB, 实测 7s) + https://stringdb-downloads.org/download/protein.info.v12.0/9606.protein.info.v12.0.txt.gz 做 ENSP->gene symbol 映射;score>=700 时 473,860 边,>=900 时 201,712 边;(3) 基因集 = Enrichr GMT 纯文本 https://maayanlab.cloud/Enrichr/geneSetLibrary?mode=text&libraryName=<LIB>,LIB 取 KEGG_2021_Human(320 term, 'Alzheimer disease' 含 369 基因)、GO_Biological_Process_2025、DisGeNET、GWAS_Catalog_2025;(4) 海马成分集 = 输入参数,以 CTD ChemicalName 精确匹配,初始清单(括号内为实测 CTD 人类基因数,总计去重后数百个靶点):Taurine(79) Glycine(14) Cholesterol(109) 'Docosahexaenoic Acids'(83) 'Eicosapentaenoic Acid'(51) 'Palmitic Acid'(868) 'Oleic Acid'(278) 'Arachidonic Acid'(171) Hypoxanthine(7) Inositol(6) Sorbitol(22) Adenosine(68) Uridine(11) 'Glutamic Acid'(10) 'Aspartic Acid'(1) Lysine(2) Arginine(10) Alanine(1) Betaine(8) Creatine(5);Proline 在 CTD 无人类记录,须在日志中标注剔除。脚本必须逐条打印该清单与命中数,并支持外部 CSV 覆盖。",
 "arms": [
  {
   "name": "baseline-standard-pipeline",
   "is_baseline": true,
   "what": "文献默认流水线,不加任何对照:海马成分集 -> CTD 取靶点 -> 与 AD 基因集取交集 -> STRING(阈值内)建子网 -> degree 排序取 top-10 hub -> 对 KEGG_2021_Human + GO_BP_2025 做超几何检验 + BH FDR。输出 hub 列表与 FDR 表,即目前论文里会写进结果的那部分"
  },
  {
   "name": "null-size-matched",
   "is_baseline": false,
   "what": "弱空模型:从 CTD 11,095 个人类化合物中随机抽同样个数(20 个)的化合物集,跑完全相同的流水线 1000 次,得到 hub 与富集统计量的空分布"
  },
  {
   "name": "null-degree-matched",
   "is_baseline": false,
   "what": "强空模型(主对照):按每个海马成分的 CTD 靶点度数分箱(log2 分箱)抽取同分箱内的随机化合物,保证随机集的化合物个数与靶点度数分布都与海马集匹配,跑 1000 次。由此计算 emp_p_ad_overlap / emp_p_ad_kegg / hub_recovery_rate / hub_jaccard_null"
  },
  {
   "name": "disease-swap-control",
   "is_baseline": false,
   "what": "疾病特异性对照:固定海马靶点集,把 AD 基因集换成 5 个不相关疾病(Type 2 Diabetes / Hypertension / Colorectal Carcinoma / Asthma / Osteoarthritis,取自 DisGeNET 与 KEGG),比较富集强度并给出 AD 的排名 disease_rank_ad"
  }
 ],
 "metrics": [
  {
   "name": "hub_recovery_rate",
   "higher_is_better": false,
   "what": "null-degree-matched 的 1000 个随机集中,top-10 度中心性 hub 命中 {APP,JUN,PPARG,AKT1,TNF,IL6,TP53} 任一的比例;分别再报每个基因的单独命中率。越高说明核心靶点越是数据库假象"
  },
  {
   "name": "hub_jaccard_null",
   "higher_is_better": false,
   "what": "随机抽 200 对互不相关的空集,其 top-10 hub 列表 Jaccard 相似度的中位数与四分位数。>0.5 说明流水线几乎不区分药材"
  },
  {
   "name": "emp_p_ad_overlap",
   "higher_is_better": false,
   "what": "|海马靶点 ∩ AD 基因集| 在 null-degree-matched 空分布中的右尾经验 p = (#{null >= obs}+1)/(N+1)"
  },
  {
   "name": "emp_p_ad_kegg",
   "higher_is_better": false,
   "what": "海马集在 KEGG hsa05010 'Alzheimer disease' 上的 -log10(超几何 p) 在空分布中的右尾经验 p"
  },
  {
   "name": "disease_rank_ad",
   "higher_is_better": false,
   "what": "disease-swap-control 中 AD 在 6 个疾病上按 -log10(p) 排名,1 = AD 最强。排名靠后说明 AD 结论不特异"
  },
  {
   "name": "n_targets_seahorse",
   "higher_is_better": true,
   "what": "海马成分集在 CTD 中映射到的去重人类基因总数(记录用,不作优劣判断)"
  }
 ],
 "sweep": {
  "string_confidence_cutoff": [
   "400",
   "700",
   "900"
  ],
  "ad_geneset_source": [
   "KEGG_2021_Human:Alzheimer disease",
   "DisGeNET:Alzheimer's Disease",
   "GWAS_Catalog_2025:Alzheimer"
  ]
 },
 "seeds": [
  0,
  1,
  2
 ],
 "budget_minutes": 45,
 "cpu_feasible": true,
 "out_of_scope": [
  "分子对接(AutoDock Vina)与分子动力学模拟 —— 无 GPU 且超时间预算",
  "海马的蛋白/肽类活性成分靶点 —— CTD/STRING 仅覆盖小分子与蛋白编码基因,库里没有记录;本轮结论仅对小分子成分成立,该覆盖缺口须作为交付结论之一明确写出",
  "任何药效学判断(不下'海马对 AD 有效/无效'的结论)—— 无细胞、无动物数据",
  "湿实验、质谱肽组学、动物行为学",
  "成分清单的正确性 —— 它是输入参数不是本轮发现,须逐条打印并支持用户用自己的 UPLC-MS/MS 成分表替换重跑"
 ],
 "env_notes": {
  "python": "必须用 /usr/bin/python3 (3.12.3);PATH 上默认的 python3 是 linuxbrew 3.14,缺 scipy/sklearn/matplotlib,直接用会失败",
  "preinstalled_in_usr_bin_python3": [
   "numpy 2.4.6",
   "scipy 1.18.0",
   "scikit-learn 1.9.0",
   "matplotlib 3.11.0",
   "requests 2.31.0"
  ],
  "must_pip_install": "pip install --break-system-packages pandas networkx (PEP 668 环境,不加 --break-system-packages 会被拒;已实测可成功装到 python3.12)",
  "hardware": "2 核可用 / 30GB 内存 / 无 GPU;STRING 建议先用 awk 按 combined_score 过滤再进 pandas,避免全量 1200 万边入内存",
  "language": "按 Python 实现",
  "cached_downloads": "本轮探测已缓存 /tmp/ctd.tsv.gz、/tmp/string.gz、/tmp/kegg.gmt、/tmp/dis.gmt、/tmp/gwas.gmt,可直接复用以节省下载时间"
 },
 "deliverables": [
  "可重跑脚本",
  "各臂原始结果 CSV",
  "空分布直方图 + 观测值标注图",
  "完整运行日志",
  "数据快照版本号(CTD 报表日期 2026-07-30 / STRING v12.0 / Enrichr 库名)"
 ]
}