随附材料 · 边界与数据来源

DeepGraph 第一轮交付 · 知识图谱预测骨关节炎候选基因

提交方向: 用知识图谱预测骨关节炎(OA)的候选基因 目标档位: 把实验真跑完,交数据、代码、日志 · 投稿目标: 未填写(下文按"中文核心 / SCI 三四区"的审稿标准写;若你实际瞄准顶会,请告诉我们,第 2、3 节要换一套写法) 交付时间: 2026-08-11


0. 先说一个判断:这个方向 CPU 上完全做得动,但它现在最缺的不是新模型,是"结论稳不稳"的证据

命题和算力是匹配的——OA 候选基因排序本质是稀疏图上的传播/打分,45k 节点、225 万条边的公开图谱,在 2 核 CPU 上跑一次个性化 PageRank 只要 0.15 秒(我们已实测,见第 4 节)。不需要 GPU。

不匹配的是另一件事:这条线的论文已经很多,新做一个"我们的模型 AUC 比 TransE 高"很难过审。真正还开着的口子是稳健性——换个边权、换个负样本、换个截断,候选基因名单会不会换一半人。本轮我们只做这件事,不替你判断哪个基因有生物学意义,那是你的专业判断,不是我们的。


1. 领域现状:不是空白地带,是"方法多、可复现性少"


2. 还开着的缺口(按可行性排序)

缺口 A(推荐,本轮做):候选基因名单的设定敏感性,没人系统报过。 现有 OA 相关工作都只报一套超参下的最终名单。但知识图谱打分里有至少四个自由度——边权方案、负样本采样方式、随机游走重启率、Top-K 截断——每一个都会改名单。做成了就是一篇方法学/可重复性论文:结论是"名单在 X 范围内稳定 / 在 Y 处崩掉",对中文核心和 SCI 三四区是扎实的正经工作,而且审稿人很难说"缺乏创新性"——因为它报的是别人没报的东西。还开着,是因为这活儿不出漂亮的 AUC 数字,没人愿意做。

缺口 B:度偏置零模型对照,在 OA 上从没做过。 PNAS 那篇的结论是通用生物网络层面的。OA 这个具体疾病上,"只按基因在图里的连接数排序"能达到什么水平,没人报过。如果零模型就能拿到接近的 AUROC,那此前所有 OA 候选基因排序结果的解释力都要打折。这个结论不中听,但可发、且有引用价值。工作量极小,本轮顺带做掉(它就是我们的对照臂)。

缺口 C(不建议本轮碰):把 GWAS 效应量真正当边权融进去。 npj 那篇已经做了,你再做是跟随。而且要拿 OA GWAS 汇总统计、做 MR/共定位,超出 60 分钟和本轮范围。


3. 评审会打你的三个点(提前堵)

  1. "62 个正样本,你的结论有统计意义吗?"——这是最致命的一条,也是数据本身决定的。堵法:不用单次划分报点估计,一律用 62 折留一交叉验证 + 自助法置信区间,把区间宽度老实报出来。如果区间宽到跨越基线,就直说"当前样本量下区分不出",这比硬报一个 0.87 更过得去。
  2. "你怎么证明不是在预测'哪个基因被研究得多'?"——PNAS 2025 之后,这个质疑会越来越常见。堵法:强制加一个只用节点度的零模型对照臂,并额外报度匹配负样本下的 AUPRC(即负样本和正样本的度分布对齐),把"popularity"这条捷径掐掉。
  3. "你的名单跟已有工作重合吗?为什么不比 CausalPathKG?"——堵法:诚实说明你用的是 Hetionet(公开、可复现),对方用的是 DRKG+GWAS 的 OKG,两个图谱不同,直接比 AUC 不公平;改为报名单重合度这一可复现的比较口径。审稿人接受"不同底座不硬比",不接受"装作不知道有这篇"。

4. 我们这一轮真去跑的实验

选的是缺口 A,并把缺口 B 当成对照臂。 理由:它是唯一一个 60 分钟 CPU 内能得出可站住结论、且结论无论正负都有信息量的设计。

可被推翻的预测 我们预测两件事,任一被数据推翻都算这个预测挂了:

主指标

指标口径为什么要它
auroc62 折留一,每折把 1 条已知 OA–基因边移出图,看它在全部约 2 万个基因中的排名通用可比,审稿人一定要看
auprc_degmatched同上,但负样本按节点度分层匹配采样掐掉"预测热门基因"这条捷径,堵第 3 节第 2 点
recall_at_kk ∈ {20, 50, 100, 200}实际用名单的人只看前几十个
mrr留一基因排名倒数的均值对头部敏感,补 AUROC 的钝感
jaccard_top50任意两套设定产出的 Top-50 名单的交并比,报中位数与分布本轮的核心产出,直接检验 P1
kendall_tau两套设定全排序的秩相关名单级之外再给一个连续版稳定性

要扫的自变量(全组合,共 36 套设定 / 折)

baseline 及其公平性:degree_null完全相同的折划分、相同的评测代码、相同的负样本,唯一区别是它给基因的打分就是该基因在图中的度,不使用 OA 节点的任何信息。它拿到的任何分数,都是"不需要知识图谱推理也能拿到的分数"。这是本轮最重要的一根标尺。

统计口径:随机成分(负样本采样、自助重采样、并列名次打散)跑 seed ∈ {0,1,2},报均值 ± 标准差;所有臂在同一算力预算下对齐(每套设定的传播迭代次数固定 30 次)。负结果照报——若 P1/P2 被推翻,我们原样写进报告,不换指标凑结论。

算力已实测,不是估算:Hetionet 边表 12.4 MB(gzip),加载建稀疏矩阵 2.1 秒;单次 30 轮 PPR 0.15 秒。62 折 × 36 设定 ≈ 2232 次传播 ≈ 6 分钟,连同 I/O、DWPC 矩阵乘、三种子后处理与作图,总预算 45 分钟内有充分余量。

这一轮做不到的部分,明确列出来


5. 参考来源


本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索,已标注出处;判断部分是我们的观点,可以被反驳。第 4 节的算力数字为本机实测,非估算。

← 回到案例正文