案例 · 用户提交方向,已匿名
核心问题:登革热四个血清型的保守表位有多少?把 ADE 相关的增强表位区域排除掉之后,跨血清型覆盖率被吃掉多少?
本轮判定:预注册的 H2 推翻条件触发(ADE 区造成的损失 ≤ 随机损失分布的 95 分位)
数据:UniProt 公开 REST 接口的四个血清型参考多蛋白(DENV-1 P27909 / DENV-2 P29990 / DENV-3 Q6YMS4 / DENV-4 Q2YHF0),匿名可直接访问
真跑了:穷举 9-mer 与 15-mer 四型逐字一致的保守表位 · 排除 ADE 区(prM 全链 + E 融合环,坐标取自注释与保守基序而非硬编码)· 1000 次随机区域零模型 · 纯 CPU

案例速览

判定:负结果(预注册的 H2 被推翻,而且是往有利方向翻)

数据源与对照规模:UniProt 四个血清型参考多蛋白;9-mer 与 15-mer 两档;1000 次同等总长度、同等片段数的随机区域零模型,纯 CPU

主要结论:四型逐字一致的 9-mer 保守表位共 152 个,排除 ADE 相关区域(占多蛋白 5.6%)后只损失 7 个、剩 145 个;排除同等大小的随机区域平均损失 33.8 个(95 分位 56),经验 p = 0.994——ADE 区里的保守表位反而比随机区域还稀疏,预注册的「最保守的恰恰是最危险的」被推翻。但第二条更要紧:这 152 个里 48.7% 在 NS5、23.7% 在 NS3,结构蛋白(C / prM / E)里只有 9 个、占 5.9%,prM 与 C 里一个都没有。避开 ADE 区之所以不用付代价,是因为保守表位本来就不在那里。

这些结果不支持:「四型参考株一致」不等于「全球流行株保守」——这是本轮最大的外推限制,任何进入设计的表位都必须先在流行株群体序列上重验。没有做 MHC 结合力预测,保守不等于能被递呈。ADE 区的定义只覆盖 prM 与 E 融合环,没有穷尽文献报道的全部增强表位。没有免疫原性、动物实验、mRNA 序列设计与密码子优化。蛋白分布那张表是描述性的,没有做富集的显著性检验。

代码 / 原始结果 / 日志:UniProt 取序列与链段注释脚本、保守表位 + ADE 排除 + 零模型全流程、四项敌意复核、results.json 与运行日志全部随附。复核过程中修掉了我们自己检查脚本里的一个计数 bug(break 位置写错,损失数恒等于 1),修复后与主实验一致。

DeepGraph 免费验证案例 · 登革热四型保守表位与 ADE 区域的关系

提交方向:基于登革热四型、从 ADE 入手设计 mRNA 通用疫苗(提交人选定选项 2) 交付时间:2026-08-27 这一轮真跑了:UniProt 四个血清型参考多蛋白(DENV-1~4),穷举 9-mer 与 15-mer 保守表位, 排除 ADE 相关区域后测覆盖率损失,外加 1000 次随机区域零模型。纯 CPU。


0. 结论(两条,第二条比第一条重要)

第一条:避开 ADE 区几乎不用付代价。 四型逐字一致的 9-mer 保守表位共 152 个(随机期望约 4e-29, 保守性是压倒性真实的)。排除 ADE 相关区域(prM 全链 + E 融合环,占多蛋白 5.6%)后 只损失 7 个(4.6%),剩下 145 个。 而排除同等大小的随机区域平均损失 33.8 个(95 分位 56)—— 也就是说,ADE 区里的保守表位反而比随机区域还稀疏(经验 p=0.994)。

我们原本预测「最保守的恰恰是最危险的」,这条预测被推翻了,而且是往对你有利的方向翻。

第二条:但这批保守表位几乎不在结构蛋白上。

所在蛋白保守 9-mer 数占比
RNA-directed RNA polymerase/Methyltransferase NS57448.7%
Serine protease NS33623.7%
Non-structural protein 4B1711.2%
Non-structural protein 1159.9%
Envelope protein E95.9%
Non-structural protein 4A10.7%

结构蛋白(C / prM / E)里只有 9 个,占 5.9%;prM 与 C 里一个都没有。(上面这张表是描述性分布,本轮没有对"保守表位是否富集于非结构蛋白"做显著性检验,所以这些计数不带 p 值。) 其余 94% 全在 NS5、NS3、NS4B、NS1 这些非结构蛋白上。

这一条直接改变第一条的含义:避开 ADE 区之所以不用付代价,是因为保守表位本来就不在那里。 换句话说——

这条路线因此有一个需要先想清楚的岔路:这支疫苗是走 T 细胞免疫为主, 还是必须解决 E 蛋白的跨型中和? 两条路的设计与验收标准完全不同。

1. 判定规则(跑之前写死,见 claims.json

15-mer 结果同向:共 15 个,排除 ADE 区损失 1 个(随机期望损失 3.6)。

主结果图
主结果图(本轮实验的关键对比)。原图见随附材料。

2. 我们怎么确认这不是实现问题

四项敌意复核(work/adversarial_check.py):

  1. 保守表位落在哪 —— 就是第 0 节第二条那张表,它把结论整个改写了。
  2. 换融合环 padding(0 / 12 / 24 残基) —— 损失恒为 7/152,结论不随参数变。
  3. 只用 4 条参考株够不够 —— 不够,见第 3 节第 1 条。
  4. exact-match 是否太严 —— k=8/9/10/12 分别得到 208/152/108/53 个,单调下降符合预期, 152 不是某个 k 的偶然峰值。

复核过程中还修掉了我们自己检查脚本里的一个计数 bug(break 位置写错,导致损失数恒等于 1), 修复后与主实验完全一致。这类 bug 会把结论改成"避开 ADE 几乎零损失",方向虽同但数量级错了。

3. 这些数支持什么

  1. 「四型参考株一致」≠「全球流行株保守」。 这是本轮最大的外推限制。真实流行株在同一位点存在多态, 逐字一致的 9-mer 在流行株群体里可能被打断。任何进入设计的表位,都必须先在流行株群体序列上重验。
  2. 没有做 MHC 结合力预测。 保守 ≠ 能被递呈。这批 9-mer 里有多少真能结合常见 HLA 等位基因,本轮没算。
  3. ADE 区的定义只覆盖了 prM 与 E 融合环。 文献里还有其他被报道的增强表位,本轮没有穷尽。
  4. 没有免疫原性、没有动物实验、没有 mRNA 序列设计与密码子优化。

4. 下一步:三个能直接推进设计的方向

  1. 把保守性从 4 条参考株扩到流行株群体。 拉 NCBI Virus 上四型的数千条完整基因组, 把「逐字一致」换成「群体保守度阈值」,看这 152 个还剩多少。这是任何表位进入设计前的必做一步。
  2. 给存活下来的表位算 HLA 结合谱。 覆盖你关心的目标人群等位基因,输出「保守 × 可递呈」的交集—— 这才是能直接写进 mRNA 构建的候选清单。
  3. 单独处理 E 蛋白的跨型中和问题。 既然保守表位不在 E 上,就要正面回答: 是接受以 T 细胞免疫为主,还是引入嵌合/共识序列 E 抗原。这一步决定整支疫苗的路线。

这三条属于付费轮。

5. 随附材料

work/fetch_seqs.py(UniProt 取序列与链段注释)、work/experiment.py(保守表位 + ADE 排除 + 零模型)、 work/adversarial_check.py(第 2 节四项)、claims.json(跑前预测)、 work/results.json(数字唯一回查源)、work/logs/run.log

数据来源为 UniProt 公开 REST 接口的四个血清型参考条目(DENV-1 P27909 / DENV-2 P29990 / DENV-3 Q6YMS4 / DENV-4 Q2YHF0),匿名可直接访问。本轮不需要提交人提供任何材料。

随附材料(点开即看,不用下载)

打包下载全部材料(.zip)
包里不含体积大的原始下载数据(取数脚本会自动重新下载)。
本案例源自一位研究者通过公开表单提交的方向,已隐去其姓名、单位与一切可定位信息。结论与代码可复查、可反驳。
← 全部案例 · JouleBeat · DeepGraph