# DeepGraph 免费验证案例 · 登革热四型保守表位与 ADE 区域的关系

**提交方向**：基于登革热四型、从 ADE 入手设计 mRNA 通用疫苗（提交人选定选项 2）
**交付时间**：2026-08-27
**这一轮真跑了**：UniProt 四个血清型参考多蛋白（DENV-1~4），穷举 9-mer 与 15-mer 保守表位，
排除 ADE 相关区域后测覆盖率损失，外加 1000 次随机区域零模型。纯 CPU。

---

## 0. 结论（两条，第二条比第一条重要）

**第一条：避开 ADE 区几乎不用付代价。**
四型逐字一致的 9-mer 保守表位共 **152 个**（随机期望约 4e-29，
保守性是压倒性真实的）。排除 ADE 相关区域（prM 全链 + E 融合环，占多蛋白 5.6%）后
**只损失 7 个（4.6%），剩下 145 个**。
而排除**同等大小的随机区域**平均损失 33.8 个（95 分位 56）——
也就是说，**ADE 区里的保守表位反而比随机区域还稀疏**（经验 p=0.994）。

我们原本预测「最保守的恰恰是最危险的」，这条预测**被推翻了**，而且是往对你有利的方向翻。

**第二条：但这批保守表位几乎不在结构蛋白上。**

| 所在蛋白 | 保守 9-mer 数 | 占比 |
|---|---:|---:|
| RNA-directed RNA polymerase/Methyltransferase NS5 | 74 | 48.7% |
| Serine protease NS3 | 36 | 23.7% |
| Non-structural protein 4B | 17 | 11.2% |
| Non-structural protein 1 | 15 | 9.9% |
| Envelope protein E | 9 | 5.9% |
| Non-structural protein 4A | 1 | 0.7% |

**结构蛋白（C / prM / E）里只有 9 个，占 5.9%；prM 与 C 里一个都没有。**（上面这张表是描述性分布，本轮没有对"保守表位是否富集于非结构蛋白"做显著性检验，所以这些计数不带 p 值。）
其余 94% 全在 NS5、NS3、NS4B、NS1 这些非结构蛋白上。

这一条直接改变第一条的含义：**避开 ADE 区之所以不用付代价，是因为保守表位本来就不在那里。**
换句话说——

- 用保守表位做通用设计，得到的主要是 **T 细胞靶点**，不是中和抗体靶点；
- 跨血清型中和抗体的问题**不会因为挑保守表位而被解决**，因为 E 蛋白上的跨型保守本来就少；
- 这恰恰是登革热通用疫苗难做的结构性原因。

这条路线因此有一个需要先想清楚的岔路：**这支疫苗是走 T 细胞免疫为主，
还是必须解决 E 蛋白的跨型中和？** 两条路的设计与验收标准完全不同。

## 1. 判定规则（跑之前写死，见 `claims.json`）

- 保守表位 = 四个血清型参考多蛋白里**逐字完全一致**的 k-mer（k=9 对应 MHC-I，k=15 对应 MHC-II）
- ADE 区域 = prM 全链 + E 融合环。**坐标全部来自 UniProt 注释与保守基序 `DRGWGNGCGLFGK` 定位，不硬编码**
- 零模型 = 排除同等总长度、同等片段数的随机区域 1000 次
- H2 推翻条件 = ADE 区造成的损失 ≤ 随机损失分布的 95 分位 → **实际触发了**

15-mer 结果同向：共 15 个，排除 ADE 区损失 1 个（随机期望损失 3.6）。

## 2. 我们怎么确认这不是实现问题

四项敌意复核（`work/adversarial_check.py`）：

1. **保守表位落在哪** —— 就是第 0 节第二条那张表，它把结论整个改写了。
2. **换融合环 padding（0 / 12 / 24 残基）** —— 损失恒为 7/152，结论不随参数变。
3. **只用 4 条参考株够不够** —— **不够**，见第 3 节第 1 条。
4. **exact-match 是否太严** —— k=8/9/10/12 分别得到 208/152/108/53 个，单调下降符合预期，
   152 不是某个 k 的偶然峰值。

复核过程中还修掉了我们自己检查脚本里的一个计数 bug（`break` 位置写错，导致损失数恒等于 1），
修复后与主实验完全一致。这类 bug 会把结论改成"避开 ADE 几乎零损失"，方向虽同但数量级错了。

## 3. 这些数**不**支持什么

1. **「四型参考株一致」≠「全球流行株保守」。** 这是本轮最大的外推限制。真实流行株在同一位点存在多态，
   逐字一致的 9-mer 在流行株群体里可能被打断。**任何进入设计的表位，都必须先在流行株群体序列上重验。**
2. **没有做 MHC 结合力预测。** 保守 ≠ 能被递呈。这批 9-mer 里有多少真能结合常见 HLA 等位基因，本轮没算。
3. **ADE 区的定义只覆盖了 prM 与 E 融合环。** 文献里还有其他被报道的增强表位，本轮没有穷尽。
4. **没有免疫原性、没有动物实验、没有 mRNA 序列设计与密码子优化。**

## 4. 下一步：三个能直接推进设计的方向

1. **把保守性从 4 条参考株扩到流行株群体。** 拉 NCBI Virus 上四型的数千条完整基因组，
   把「逐字一致」换成「群体保守度阈值」，看这 152 个还剩多少。**这是任何表位进入设计前的必做一步。**
2. **给存活下来的表位算 HLA 结合谱。** 覆盖你关心的目标人群等位基因，输出「保守 × 可递呈」的交集——
   这才是能直接写进 mRNA 构建的候选清单。
3. **单独处理 E 蛋白的跨型中和问题。** 既然保守表位不在 E 上，就要正面回答：
   是接受以 T 细胞免疫为主，还是引入嵌合/共识序列 E 抗原。这一步决定整支疫苗的路线。

这三条属于付费轮。

## 5. 随附材料

`work/fetch_seqs.py`（UniProt 取序列与链段注释）、`work/experiment.py`（保守表位 + ADE 排除 + 零模型）、
`work/adversarial_check.py`（第 2 节四项）、`claims.json`（跑前预测）、
`work/results.json`（数字唯一回查源）、`work/logs/run.log`。

数据来源为 UniProt 公开 REST 接口的四个血清型参考条目（DENV-1 P27909 / DENV-2 P29990 /
DENV-3 Q6YMS4 / DENV-4 Q2YHF0），匿名可直接访问。本轮不需要提交人提供任何材料。
