判定:尚不确定
数据源与对照规模:拟运行 3 个对照臂,序列长度 128–1024、块大小 32/64/128、3 个随机种子;本页尚未执行实验
主要结论:方向本身成立,但宽命题与 CPU 预算、顶会目标不匹配;已冻结一个可在 CPU 上检验的算子级最小问题。
这些结果不支持:尚不支持任何实测加速、GPU 吞吐、端到端 LLM 质量或论文级创新主张。
代码 / 原始结果 / 日志:文献查新、范围说明和预注册计划齐全;代码、原始结果和运行日志尚不存在。
提交方向: Sparse Attention to accelerate large language model training and model inference 目标档位: 完整实验交付(数据、结果、代码、日志) · 投稿目标: AAAI / ICLR(备注,年份未定) 交付时间: 2026-08-16
“稀疏注意力能否加速 LLM”已经不是足够具体的研究问题;NSA、MoBA、DSA 等工作已经覆盖可训练稀疏注意力,并在 GPU 长上下文模型上报告训练和推理加速。只有 CPU、60 分钟时,不能复现这些大模型结论,也不能据此支撑 AAAI/ICLR 级别的模型贡献。
两条出路:其一,若坚持 AAAI/ICLR,需要补充具体稀疏机制、科学假设,并准备 GPU 上的长上下文模型和任务评测;其二,当前先完成一个 CPU 算子级可证伪实验,确定“真正跳过计算”相对“只加稀疏掩码”是否产生实测加速,以及这种加速付出多少输出偏差。
本轮选择第二条,但它是工程可行性诊断,不替提交人决定论文题目,也不能替代端到端 LLM 证据。
按 2025 年 2 月至 2026 年 8 月的公开结果,至少已有七条直接相关且可核验的代表路线:NSA、MoBA、SpargeAttn、XAttention、DeepSeek Sparse Attention(DSA)、SeerAttention-R 和 MISA;这只是代表工作数量,不是该方向论文总数。
其中:
因此,审稿人默认至少要看到:全注意力基线、只掩码但不跳过计算的控制臂、真正跳过块计算的实现,以及在同一 token/块预算下的质量—速度曲线。仅报告 FLOPs 减少,或者拿未经优化的稠密实现做对照,会被认为证据不足。
近 18 个月已经被直接覆盖的内容包括:
因此,当前输入不足以判断真正的“未覆盖研究空白”。“sparse attention; model training”只是范围,不包含可查重的机制或假设。正式选题前必须由提交人补齐:
本轮不把这些缺失项擅自补成新选题,只对提交方向中最基础、也最容易被错误论证的一点做诊断:稀疏掩码本身不等于加速,只有实际跳过计算后才可能降低时间和内存。
dense-blockmask-control。它与真正块稀疏臂使用完全相同的块对角因果掩码,但仍建立完整分数矩阵。若实验臂不能比它快,就不能声称稀疏带来了实测加速。matmul → mask → softmax → matmul 数学步骤。实验臂首先与同掩码控制臂检查输出、梯度数值等价,再单独报告它相对全注意力的偏差。在相同块对角因果稀疏语义下,真正只计算活跃块,是否比建立完整注意力矩阵后再加掩码更快、更省内存;随着稀疏率提高,它相对全注意力的输出偏差如何变化?
这不是新的论文题目,而是对原命题“稀疏注意力能加速训练和推理”的最小可执行检验。
| 实验臂 | 实现 | 作用 |
|---|---|---|
baseline-dense-causal | 建立完整 \(N\times N\) 因果注意力矩阵 | 平凡基线,代表不使用稀疏结构 |
control-dense-blockmask | 建立完整矩阵,再施加块对角因果掩码 | 零加速控制臂:隔离“掩码语义”与“跳过计算” |
proposed-block-sparse-exact | 将序列重排为连续块,只在各块内部执行因果注意力 | 真正跳过非活跃块;应与控制臂数值等价 |
“proposed”这里只表示实验臂,不表示这是提交人的新方法。
可被推翻的预测:当序列长度不低于 512、活跃注意力对密度不高于 25% 时,真正块稀疏臂的预填充和训练步中位延迟均至少比同掩码控制臂低 20%,同时两者输出及输入梯度相对误差低于 \(10^{-5}\);任一速度条件未达到,或数值误差超过阈值,都算预测被推翻。
不下载文本数据,以程序生成的 seeded Gaussian \(Q,K,V\) 张量做算子诊断:
块对角模式的活跃注意力对密度近似为 block_size / sequence_length。每个配置独立进程运行,避免峰值内存和缓存状态串扰。
| 指标 | 口径 | 为什么 | ||||
|---|---|---|---|---|---|---|
prefill_latency_ms | 预热3次后,10次纯前向的中位 wall-clock;每个种子保留一个中位数 | 检验推理预填充的实际延迟 | ||||
train_step_latency_ms | 前向、标量损失、反向及梯度清零完整耗时的中位数 | 检验注意力算子训练步,而不是只看前向 | ||||
speedup_vs_mask_control | 控制臂中位延迟 ÷ 块稀疏臂中位延迟 | 直接判断跳过计算是否有收益 | ||||
peak_rss_mb | 每个臂在独立子进程中的最大常驻内存 | 检查是否真的避免完整分数矩阵 | ||||
output_rel_l2_vs_mask_control | \(\ | O_s-O_m\ | _2/\max(\ | O_m\ | _2,10^{-12})\) | 验证同一稀疏语义的实现等价性 |
gradient_rel_l2_vs_mask_control | 对 Q、K、V 梯度分别计算相对 L2,报告最大值 | 防止只有前向等价、反向错误 | ||||
output_rel_l2_vs_dense | 块稀疏输出相对全注意力输出的相对 L2 | 显示速度所对应的近似代价 | ||||
active_pair_density | 实际计算的 query-key 对数 ÷ 完整因果对数 | 给出算法预算,避免只报名义稀疏率 |
sequence_length × block_size × arm,无效组合跳过。本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索,已标注出处;判断部分是我们的观点,可以被反驳。