案例 · 用户提交方向,已匿名 · 尚未运行
核心问题:在相同块对角因果掩码语义下,真正跳过非活跃块能否在两核 CPU 上同时降低注意力预填充与训练步延迟,并量化其相对全注意力的输出偏差?
本轮做了什么:文献查新、可证伪问题、对照矩阵和执行边界
拟用数据:程序按种子0、1、2生成float32 Gaussian Q/K/V张量,无需下载;batch=1、heads=4、head_dim=32,并保存生成参数与张量校验摘要。
状态:本页不声称实验已跑;真正实验结果需另行执行并过真实性闸门

案例速览

判定:尚不确定

数据源与对照规模:拟运行 3 个对照臂,序列长度 128–1024、块大小 32/64/128、3 个随机种子;本页尚未执行实验

主要结论:方向本身成立,但宽命题与 CPU 预算、顶会目标不匹配;已冻结一个可在 CPU 上检验的算子级最小问题。

这些结果不支持:尚不支持任何实测加速、GPU 吞吐、端到端 LLM 质量或论文级创新主张。

代码 / 原始结果 / 日志:文献查新、范围说明和预注册计划齐全;代码、原始结果和运行日志尚不存在。

DeepGraph 第一轮交付 · 稀疏注意力训练与推理加速

提交方向: Sparse Attention to accelerate large language model training and model inference 目标档位: 完整实验交付(数据、结果、代码、日志) · 投稿目标: AAAI / ICLR(备注,年份未定) 交付时间: 2026-08-16


0. 先说一个判断:方向成立,但当前命题与 CPU 算力、AAAI/ICLR 目标不匹配

“稀疏注意力能否加速 LLM”已经不是足够具体的研究问题;NSA、MoBA、DSA 等工作已经覆盖可训练稀疏注意力,并在 GPU 长上下文模型上报告训练和推理加速。只有 CPU、60 分钟时,不能复现这些大模型结论,也不能据此支撑 AAAI/ICLR 级别的模型贡献。

两条出路:其一,若坚持 AAAI/ICLR,需要补充具体稀疏机制、科学假设,并准备 GPU 上的长上下文模型和任务评测;其二,当前先完成一个 CPU 算子级可证伪实验,确定“真正跳过计算”相对“只加稀疏掩码”是否产生实测加速,以及这种加速付出多少输出偏差。

本轮选择第二条,但它是工程可行性诊断,不替提交人决定论文题目,也不能替代端到端 LLM 证据。

1. 领域现状:高度拥挤,比较对象已经从“全注意力”扩展到“硬件对齐的动态稀疏注意力”

按 2025 年 2 月至 2026 年 8 月的公开结果,至少已有七条直接相关且可核验的代表路线:NSA、MoBA、SpargeAttn、XAttention、DeepSeek Sparse Attention(DSA)、SeerAttention-R 和 MISA;这只是代表工作数量,不是该方向论文总数。

其中:

因此,审稿人默认至少要看到:全注意力基线、只掩码但不跳过计算的控制臂、真正跳过块计算的实现,以及在同一 token/块预算下的质量—速度曲线。仅报告 FLOPs 减少,或者拿未经优化的稠密实现做对照,会被认为证据不足。

2. 查新去重与仍未覆盖的部分

近 18 个月已经被直接覆盖的内容包括:

因此,当前输入不足以判断真正的“未覆盖研究空白”。“sparse attention; model training”只是范围,不包含可查重的机制或假设。正式选题前必须由提交人补齐:

  1. 稀疏模式是固定窗口、块选择、token 选择,还是可学习索引器?
  2. 主目标是训练、预填充还是逐 token 解码?三者的瓶颈不同。
  3. “加速”具体指延迟、吞吐、峰值内存,还是总训练时间?
  4. 面向哪种模型、上下文长度、数据集和硬件?
  5. 可接受的困惑度或任务准确率损失是多少?
  6. 相对 NSA、MoBA、DSA、SeerAttention-R 或 MISA,拟议机制改变了什么?

本轮不把这些缺失项擅自补成新选题,只对提交方向中最基础、也最容易被错误论证的一点做诊断:稀疏掩码本身不等于加速,只有实际跳过计算后才可能降低时间和内存。

3. 评审会打你的三个点(提前堵)

  1. “你的稀疏实现只是把元素设为负无穷,仍然计算了完整 \(N\times N\) 矩阵。” 防法:加入 dense-blockmask-control。它与真正块稀疏臂使用完全相同的块对角因果掩码,但仍建立完整分数矩阵。若实验臂不能比它快,就不能声称稀疏带来了实测加速。
  1. “速度来自换了实现或牺牲语义,不是来自稀疏计算。” 防法:三个臂统一使用 PyTorch float32、相同线程数以及相同的 matmul → mask → softmax → matmul 数学步骤。实验臂首先与同掩码控制臂检查输出、梯度数值等价,再单独报告它相对全注意力的偏差。
  1. “CPU 微基准不能推出 LLM、GPU 或端到端训练会加速。” 防法:结论严格限定为两核 CPU 上的注意力算子结果;分别报告前向预填充和含反向传播的训练步延迟,不把算子 speedup 写成模型吞吐。若继续面向 AAAI/ICLR,后续仍需 GPU 内核、真实长上下文模型、任务质量和端到端 wall-clock 证据。

4. 我们这一轮真去跑的对照矩阵

要回答的问题

在相同块对角因果稀疏语义下,真正只计算活跃块,是否比建立完整注意力矩阵后再加掩码更快、更省内存;随着稀疏率提高,它相对全注意力的输出偏差如何变化?

这不是新的论文题目,而是对原命题“稀疏注意力能加速训练和推理”的最小可执行检验。

对照臂

实验臂实现作用
baseline-dense-causal建立完整 \(N\times N\) 因果注意力矩阵平凡基线,代表不使用稀疏结构
control-dense-blockmask建立完整矩阵,再施加块对角因果掩码零加速控制臂:隔离“掩码语义”与“跳过计算”
proposed-block-sparse-exact将序列重排为连续块,只在各块内部执行因果注意力真正跳过非活跃块;应与控制臂数值等价

“proposed”这里只表示实验臂,不表示这是提交人的新方法。

可被推翻的预测

可被推翻的预测:当序列长度不低于 512、活跃注意力对密度不高于 25% 时,真正块稀疏臂的预填充和训练步中位延迟均至少比同掩码控制臂低 20%,同时两者输出及输入梯度相对误差低于 \(10^{-5}\);任一速度条件未达到,或数值误差超过阈值,都算预测被推翻。

数据与张量设置

不下载文本数据,以程序生成的 seeded Gaussian \(Q,K,V\) 张量做算子诊断:

块对角模式的活跃注意力对密度近似为 block_size / sequence_length。每个配置独立进程运行,避免峰值内存和缓存状态串扰。

主指标

指标口径为什么
prefill_latency_ms预热3次后,10次纯前向的中位 wall-clock;每个种子保留一个中位数检验推理预填充的实际延迟
train_step_latency_ms前向、标量损失、反向及梯度清零完整耗时的中位数检验注意力算子训练步,而不是只看前向
speedup_vs_mask_control控制臂中位延迟 ÷ 块稀疏臂中位延迟直接判断跳过计算是否有收益
peak_rss_mb每个臂在独立子进程中的最大常驻内存检查是否真的避免完整分数矩阵
output_rel_l2_vs_mask_control\(\O_s-O_m\_2/\max(\O_m\_2,10^{-12})\)验证同一稀疏语义的实现等价性
gradient_rel_l2_vs_mask_control对 Q、K、V 梯度分别计算相对 L2,报告最大值防止只有前向等价、反向错误
output_rel_l2_vs_dense块稀疏输出相对全注意力输出的相对 L2显示速度所对应的近似代价
active_pair_density实际计算的 query-key 对数 ÷ 完整因果对数给出算法预算,避免只报名义稀疏率

扫描与统计口径

这一轮做不到的部分

5. 参考来源


本文档由 JouleBeat · DeepGraph 出具。文献结论来自公开检索,已标注出处;判断部分是我们的观点,可以被反驳。

随附材料

打包下载(.zip)
口径与边界。这一页交付的是经查新的问题定义和可执行对照计划;没有跑过的数字不写成结果。
本案例源自一位研究者通过公开表单提交的方向,已隐去其姓名、单位与一切可定位信息。本页仅交付查新与预注册计划,实验尚未运行;计划和来源可复查、可反驳。
← 全部案例 · JouleBeat · DeepGraph