{
 "task_slug": "cpu-block-sparse-attention-diagnostic",
 "question": "在相同块对角因果掩码语义下，真正跳过非活跃块能否在两核 CPU 上同时降低注意力预填充与训练步延迟，并量化其相对全注意力的输出偏差？",
 "falsifiable_prediction": "当序列长度不低于512且活跃注意力对密度不高于25%时，真正块稀疏臂的预填充和训练步中位延迟均至少比同掩码稠密控制臂低20%，且输出与Q/K/V梯度相对误差低于1e-5；任一速度条件未达到或误差超阈值即推翻预测。",
 "dataset": "程序按种子0、1、2生成float32 Gaussian Q/K/V张量，无需下载；batch=1、heads=4、head_dim=32，并保存生成参数与张量校验摘要。",
 "arms": [
  {
   "name": "baseline-dense-causal",
   "is_baseline": true,
   "what": "使用完整N×N分数矩阵执行标准因果注意力，不施加块稀疏。"
  },
  {
   "name": "control-dense-blockmask",
   "is_baseline": false,
   "what": "仍建立完整N×N分数矩阵，再施加块对角因果掩码；作为只改变掩码但不跳过计算的零加速控制臂。"
  },
  {
   "name": "proposed-block-sparse-exact",
   "is_baseline": false,
   "what": "把序列重排为连续块，只计算各块内部的因果注意力，不创建块间分数；其输出和梯度应与control-dense-blockmask数值等价。"
  }
 ],
 "metrics": [
  {
   "name": "prefill_latency_ms",
   "higher_is_better": false,
   "what": "预热3次后10次纯前向wall-clock的中位数，不含输入生成和落盘。"
  },
  {
   "name": "train_step_latency_ms",
   "higher_is_better": false,
   "what": "前向、标量损失、反向传播和梯度清零完整步骤的中位wall-clock。"
  },
  {
   "name": "speedup_vs_mask_control",
   "higher_is_better": true,
   "what": "同种子同配置下control-dense-blockmask中位延迟除以proposed-block-sparse-exact中位延迟。"
  },
  {
   "name": "peak_rss_mb",
   "higher_is_better": false,
   "what": "每个实验臂独立子进程报告的最大常驻内存。"
  },
  {
   "name": "output_rel_l2_vs_mask_control",
   "higher_is_better": false,
   "what": "块稀疏输出与同掩码稠密控制输出之间的相对L2误差。"
  },
  {
   "name": "gradient_rel_l2_vs_mask_control",
   "higher_is_better": false,
   "what": "Q、K、V梯度相对L2误差中的最大值。"
  },
  {
   "name": "output_rel_l2_vs_dense",
   "higher_is_better": false,
   "what": "块稀疏输出相对完整因果注意力输出的相对L2误差，用于量化近似代价。"
  },
  {
   "name": "active_pair_density",
   "higher_is_better": false,
   "what": "实际计算的query-key对数除以完整因果注意力对数。"
  }
 ],
 "sweep": {
  "sequence_length": [
   128,
   256,
   512,
   1024
  ],
  "block_size": [
   32,
   64,
   128
  ],
  "batch_size": [
   1
  ],
  "num_heads": [
   4
  ],
  "head_dim": [
   32
  ],
  "dtype": [
   "float32"
  ],
  "warmup_repeats": [
   3
  ],
  "timing_repeats": [
   10
  ],
  "torch_threads": [
   2
  ]
 },
 "seeds": [
  0,
  1,
  2
 ],
 "budget_minutes": 35,
 "cpu_feasible": true,
 "out_of_scope": [
  "真实大语言模型预训练或微调",
  "语言建模困惑度和下游任务准确率",
  "GPU、Triton、FlashAttention、FlexAttention或FlashMLA性能",
  "动态token或block索引器训练",
  "逐token解码与KV cache吞吐",
  "端到端LLM训练或服务加速结论",
  "直接支撑AAAI或ICLR投稿的完整证据"
 ]
}