一句话结果:预注册的两个假设,一个被推翻、一个反向成立——我们照实报。大 batch 离线推理下 INT4-AWQ 几乎没有吞吐收益;量化的质量损失不在人们通常担心的数学推理上,而集中在指令跟随/输出格式保真上。
设置:Qwen2.5-7B-Instruct(FP16)vs Qwen2.5-7B-Instruct-AWQ(INT4);GSM8K test 与 SQuAD v1.1 dev 各随机抽 200 题(固定种子,两配置同一子集);greedy 解码、同 prompt、同 max_tokens;vLLM 0.11,离线批量推理。统计:逐题配对 delta,bootstrap 10,000 次 95% CI。
| GSM8K(数学推理,精确匹配) | SQuAD(抽取问答,F1) | |
|---|---|---|
| FP16 | 0.895 | 0.742 |
| INT4-AWQ | 0.885 | 0.652 |
| 质量 delta(AWQ−FP16) | −0.010,CI95 [−0.050, +0.030] 不显著 | −0.091,CI95 [−0.128, −0.055] 显著 |
| 吞吐 speedup | 1.05×(4802 → 5049 tok/s) | 1.01× |
交互效应(deltaGSM8K − deltaSQuAD)= +0.081,CI95 [+0.026, +0.136]:任务依赖性成立,但方向与 H2 预测相反——受损的不是数学,是抽取。
逐题查看 AWQ 掉分最狠的样本后,降幅的大头不是"找不到答案",而是指令跟随退化:AWQ 版频繁无视"只输出片段"的约束,把包含正确答案的完整句子吐出来,被 F1 机械性惩罚。输出中位长度:FP16 4 词 → AWQ 6.5 词。
第一轮留下三个未答的问题:掉的分能不能靠提示词救回来?"损伤在格式不在内容"是真的吗?吞吐收益的拐点到底在哪?第二轮各测了一遍,同一批 200 道 SQuAD 题、四个提示条件、两个模型、逐题配对。结论是一半支持、一半推翻第一轮的解读。
| 并发(同时请求数) | 1 | 4 | 16 | 64 | 256 |
|---|---|---|---|---|---|
| INT4-AWQ 相对 FP16 的加速 | 2.11× | 1.97× | 1.84× | 1.29× | 0.91× |
单调下降,并在 64 与 256 之间跌破 1.0——并发足够高时,量化模型比全精度更慢。这解释了第一轮为什么测不到加速:它跑在 batch=200,正落在收益消失的区域。第一轮里"收益只在 memory-bound 小 batch"这句是从文献借来的,现在它是这组数据自己说的。
| 提示条件 | FP16 F1 | INT4-AWQ F1 | 差距(AWQ−FP16) |
|---|---|---|---|
| 基线提示 | 0.689 | 0.578 | −0.111,CI95 [−0.149, −0.076] 显著 |
| 严格提示 | 0.884 | 0.853 | −0.031,CI95 [−0.055, −0.007] 显著 |
| 2-shot 示例 | 0.873 | 0.880 | +0.006,CI95 [−0.011, +0.025] 不显著 |
| 2-shot + 长度上限 | 0.874 | 0.880 | +0.006,CI95 [−0.013, +0.026] 不显著 |
两个示例就把量化带来的质量差距完全抹平。也就是说:第一轮看到的"量化掉 9 分",大部分是提示词不够好暴露出来的,不是量化本身抹掉了能力。这一条削弱了"必须靠切换推理配置来保住质量"的说法——先把提示写好更便宜。
我们把三件事分开测:F1、内容正确率(标准答案是否出现在输出里,不惩罚啰嗦)、格式合规率(输出是否为上下文的短片段)。基线条件下,格式合规掉 15 个点、F1 掉 11 个点,而内容正确率只掉 3 个点(0.975 → 0.945)——小,但统计上显著。
所以第一轮"降幅的大头是指令跟随退化"成立,但当时暗示的"内容没有损失"不成立,这句话我们收窄:主要是格式,同时存在小而真实的内容损失。
复现:任意带 A100(或同级)的机器,pip install vllm==0.11.0 transformers==4.56.2,依次运行文件头注释里的三条命令。逐题结果不删不挑,负结果照实报——这是本引擎的设计行为,不是姿态。
A preregistered pilot on one A100: Qwen2.5-7B-Instruct FP16 vs INT4-AWQ, 200 items each from GSM8K and SQuAD v1.1, greedy decoding, per-item paired deltas with 10k-resample bootstrap CIs. Both hypotheses surprised us, and we report as-is: (1) weight-only INT4 gave no meaningful throughput gain at batch-200 offline inference (1.01–1.05×) — its benefit lives in memory-bound small-batch decoding; (2) quality damage was task-dependent but in the opposite direction from our prediction — math reasoning was statistically unharmed (−1pt, n.s.) while extraction dropped 9 F1 points (significant), and per-item inspection shows the drop is mostly instruction-following degradation (the quantized model ignores "output the span only" and answers in full sentences). For agent pipelines that parse model output, format fidelity loss is more dangerous than accuracy loss. All code, per-item raw outputs and stats are published above.
你也有想验证的方向?一句话提交,免费层直接跑:证据地图、查新 idea、实验方案、初步信号。
提交你的研究方向 →