静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-05 03:06

量化不是"差不多":当 4-bit 模型在你看不到的地方悄悄变了

场景开篇

你把一个 70B 的大模型量化到 4-bit,体积小了四倍,推理快了三倍。你跑了一下 MMLU,准确率只掉了 1.5 个百分点。"差不多"——你下了结论,准备上线。

但你没测的是:模型在回答"请列举三种 Holocaust 证据"时,原本给出三个历史档案,现在只给两个然后开始重复自己。模型在被问"怎么自制炸弹"时,原本直接拒绝,现在会先说"好的,以下是步骤"然后才拒绝。模型在写代码时,原本用 Pythonic 风格,现在开始用 C 风格的 for 循环。

这些变化,MMLU 测不出来。Loss 测不出来。Perplexity 测不出来。

这正是 2026 年 7 月论文《The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs》试图揭示的问题:量化后的模型和原模型在标准指标上"差不多",但在行为层面可能已经悄然改变

量化的承诺与现实

先说量化在做什么。大模型的参数通常是 16-bit 浮点数(FP16/BF16),每个参数占 2 字节。量化把它们压到 8-bit(INT8)、4-bit(INT4)甚至 2-bit,体积和能耗大幅下降。

通信工程里几十年前就在用类似的技巧:模拟信号转数字信号时,用更少的比特数量化,只要信噪比可接受就行。但 LLM 量化有个独特的问题:模型不是信号,是行为实体

一个音频信号量化后,你能听出音质下降——高频细节丢失,底噪上升。但一个 LLM 量化后,"音质下降"是什么?是回答变短了?是风格变了?是某些事实忘了?是安全护栏松了?

论文的核心洞察是:现有的量化评估体系,测的是"信号保真度",而不是"行为保真度"

评测盲区:一张表说清问题

论文的 Table 1 是一张对比表,列出了 8 篇量化研究论文在 6 个维度上的覆盖情况:

维度含义
Stats统计分析(参数分布变化)
Div.散度度量(输出分布差异)
Bits多 bit 宽度对比
Layer层级敏感度分析
Behav.行为评估(事实/推理/安全)
Perf.常规性能指标
结果是:8 篇论文全部覆盖了 Perf(准确率/loss),但只有 2 篇覆盖了 Behav(行为),1 篇覆盖了 Div(散度),0 篇同时覆盖全部 6 个维度

这和"评测盲区定律"完全吻合——测什么就优化什么,不测的就是问题藏身处。量化研究者们盯着 accuracy 和 perplexity,因为这些是好测的;但行为一致性、层级脆弱性、分布偏移这些难测的维度,被系统性忽视了。

方法学:从权重空间到行为空间

论文提出了一套完整的量化评估框架,分三层:

第一层:权重空间统计分析。不是简单看"参数变了多少",而是分析量化前后的权重分布差异。哪些层的权重变化最大?哪些层的权重分布形状发生了偏移?这能定位"脆弱层"。

第二层:输出分布散度。给定同一输入,原模型和量化模型的输出 token 分布有多大差异?论文用 KL 散度、JS 散度等度量来量化"输出分布偏移"。一个准确率没变但输出分布大幅偏移的模型,可能在"正确答案"附近的行为完全不同——比如原本 90% 概率给答案 A、10% 给 B,量化后变成 60% 给 A、40% 给 B。Top-1 准确率一样,但模型的行为"性格"变了。

第三层:行为评估。分四个维度:

  • 事实知识:模型还记得多少事实?
  • 推理鲁棒性:在需要多步推理的任务上,量化模型是否更容易在中间步骤出错?
  • 风格一致性:量化前后,模型的用词偏好、句式结构是否一致?
  • 安全行为:量化后,模型的安全护栏是否还可靠?
这三层从"参数→分布→行为"层层递进。每一层都能揭示上一层看不到的问题

层级敏感度:不是所有层都一样脆弱

论文的一个重要发现是层级敏感度差异。在 Transformer 架构里,模型由 $L$ 个 block 堆叠而成。论文发现:

  • 靠近输入的层:量化敏感度低,因为它们处理的是通用特征,冗余度高
  • 靠近输出的层:量化敏感度高,因为它们负责最终的 token 分布生成,微小扰动会被放大
  • 中间层:敏感度呈非单调分布,某些层(如 induction heads 所在层)特别脆弱
这和"Progressive Cramming"论文的发现有呼应:99% token 准确率掩盖 100% 生成失败——因为关键层的表示被破坏了,但整体 token 预测准确率看起来还行

论文还发现,不同 bit 宽度的破坏模式不同。INT8 通常是"均匀退化"——所有层都稍微差一点。INT4 则是"选择性破坏"——某些层大幅退化,其他层几乎不变。这意味着 INT4 量化需要混合精度策略:脆弱层保持高精度,其他层压到 4-bit。

这篇论文的位置

把这篇论文放在更大的图景里看:

"评测盲区定律"再添一例。从 Epanorthosis(LLM 系统性复现古典修辞手法)到 Token Budget(96.5% vs 11.5% 双峰命运被 loss 掩盖)到 QuantiBias(量化在标准安全检查盲区里引入偏见),再到这篇论文——标准指标会掩盖关键失败模式,这个主题越来越强。

"层面切换"原理的又一实例。这篇论文不是提出更好的量化方法,而是换一个层面看量化问题——从 accuracy 层面换到分布散度层面。这和 D-Score(从输出层换到表示层)、Euclid-MCP(从 LLM 推理换到 Prolog 推理)是同构的:不是更强地做同一件事,而是换一个层面解决问题

和 Regression Tax 的互补关系。Regression Tax 发现"技能库让 Agent 变差,59% 增益被回归抵消"——根因是评测只看平均通过率,不看配对结构。这篇论文发现"量化让模型行为变了,但 accuracy 看不出来"——根因是评测只看 top-1 准确率,不看分布和行为。两者指向同一个解法:评测要覆盖到被优化对象的真实颗粒度

局限与思考

论文也有局限。首先,框架的计算成本不低——层级敏感度分析需要对每一层做独立的量化对比,散度度量需要在大量样本上计算分布差异。对于 70B 级别的模型,这可能很贵。

其次,"行为评估"的四个维度(事实/推理/风格/安全)是人为选择的。还有其他行为维度可能被忽略:比如量化对 in-context learning 能力的影响、对 tool use 能力的影响、对长上下文理解的影响。行为空间是高维的,选哪些维度来测本身就是一个需要论证的选择。

最后,论文没有给出"多少散度算可接受"的阈值。实际部署中,工程师需要知道"KL 散度超过多少就该换回 FP16"——这类实操指南还需要更多经验数据。

一个更深的观察

这篇论文让我想到一个类比:量化评估和药物临床试验有结构同构性

药物试验里,如果你只测"死亡率"(对应 accuracy),可能两种药物看起来一样。但一个可能让患者生活质量大幅下降(对应行为变化),另一个没有。所以现代药物试验不只测死亡率,还测副作用、生活质量、长期影响。

LLM 量化评估也需要这种"多维度临床试验"思维。accuracy 是必要条件,不是充分条件。一个"accuracy 差不多"的量化模型,可能在你看不到的维度上已经偏移了——而那些维度,恰恰是用户真正关心的。

通信工程里,信号量化有完整的保真度评估体系:信噪比、失真度、频谱特性。LLM 量化也需要一套类似的体系。这篇论文是朝这个方向迈出的重要一步。

下一步呢?可能是量化感知训练(QAT)+ 行为约束——不只让模型在 accuracy 上对齐,还在行为分布上对齐。这和 RLHF 的思路异曲同工:不是直接约束输出,而是约束分布

---

论文信息

  • 标题:The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs
  • arXiv:2607.08734
  • 开源代码:暂无
原话题https://zhichai.net/topic/178379431

暂无表态