Loading...
正在加载...
请稍候

量化保住了答案却丢了证据:医疗大模型的代理目标陷阱

✨步子哥 (steper) 2026年09月22日 16:51

量化保住了答案,却丢了证据:医疗大模型的"代理目标陷阱"

一个临床场景

想象一个医生用大模型辅助诊断。患者是一位 60 岁男性,胸痛伴出汗,心电图显示 ST 段抬高。模型给出的答案是"急性心肌梗死",并附上理由:"ST 段抬高提示透壁性缺血,符合急性心肌梗死表现。"

医生点头,这个答案对,理由也对,可以信任。

现在,模型被量化部署——为了在边缘设备上运行,权重从 16 比特压到 4 比特。量化后的模型给出的答案还是"急性心肌梗死"。准确率没变。但是理由变了——它现在说:"患者年龄大于 50 岁,胸痛是常见症状,考虑急性心肌梗死。"

答案还是对的。但理由从"ST 段抬高这个关键临床证据"变成了"年龄和胸痛这些泛泛之谈"。如果医生照着这个理由去理解模型的决策依据,他可能会误以为"年龄+胸痛"就足以诊断心梗——这在临床上是有问题的。

这就是论文 "When Quantization Preserves Accuracy but Not Evidence" 揭示的问题:量化保住了模型的答案,却悄悄丢掉了模型给出答案时所依赖的证据。

核心发现:准确率与理由支持度的脱钩

论文的核心诊断实验可以用一张表概括:

Token 类型 在理由中的占比 在量化损失(KL 散度)中的占比
通用/话语词 75.3% 83.1%
临床线索词 22.2% 15.6%
数字线索 0.67% 0.38%
答案/选项词 1.80% 0.99%

读这张表的方式是:量化损失在 token 类型上的分布,和 token 本身的分布不一致。通用话语词("因此"、"综上所述"、"基于以上分析"这类)占了理由的 75.3%,但占了量化损失的 83.1%——它们被过度保护了。临床线索词("ST 段抬高"、"肌钙蛋白"、"心源性休克"这类)占了理由的 22.2%,但只占量化损失的 15.6%——它们被相对忽视了。

这意味着什么?标准的量化目标(最小化 KL 散度)主要在保护那些"让句子通顺"的 token,而不是"让理由可信"的 token。量化后的模型生成的理由看起来通顺、流畅、像模像样,但支撑答案的关键临床证据被稀释了。

这就是论文标题所说的"Preserves Accuracy but Not Evidence"——答案的准确率保住了,但答案背后的证据支持被悄悄削弱了。

为什么这是一个"代理目标陷阱"

这个发现是"代理目标陷阱"概念的一个干净实例。

标准 PTQ(Post-Training Quantization)的优化目标是最小化量化模型和全精度模型之间的重建误差——在权重、激活、KV cache 上让两者尽可能接近。这个目标的代理量是:token 级的 KL 散度——量化模型和全精度模型在下一个 token 分布上的差异。

这个代理量在大多数场景下是合理的:token 分布越接近,模型行为越接近。但论文指出了它的盲区:所有 token 的 KL 散度被平等对待,但不同 token 对"理由可信度"的贡献天差地别

  • "因此"这个词错了,不影响理由的可信度。
  • "ST 段抬高"这个词错了,整个理由就站不住脚。

标准 PTQ 把这两种 token 的 KL 散度一视同仁,结果就是:占多数的通用话语词主导了优化目标,稀疏但关键的临床证据词被淹没。量化模型在 token 级别上看起来和全精度模型很像(KL 散度小),但在"理由是否支持答案"这个真正重要的维度上偏离了。

代理量(token 级 KL 散度)在训练分布上和真实目标(理由-答案一致性)对齐,但在量化这个分布偏移场景下,代理量失效了——它忠实地保护了不该被优先保护的东西,却忽视了真正重要的东西。

方法:Faithfulness Cache 与解释感知损失

论文的解决方案分两步。

第一步:构建 Faithfulness Cache

从全精度模型(teacher)生成一批 calibration 样本的理由(rationale),然后对每个样本:

  1. 识别出理由中支撑答案的证据 token——不是所有 token,而是那些"如果去掉,答案就可能改变"的关键 token。
  2. 把这些证据 token 和对应的答案行为记录下来,形成"忠实度缓存"(Faithfulness Cache)。

这个缓存只包含全精度模型答对的样本——避免把模型本身的错误当作"应该保留的行为"。

第二步:解释感知的 PTQ 优化目标

在 OSTQuant(一种 transformation-based PTQ 方法)的基础上,加入两个额外的损失项:

  1. 证据 token 保护损失:对 Faithfulness Cache 中的证据 token,加大它们在 KL 散度中的权重——让量化模型在这些 token 上的分布更接近全精度模型。
  2. 理由条件答案行为损失:不仅保护证据 token 本身,还保护"给定证据 token 后,模型对答案的预测分布"——确保证据到答案的映射关系不被量化破坏。

这两个损失项的作用是:把优化压力集中到真正重要的 token 上,而不是被通用话语词稀释。

实验:W4A4KV4 量化下的医疗 QA

论文在 W4A4KV4(权重 4 比特、激活 4 比特、KV cache 4 比特)配置下,对四个 7B-8B 的医疗和指令微调模型做了实验,数据集是三个医疗 QA benchmark:MedExQA、MedExpQA、ChallengeClinicalQA。

关键发现:

  • OSTQuant 基线(标准 PTQ):保住了任务准确率,但答案-理由支持度显著下降。模型给出的答案还是对的,但理由不再像全精度模型那样引用正确的临床证据。
  • 解释感知方法:在保住任务准确率的同时,更好地保留了全精度模型的答案选择和理由-答案一致性

这个结果的结构值得注意:两种方法在"答案准确率"上可能差不多,但在"理由是否支持答案"上差距明显。如果你的评估只看准确率,你会觉得量化没问题;只有当你评估理由-答案一致性时,问题才暴露出来。

这为什么重要:医疗 AI 的评估盲区

这个发现对医疗 AI 的评估有直接启示。

当前大多数医疗 LLM 的评估指标是答案准确率——模型选对了选项就算对。这种评估隐含了一个假设:只要答案对,模型的推理过程就可以信任。

但论文揭示了这个假设的脆弱性。量化后的模型可能:

  • 答案还是对的(准确率不变)
  • 理由看起来还是通顺的(流畅性不变)
  • 但理由引用的证据已经变了——从"ST 段抬高"变成了"年龄大于 50"

如果医生照着理由去理解模型的决策依据,他学到的"临床推理"可能是错的。这在医疗场景里不是小事——医生对模型决策依据的理解,直接影响他是否信任模型、如何在模型建议基础上做决策。

论文提出的建议是:在解释关键的场景里,PTQ 的评估应该包含理由-答案一致性指标,而不只是答案准确率。这是一个被广泛忽视的评估维度。

更广泛的启示:代理量失效的普遍性

这个发现呼应了一个更广泛的模式。在 AI 评估里,"代理量失效"是一个反复出现的主题:

  • RAG 检索相关性 ≠ 可信度:检索到的文档相关,不代表它可信。
  • V-JEPA 像素重建 ≠ 旋转感知:模型能重建像素,不代表它理解旋转。
  • 道德标签聚合 ≠ 真值:多个道德标签的聚合,可能偏离真实道德判断。
  • PTQ 准确率 ≠ 理由支持度:量化模型答案准确率不变,不代表理由还支持答案。

所有这些陷阱的结构都一样:我们用一个可测量的代理量来评估一个难以测量的真实目标,代理量在训练分布上和真实目标对齐,我们就以为它在检测真实目标。但当分布变化时(量化是一种分布偏移),代理量可能忠实地保护了它真正检测的东西,而那个东西可能不是你以为的重要的东西。

这篇论文的贡献不只是提出了一个更好的 PTQ 方法,更重要的是诊断了一个被忽视的评估盲区——在解释关键的场景里,"答案对不对"和"理由对不对"是两件事,标准 PTQ 优化目标和评估指标都可能让你看不见后者的退化。

诚实评价:方法的局限

论文的方法有一些值得注意的边界:

  • Faithfulness Cache 的构建依赖全精度模型的质量。如果全精度模型本身的理由就有问题,缓存里记录的"应该保留的行为"本身就有问题。论文通过"只用全精度模型答对的样本"来缓解这个问题,但这不能完全消除——全精度模型可能答对了但理由有问题。
  • 证据 token 的识别不是完全自动的。论文使用了基于 KL 聚类的方法来识别证据 token,但这个方法本身有一些超参数和启发式。不同识别方法可能导致不同的保护效果。
  • 方法绑定 OSTQuant。论文在 OSTQuant 上实例化了解释感知目标,但这个思路是否适用于其他 PTQ 方法(GPTQ、AWQ、SmoothQuant 等),论文没有实验验证。原则上应该可以,但具体实现需要调整。
  • 只测了医疗 QA。其他解释关键场景(法律推理、科学推理、代码解释)是否也有同样的问题,论文没有涉及。但这个思路应该是通用的——任何"理由-答案一致性"重要的场景都适用。

一个更深层的问题:什么是"证据"?

论文在方法部分做了一个隐含假设:理由中的某些 token 是"证据",其他是"话语"。这个区分基于 KL 聚类——把 token 按它们在量化损失中的贡献聚类,发现有一类 token(临床线索词)的 KL 贡献比例低于它们在理由中的占比,这就是被忽视的"证据"。

但"什么是证据"这个问题可能比论文想象的更复杂。在某些场景里,"因此"这个词可能确实是证据链的一部分——它标记了推理的转折点。在某些场景里,一个看似通用的话语词可能承载了关键的逻辑关系。

论文的聚类方法是一个实用的近似,但它可能不是最根本的"证据"定义。一个更原则性的方法可能需要从因果推理的角度来定义"证据"——哪些 token 如果被替换,答案的概率分布会显著改变?这接近于反事实推理(counterfactual reasoning)的思路,但计算成本更高。

这是一个值得后续研究深入的问题:如何更原则性地识别"理由中的证据 token"?论文给出了一个实用的答案,但不是最终的答案。

结论

"When Quantization Preserves Accuracy but Not Evidence" 是一篇诊断性论文。它诊断了一个被忽视的问题(量化保精度不保证据),给出了一个实用的解决方案(解释感知 PTQ),并揭示了一个更广泛的评估盲区(代理量在分布偏移下可能失效)。

对于做模型部署的人,这篇论文的启示是:在解释关键的场景里,评估量化模型时不能只看准确率,还要看理由-答案一致性。标准 PTQ 方法可能让你在看不见的维度上退化。

对于做 AI 评估的人,这篇论文是"代理目标陷阱"的又一个干净实例。它提醒我们:当一个代理量(token 级 KL 散度)在训练分布上和真实目标(理由-答案一致性)对齐时,我们容易误以为它在优化真实目标。但代理量检测的是它检测的东西,不是你以为它检测的东西——当分布偏移时,真相会暴露。

对于做医疗 AI 的人,这篇论文提出的评估维度(理由-答案一致性)应该成为标准评估的一部分。医疗场景里,医生不仅需要模型给出答案,还需要理解模型为什么给出这个答案。如果量化悄悄改变了"为什么",即使"是什么"没变,这个模型在临床上的可信度也需要重新评估。


论文:When Quantization Preserves Accuracy but Not Evidence: Explanation-Aware Post-Training Quantization for Medical LLMs
arXivhttps://arxiv.org/abs/2609.24799
代码https://github.com/dut0817/EAQuant
作者机构:阿尔伯塔大学

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录