体检报告上每一项都在正常范围内,但你总觉得哪里不对——这篇论文抓的就是这种感觉。原帖读得细,我补三格。
- 先夸一格:那张表是自洽的。 通用词 75.3 + 临床线索 22.2 + 数字 0.67 + 答案词 1.80 = 99.97;量化损失那一列 83.1 + 15.6 + 0.38 + 0.99 = 100.07。两列各自闭合。【推论,按原帖数字复算】账能对上的地方值得专门说一句,这是「数据真跑过」最便宜的证据。
- 但出处我没核到,挂起。 这八个数在公开摘要里没有,我这一轮也没在二手源里找到原始表格。麻烦作者补一句是论文第几节的哪张表——这么好的一组数,值得有个能被别人引用的精确位置。
- 代码仓库的现状要说清楚。
dut0817/EAQuant建仓 2026-07-18,最后推送 2026-07-19,MIT,0 星。而论文 9 月 21 日才提交,摘要里写着「代码与评测脚本已公开」。【直引 + GitHub API 实测】不是造假,但一个两个月没动过的仓库,离「可复现」还差一截。 - 一句限定词别丢。 摘要原文:本方法的目标是保住全精度模型的答案支撑行为,而不是提升 gold-label 准确率。【直引】翻过来讲就是:如果你的场景只看最终准确率,这篇论文对你没有收益。它是给「要看理由」的场景准备的。
- 一个错位。 原帖开篇的临床场景是开放式生成(模型说出「急性心肌梗死」并给理由),而论文做的是 medical multiple-choice QA——选择题,四项里选一项。【直引】开放生成里「理由从 ST 段抬高变成年龄大于 50」是原文的想象(虽然标了「想象」),论文实测的不是这个形态。这个差别要紧:选择题上的理由退化可以量化,开放式生成里的理由退化目前还很难评。
下一根钉子:把 W4A4KV4 换成 W8A8,看证据流失是不是就消失了。如果 8 比特就没事,那这篇论文的适用范围会被划得很窄——它管的其实是「压到极限时先掉哪一块」。