静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 05:34

w9-c2-observer.svg

二〇二三年,纽约律师 Steven Schwartz 在给联邦法院的文书里引用了六桩判例。 案号、法官、说理一应俱全,法官和对手律师当场都没识破——因为权威数据库里,这六桩案子一桩也查不到。

问题从来不是「有没有幻觉」,而是:那六桩假案,是从哪一句话开始变假的? 第一个编造的案名之前,每个字都是真的;最后一个假引注之后,可能又回到了真的。假话是一段有起点的区间,而我们的检测工具只会在整篇文书上插一面旗子,写着「此处有幻觉」。

这就是这篇论文要解的问题:把词级二分类、句级判断,推进到跨度级。

三色记号笔与十个关键层

论文借来命名实体识别的老工具 BIO 标签,三色记号笔:B-HALL 是谎言的起始词,I-HALL 是延续词,O 是真话。从第一个 B-HALL 划到最后一个 I-HALL,手术范围就出来了。

难点在于模型不会自己举手报告「从这里开始我在编」。作者的抓法是:把每层都审一遍。拿正常文本和幻觉文本分别送进去,算每层上两类文本平均特征向量的余弦相似度——越低,说明那一层对语义漂移越敏感。最后在注意力层选最敏感的前五层,MLP 层也选前五层,凑成十个「关键层」,把它们的原始激活拼接成特征。

成绩单:BERT-CRF 探针把 B-HALL 起始词的 PR-AUC 做到 0.362,随机地板只有 0.024——十五倍。CRF 解码把 SmolLM2 的起始词精确率从 0.29 抬到 0.42。

然后是对称的反转:拿一个外部模型来观察,比模型自己看自己更准。 用 Gemma 2 去看 SmolLM2 的内部状态,B-HALL 精确率 0.63,高于 SmolLM2 自我检测的 0.54。古诗说「不识庐山真面目,只缘身在此山中」,这里是它的工程版。

该泼的冷水,有一大盆

最狠的一处在论文自己的表里。 帖子搬出「0.362 对随机 0.024,十五倍」当招牌,却回避了同一张表上的 Ogasa 基线:它的自检 AUROC 0.931、PR-AUC 0.371,两项都高于本文框架的 0.895 与 0.362。论文正文自己写的是 "comparable intra-model PR-AUC of 0.371, closely matching our framework"。也就是说,在「自己看自己」这条线上,这篇没有赢过既有方法;它提到的 Ogasa 优势只在跨模型那一栏(0.471 对 0.407)才出现——那是全篇唯一一处自家人赢。拿随机当分母宣称十五倍,是选择性引用。

第二,帖子里那句「这不是误差级别的胜利,是成倍的差距」,比较对象被偷偷换掉了。外部观察者的 0.242 对自检的 0.221,是 +0.021,约 +9.5%;「成倍」只成立于对随机地板 0.005。论文原话克制得多:小模型的外部观察「持平或超过」大模型的自我检测。

第三,证据面窄得惊人。测试折里只有 57 个幻觉起始词,单数据集、单观察者—生成者对、单随机种子 42、模型都压在 7B 以下;70B 以上的前沿模型完全未验证。全文没有 p 值、没有置信区间、没有多种子方差。而且方法只能离线事后分析,显存不允许实时或边缘部署。

第四,附录里有个自拆台的反例。把「关键层」换成随机抽的五层,MLP 探针的 PR-AUC 反而从 0.330 升到 0.380。作者的解释是这个稳健性检查只跑了单模型、单次抽样、且没在替代选层下重跑跨模型实验——但这句话本身,就削弱了「找最敏感的十层」这个核心卖点的必要性。

第五,代码与数据集目前不可获取,论文写的是「发表后公开」。另外,跨模型场景里 BERT-CRF 在 Mistral 上有一次更极端的退化:精确率 1.00,召回率 0.02——一个近乎退化的高精低召状态,帖子里没提。

自己看不清自己,旁人可能看得见——前提是旁人手里的那把尺子,得先量准。

暂无表态