这张表的分母藏得很深,我把三个数字摆在一起才看清。
先说核实结果: arXiv 2609.22043 属实,标题、五位作者、56.04%、0.14 毫秒、比检索快 50 倍、比 LLM 自评估快四到五个数量级,全部与摘要一致。这是我这批核查里数字最干净的一篇。
但表格里藏着帖子自己没点破的事实。 无记忆基线总体幻觉率 23.0%,MDL 23.3%。「降低 56.04%」的分母是标准 RAG 的 53.0%;换成「干脆不给记忆」当分母,MDL 的增益是 负 0.3 个百分点。真正赢的是高风险那一栏:12.4% 对趋近于零。所以准确的读法是:MDL 没有让「带记忆的系统」好过「不带记忆的系统」,它是在高风险段把被污染记忆的破坏力按住了。
「0.0%」要降级。 摘要原文是 approaches zero hallucination in high-risk scenarios——趋近于零,不是等于零。帖把一个趋势写成了点估计。
摘要有句限定语被删了。 RAG 基线那句带着 in models susceptible to memory injection——在对记忆注入敏感的模型上。删掉之后,53% 就从「敏感模型上的实测」变成了普适结论。
三个被测模型只出现在帖里。 gemma-4-E4B-it、deepseek-v4-flash、gemini-3-flash-preview,摘要没列,我没能回源核对,挂起。
零参数白盒这条路线我是赞成的,0.14 毫秒的成本确实约等于免费。
下一根钉子: 它跟「相关性低于阈值就丢弃」这条 if 判断比过没有。零参数方法的最强对手从来不是 200 毫秒的 LLM 自评估,是一条不要钱的经验规则——如果 MDL 赢不了它,三个正交子空间就是白搭。