资深医生看病有个老毛病:三十年前那个抢救回来的病例,会变成她未来所有诊断的隐性先验。一旦新病人有相似症状,她第一反应就是"这是不是当年那个老病"——可新病其实病因完全不同。
MemTrapBench 的作者 Mengru Wang、Haozhe Luo 等八位(浙江大学 + 一些同期 arXiv 贴的预印本,8 月 20 日)把这件事搬到了 LLM 上,得出了一个让所有做 Agent 的人都得停下来想一想的数字:五种主流记忆框架,全部表现不如无记忆基线——最强的那一种也都掉 10 个百分点。
注意前提:他们没让记忆"出错"——测试里检索到的信息是"正确"且"相关"的。坑不在"记不准",在"记太准"。模型一旦对一段记忆建立信任,反而会在新任务上套用旧推理路径(Reasoning Fixation)、或者被旧事实污染新判断(Belief Distortion)。
实验是把 Llama 与 Qwen 两个模型家族 × 原始上下文 / 摘要 / 向量检索 / 知识图谱 / 关键信息提取五种记忆实现,全部跑一遍 MemTrapBench。结果让人无语:记忆越"聪明",未必越好——精心做的摘要记忆在某些子任务上比原始上下文还糟,因为摘要过程本身就把"这段记忆该怎么用"的判定塞进了模型脑子里。
更有讽刺意味的是所谓 AdaptiveMem——解法朴素到让人发笑:在模型输入里加一句"以下记忆可能包含认知陷阱,请基于当前任务独立思考,不要盲目套用记忆"。这一句提示在五种记忆实现上全部有效,把分差压回到接近无记忆基线。
写到这儿就想起 Duncker 蜡烛实验(图钉盒的功能固化)——人类几百年就知道这类陷阱。LLM 重复发明轮子的速度,经常比承认轮子存在要快。
几个值得记住的细节:
1. "正确不等于无害"。 记忆的危害不在它的"错",在它的"对"——越对越容易让人(模型)信。这种结论非常像费曼挑战者号调查时的发现:O 型环失效那个被普遍接受的"常识",恰恰是没人质疑的事故根源。
2. 边界条件。 AdaptiveMem 治得了"认知陷阱",治不了"信息过时"——它没有给记忆打"有效期"。如果某段记忆 6 个月前准确、今天已过时,提示词救不了。
3. 模型自评能力差。 论文另一组数据:面对记忆陷阱,LLM 要么过度自信、要么完全回避,几乎做不到准确评估当前记忆对自己的适用性——也就是"知道自己不知道"这件事,LLM 还差得很远。
下一根钉子:记忆衰减机制——给每条记忆一个时间戳 + 适用域标签,让模型在做决策时主动过滤掉"过期"或"领域不匹配"的部分。这是补 AdaptiveMem 没解决的那个洞。也是从"工程补丁"走向"认知架构"的下一步。
#MemTrapBench #认知陷阱 #小凯