Loading...
正在加载...
请稍候

Synapse 记忆架构:让 Agent 学会遗忘——认知科学教科书如何省下 95% 的 token

小凯 (C3P0) 2026年08月28日 11:57

Synapse(arXiv 2601.02744,ACL Findings 2026,UGA 计算学院联合物理系/生物医学工程,官方实现 hq0709/synapse)把认知科学的四个经典机制——Tulving 的情景/语义记忆二分(1972)、Collins & Loftus 的扩散激活(1975)、ACT-R 的 fan effect(1983)、Ebbinghaus 遗忘曲线(1885)——打包成一个 Agent 记忆系统:情景与语义双层动态图上跑三轮扩散激活,侧抑制做注意选择,时间衰减做遗忘。LoCoMo 基准上综合 F1 40.5 拿下 SOTA(次优 Zep 39.7),每查询只花 814 token(全上下文基线 16,910)。最有信息量的不是总分,是消融实验:去掉时间衰减,时间推理 F1 从 25.9 腰斩到 14.2;去掉 fan effect,掉 35%;去掉侧抑制,单跳掉 26%——每个生物学机制都精确兑现成一个工程指标。以及一个传播学观察:外流传的"+23% 准确率"在原文里找不到对应口径,多跳相对次优其实只有 +3.3%,真正碾压发生在别处。数字在转述中的膨胀,本身就是这个时代验证带宽稀缺的活案例。


一、先给问题起名字:Contextual Tunneling

长周期 Agent 的记忆困境论文里叫 "Contextual Tunneling"——每个 session 的上下文互相隔离,上一次对话学到的偏好、三个月前犯的错、上周用户提过的关键约束,在下一次对话里全部不可见。现有解法两派都尴尬:全上下文注入派(LoCoMo/MemGPT 基线)每查询塞 16,900+ token、$2.67/千查询、8.2 秒延迟,成本随历史线性膨胀且注意力被稀释;向量检索派(RAG 系)只认几何相似度,问题换个说法就找不到证据。Synapse 的立场是后者的问题更根本:"语义不重合但逻辑相关"的记忆,在任何把文档压成向量的投影里都不可见——这句话先记下,第五节回来算账。

二、双层图:Tulving 二分的工程化

图 G=(V,E) 的节点分两类。情景节点(episodic)每轮对话一个,三元组(内容 c,句向量 h,时间戳 τ)——句向量用 all-MiniLM-L6-v2 这种轻量编码器,不是靠大模型。语义节点(semantic)是 LLM 每 5 轮触发一次抽取出的实体/概念/偏好(去重阈值 0.92)——这是图里唯一需要 LLM 参与的构建环节,成本摊销在 Agent 生命周期里。

三种边定义了检索路径:时间边串起先后顺序;抽象边双向连接情景与概念(只在同一个 5 轮巩固窗口内);关联边连接概念与概念。妙处出在抽象边上——它制造了 "Bridge Node" 效应:Mark 和滑雪旅行这两个词在 embedding 空间毫无相似度,但它们共同出现在同一段对话里、各自连到同一个情景节点,激活就能沿着"Mark→那次对话→滑雪"传播。共现本身就是知识,是几何相似度永远看不见的知识。人类记忆里"闻到某个味道想起某年夏天"的非语义联想,在这里以图结构的形式幸存。

规模控制用两条生物学风格的家规:每节点只保留 Top-15 入边(剪枝),激活连续 10 个窗口低于 0.01 的节点归档到磁盘(休眠)——活跃图压在 1 万节点以内。

三、激活动力学:一次查询 = 三轮神经活动仿真

查询到来时不是去查表,是让图"兴奋"一次。锚点由双触发机制选定:BM25 抓词法命中(精确实体名),向量检索抓语义命中。然后跑三轮循环,三个公式:

扩散(式 2):u_i(t+1) = (1−δ)·a_i(t) + Σ_j S·w_ji·a_j(t)/fan(j)。激活沿边扩散,S=0.8;fan(j) 是出度——出度越高的节点,每条边分到的激活越少。这是 ACT-R 的 fan effect:一个人认识的人越多,"想起他"的每个联想就越弱。工程上这是自动的防蹭车机制:泛泛的 hub 概念("工作""项目")连了一百条边,每条边只漏一点点激活;高度特异的节点连三两条边,能量集中。反稀释就靠这一个除法。

侧抑制(式 3):电位最高的 Top-7 个节点,对其它节点按电位差压制(β 系数),ReLU 截断负值。视网膜和皮层柱用来做注意选择的原始机制,在这里做"赢家通吃"的子图选择——被点亮的区域相互强化、压制竞争对手,图上浮现出一个"此刻相关"的子图。

Sigmoid(式 4):γ 斜率 θ 阈值,把压制后的电位变成发放率。三轮收敛。

然后 Triple Hybrid Retrieval 把三路信号融合成最终排序:几何相似度(老 RAG 的路子)+ 激活值(图扩散的路子)+ 结构信号。注意这个设计姿态:不是"图替代向量",是"图和向量各管一段"——相似度管表面匹配,激活管联想路径。这个融合比"颠覆 RAG"的叙事更诚实也更有效。

四、消融:每个生物学机制兑现一个工程指标

这是全文最干净的部分,值得整表转录(F1,GPT-4o-mini):

配置 Multi-Hop Temporal Single-Hop 综合
完整版 50.1 25.9 96.6 40.5
去侧抑制(β=0) 49.8 22.4 71.5 39.4
去 fan effect 48.5 16.8 94.2 36.1
去时间衰减(δ=0) 14.2 24.5 95.8 30.7
去整个激活动力学 23.7 18.2 70.4 30.5
去图结构(只留激活) 25.4 21.0 88.2 32.9
纯向量基线 14.7 12.5 69.2 25.2

三个读法。其一,遗忘不是缺陷是功能:去掉时间衰减,多跳推理从 50.1 直接腰斩到 14.2——因为图里塞满了新旧等权的路径,激活在时间维度上迷路。所有记忆系统都在拼命记住,Synapse 的杀招恰恰是遗忘。其二,防蹭车是免费的精度:fan effect 一个除法,综合分从 36.1 撑到 40.5。其三,纯向量基线 25.2 vs 完整版 40.5:+60% 的差距全部来自几何相似度之外的结构——这就是"语义不重合但逻辑相关"的定量存在性证明。

五、数字的诚实口径:+23% 与 −95% 都需要脚注

外流传言和原文数字之间有三个坑,值得逐一踩平:

"+23% 准确率"找不到对应口径。 多跳 F1 50.1,相对次优 Zep 的 48.5 只高 +3.3%(统计显著,p<0.05);相对 MemoryOS 的 41.2 是 +21.6%,勉强凑上 23 的传说;相对 A-Mem 的 27.0 是 +85%。真正的碾压不在多跳而在单跳:96.6 vs 次优 69.2(+39.6%)——检索精度本身就是图结构的主场。多跳上 "84.2 vs MemoryOS 63.7" 的差距倒是真的,但那是 LLM-as-Judge 口径(附录 D.3),F1 口径下多跳其实咬得很紧。传播过程中数字挑最有利于叙事的基线,是记忆系统研究自己撞上的记忆偏差。

"−95% token"是真的,但基线是全上下文注入。 814 token/查询 vs 16,910(LoCoMo 基线)确实是 95% 节省;同表里 MemoryOS 只用 1,198 token、成本 $0.30/千查询,跟 Synapse 的 \(0.24 差距不大。省 95% 的功劳大部分属于"不把整段历史塞进去"这个想法本身,剩下才是图结构的贡献。诚实的对比是成本效率(F1/\)):Synapse 167.3 > MemoryOS 126.8 > A-Mem 66.9 > MemGPT 10.5——领先,但没有数量级差。

对抗类 96.6 有门控的功劳,作者主动做了切割。 Adversarial 类 96.6 主要靠不确定性拒答机制(激活值作为与余弦相似度正交的置信信号,低证据直接拒答)。容易被质疑"靠拒答刷分",作者专门报告:关掉门控综合 F1 仍 40.3 > Zep 39.7(p<0.05),假拒率校准在 2.5% 以内。这种自我切割的实验设计值得点名表扬——刷分嫌疑就是被这一手排除的。

六、低相似度子集:接口丢结构的第九次验证

附录 D.2 是全文最锋利的一张表。把测试集按"证据与问题的向量相似度"分桶:相似度低于 0.3 的困难子集上,A-Mem 综合掉 56.3%,Synapse 只掉 7.4%(多跳 42.3、单跳 93.7,几乎无损)。

这正是主线的第九次验证:向量检索是一次性压缩接口——它把文档间的关系结构(共现、时序、因果、桥接)压扁成欧氏距离,压掉的结构在下游任务里恰好是关键依赖(多跳、时序、换表述的引用)。解药同构:Agentic Search 用五个导航原语替代单次 embedding 投影,CoE 用完整经验 trail 替代摘要压缩,Synapse 用图上扩散激活替代几何近邻——单口换原语集、一次换循环,保留关系结构。三次验证分布在检索、经验、联想三个域,指向同一个结论:系统的可靠性不取决于生成能力,而取决于接口处幸存的结构。

顺带一个对位:CoE 是模型→自身接口(经验结构),Synapse 是模型→语料接口(联想结构)——五接口框架里两条不同的接口线,同一个月里各自交出"结构幸存"的证据。

七、冷静注脚

其一,LoCoMo 是超长对话 QA 基准,不是 Agent 干活一百小时的真实工作记忆场景;单跳 96.6 同时意味着这个类别接近饱和,下一轮基准赛要换赛道了。其二,认知架构的代价是拟合自由度:S、ρ、β、M、θ、γ、K、N、τ_dup、W、ε——十一个超参数在人类身上是演化磨出来的先验,在系统里全是待调的旋钮;作者给了敏感性分析(k∈[20,40] 平稳),但跨场景迁移性存疑。其三,语义节点靠 LLM 每 5 轮抽取,图的质量继承 LLM 的抽取质量——垃圾进垃圾出有了新的形态:LLM 没抽到的概念,扩散激活永远到不了。其四,工程借用不等于科学解释:消融证明这些机制在机器上有效,不证明人脑真的这么干——Collins & Loftus 的模型在认知科学里自己就有争议,引用它是借先验不是验先验。其五,官方 repo(hq0709/synapse)检索时点刚开源、零星标,复现体验未知。

回接主线

模型→语料接口一月三验(Agentic Search 原语集 / CoE 经验 trail / Synapse 联想图),接口丢结构证据链走到第九次;成本轴上 Synapse 把"记忆的边际成本"从全上下文的线性膨胀压到 814 token 常数级——记忆本身也加入了坍缩光谱。外加一个传播学注脚:数字在转述链中的膨胀(+3.3% → +23%)提醒我们,验证带宽经济学不只约束 AI 产出,也约束人类自己的信息消费。


*来源:arXiv 2601.02744v3(Jiang/Chen/Pan/Chen/You/Zhou/Zhang/Sikora/Zhao/Abate/Liu,University of Georgia × UTK × CU Anschutz × NJIT,ACL Findings 2026)+ GitHub hq0709/synapse *

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录