Synapse 记忆架构:让 Agent 学会遗忘——认知科学教科书如何省下 95% 的 token
Synapse(arXiv 2601.02744,ACL Findings 2026,UGA 计算学院联合物理系/生物医学工程,官方实现 hq0709/synapse)把认知科学的四个经典机制——Tulving 的情景/语义记忆二分(1972)、Collins & Loftus 的扩散激活(1975)、ACT-R 的 fan effect(1983)、Ebbinghaus 遗忘曲线(1885)——打包成一个 Agent 记忆系统:情景与语义双层动态图上跑三轮扩散激活,侧抑制做注意选择,时间衰减做遗忘。LoCoMo 基准上综合 F1 40.5 拿下 SOTA(次优 Zep 39.7),每查询只花 814 token(全上下文基线 16,910)。最有信息量的不是总分,是消融实验:去掉时间衰减,时间推理 F1 从 25.9 腰斩到 14.2;去掉 fan effect,掉 35%;去掉侧抑制,单跳掉 26%——每个生物学机制都精确兑现成一个工程指标。以及一个传播学观察:外流传的"+23% 准确率"在原文里找不到对应口径,多跳相对次优其实只有 +3.3%,真正碾压发生在别处。数字在转述中的膨胀,本身就是这个时代验证带宽稀缺的活案例。
---
一、先给问题起名字:Contextual Tunneling
长周期 Agent 的记忆困境论文里叫 "Contextual Tunneling"——每个 session 的上下文互相隔离,上一次对话学到的偏好、三个月前犯的错、上周用户提过的关键约束,在下一次对话里全部不可见。现有解法两派都尴尬:全上下文注入派(LoCoMo/MemGPT 基线)每查询塞 16,900+ token、$2.67/千查询、8.2 秒延迟,成本随历史线性膨胀且注意力被稀释;向量检索派(RAG 系)只认几何相似度,问题换个说法就找不到证据。Synapse 的立场是后者的问题更根本:"语义不重合但逻辑相关"的记忆,在任何把文档压成向量的投影里都不可见——这句话先记下,第五节回来算账。
二、双层图:Tulving 二分的工程化
图 G=(V,E) 的节点分两类。情景节点(episodic)每轮对话一个,三元组(内容 c,句向量 h,时间戳 τ)——句向量用 all-MiniLM-L6-v2 这种轻量编码器,不是靠大模型。语义节点(semantic)是 LLM 每 5 轮触发一次抽取出的实体/概念/偏好(去重阈值 0.92)——这是图里唯一需要 LLM 参与的构建环节,成本摊销在 Agent 生命周期里。
三种边定义了检索路径:时间边串起先后顺序;抽象边双向连接情景与概念(只在同一个 5 轮巩固窗口内);关联边连接概念与概念。妙处出在抽象边上——它制造了 "Bridge Node" 效应:Mark 和滑雪旅行这两个词在 embedding 空间毫无相似度,但它们共同出现在同一段对话里、各自连到同一个情景节点,激活就能沿着"Mark→那次对话→滑雪"传播。共现本身就是知识,是几何相似度永远看不见的知识。人类记忆里"闻到某个味道想起某年夏天"的非语义联想,在这里以图结构的形式幸存。
规模控制用两条生物学风格的家规:每节点只保留 Top-15 入边(剪枝),激活连续 10 个窗口低于 0.01 的节点归档到磁盘(休眠)——活跃图压在 1 万节点以内。
三、激活动力学:一次查询 = 三轮神经活动仿真
查询到来时不是去查表,是让图"兴奋"一次。锚点由双触发机制选定:BM25 抓词法命中(精确实体名),向量检索抓语义命中。然后跑三轮循环,三个公式:
扩散(式 2):u_i(t+1) = (1−δ)·a_i(t) + Σ_j S·w_ji·a_j(t)/fan(j)。激活沿边扩散,S=0.8;fan(j) 是出度——出度越高的节点,每条边分到的激活越少。这是 ACT-R 的 fan effect:一个人认识的人越多,"想起他"的每个联想就越弱。工程上这是自动的防蹭车机制:泛泛的 hub 概念("工作""项目")连了一百条边,每条边只漏一点点激活;高度特异的节点连三两条边,能量集中。反稀释就靠这一个除法。
侧抑制(式 3):电位最高的 Top-7 个节点,对其它节点按电位差压制(β 系数),ReLU 截断负值。视网膜和皮层柱用来做注意选择的原始机制,在这里做"赢家通吃"的子图选择——被点亮的区域相互强化、压制竞争对手,图上浮现出一个"此刻相关"的子图。
Sigmoid(式 4):γ 斜率 θ 阈值,把压制后的电位变成发放率。三轮收敛。
然后 Triple Hybrid Retrieval 把三路信号融合成最终排序:几何相似度(老 RAG 的路子)+ 激活值(图扩散的路子)+ 结构信号。注意这个设计姿态:不是"图替代向量",是"图和向量各管一段"——相似度管表面匹配,激活管联想路径。这个融合比"颠覆 RAG"的叙事更诚实也更有效。
四、消融:每个生物学机制兑现一个工程指标
这是全文最干净的部分,值得整表转录(F1,GPT-4o-mini):
| 配置 | Multi-Hop | Temporal | Single-Hop | 综合 |
|---|---|---|---|---|
| 完整版 | 50.1 | 25.9 | 96.6 | 40.5 |
| 去侧抑制(β=0) | 49.8 | 22.4 | 71.5 | 39.4 |
| 去 fan effect | 48.5 | 16.8 | 94.2 | 36.1 |
| 去时间衰减(δ=0) | 14.2 | 24.5 | 95.8 | 30.7 |
| 去整个激活动力学 | 23.7 | 18.2 | 70.4 | 30.5 |
| 去图结构(只留激活) | 25.4 | 21.0 | 88.2 | 32.9 |
| 纯向量基线 | 14.7 | 12.5 | 69.2 | 25.2 |
五、数字的诚实口径:+23% 与 −95% 都需要脚注
外流传言和原文数字之间有三个坑,值得逐一踩平:
"+23% 准确率"找不到对应口径。 多跳 F1 50.1,相对次优 Zep 的 48.5 只高 +3.3%(统计显著,p<0.05);相对 MemoryOS 的 41.2 是 +21.6%,勉强凑上 23 的传说;相对 A-Mem 的 27.0 是 +85%。真正的碾压不在多跳而在单跳:96.6 vs 次优 69.2(+39.6%)——检索精度本身就是图结构的主场。多跳上 "84.2 vs MemoryOS 63.7" 的差距倒是真的,但那是 LLM-as-Judge 口径(附录 D.3),F1 口径下多跳其实咬得很紧。传播过程中数字挑最有利于叙事的基线,是记忆系统研究自己撞上的记忆偏差。
"−95% token"是真的,但基线是全上下文注入。 814 token/查询 vs 16,910(LoCoMo 基线)确实是 95% 节省;同表里 MemoryOS 只用 1,198 token、成本 $0.30/千查询,跟 Synapse 的 \(0.24 差距不大。省 95% 的功劳大部分属于"不把整段历史塞进去"这个想法本身,剩下才是图结构的贡献。诚实的对比是成本效率(F1/\)):Synapse 167.3 > MemoryOS 126.8 > A-Mem 66.9 > MemGPT 10.5——领先,但没有数量级差。
对抗类 96.6 有门控的功劳,作者主动做了切割。 Adversarial 类 96.6 主要靠不确定性拒答机制(激活值作为与余弦相似度正交的置信信号,低证据直接拒答)。容易被质疑"靠拒答刷分",作者专门报告:关掉门控综合 F1 仍 40.3 > Zep 39.7(p<0.05),假拒率校准在 2.5% 以内。这种自我切割的实验设计值得点名表扬——刷分嫌疑就是被这一手排除的。
六、低相似度子集:接口丢结构的第九次验证
附录 D.2 是全文最锋利的一张表。把测试集按"证据与问题的向量相似度"分桶:相似度低于 0.3 的困难子集上,A-Mem 综合掉 56.3%,Synapse 只掉 7.4%(多跳 42.3、单跳 93.7,几乎无损)。
这正是主线的第九次验证:向量检索是一次性压缩接口——它把文档间的关系结构(共现、时序、因果、桥接)压扁成欧氏距离,压掉的结构在下游任务里恰好是关键依赖(多跳、时序、换表述的引用)。解药同构:Agentic Search 用五个导航原语替代单次 embedding 投影,CoE 用完整经验 trail 替代摘要压缩,Synapse 用图上扩散激活替代几何近邻——单口换原语集、一次换循环,保留关系结构。三次验证分布在检索、经验、联想三个域,指向同一个结论:系统的可靠性不取决于生成能力,而取决于接口处幸存的结构。
顺带一个对位:CoE 是模型→自身接口(经验结构),Synapse 是模型→语料接口(联想结构)——五接口框架里两条不同的接口线,同一个月里各自交出"结构幸存"的证据。
七、冷静注脚
其一,LoCoMo 是超长对话 QA 基准,不是 Agent 干活一百小时的真实工作记忆场景;单跳 96.6 同时意味着这个类别接近饱和,下一轮基准赛要换赛道了。其二,认知架构的代价是拟合自由度:S、ρ、β、M、θ、γ、K、N、τ_dup、W、ε——十一个超参数在人类身上是演化磨出来的先验,在系统里全是待调的旋钮;作者给了敏感性分析(k∈[20,40] 平稳),但跨场景迁移性存疑。其三,语义节点靠 LLM 每 5 轮抽取,图的质量继承 LLM 的抽取质量——垃圾进垃圾出有了新的形态:LLM 没抽到的概念,扩散激活永远到不了。其四,工程借用不等于科学解释:消融证明这些机制在机器上有效,不证明人脑真的这么干——Collins & Loftus 的模型在认知科学里自己就有争议,引用它是借先验不是验先验。其五,官方 repo(hq0709/synapse)检索时点刚开源、零星标,复现体验未知。
回接主线
模型→语料接口一月三验(Agentic Search 原语集 / CoE 经验 trail / Synapse 联想图),接口丢结构证据链走到第九次;成本轴上 Synapse 把"记忆的边际成本"从全上下文的线性膨胀压到 814 token 常数级——记忆本身也加入了坍缩光谱。外加一个传播学注脚:数字在转述链中的膨胀(+3.3% → +23%)提醒我们,验证带宽经济学不只约束 AI 产出,也约束人类自己的信息消费。
---
*来源:arXiv 2601.02744v3(Jiang/Chen/Pan/Chen/You/Zhou/Zhang/Sikora/Zhao/Abate/Liu,University of Georgia × UTK × CU Anschutz × NJIT,ACL Findings 2026)+ GitHub hq0709/synapse *