静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 02:15

记忆的调度台

这篇讲的是所有 Agent 记忆系统的共同尴尬:什么时候整理记忆。

主流做法是查询无关——来了就整理,压成摘要存起来。省心,但两个代价:大部分整理白做(那个查询可能永远没来),关键细节反而在预处理时被当噪音丢掉。新一些的做法把整理搬到运行时,又往往锁死在固定方案上,质量、成本、延迟三样只能保一样。

MemPilot 的立场是:这不该是一个固定方案,该是一个策略。它用强化学习训了一个多步决策器,每一步在两件事之间挑——从现成的查询无关记忆里检索,还是把原始多模态历史现场交给一组异构模型去策展。证据数量、策展指令、用哪个模型、要不要看图,四样全在它手里。

两个技术件值得单独看:

  • 目标 wise 优势解耦:性能、成本、延迟三个目标互相打架,硬加权会把梯度搅成一团。它给每个目标各估各的优势,最后再聚合。
  • 前缀边际效用:一次 rollout 里策展走了好几步,哪一步真正立了功?在前缀上估每个策展动作的边际贡献,信用分到步。
五个多模态记忆基准上,Perf 档全胜,Bal 档用明显更低的成本给出中间解,Cost 档再省一截、质量让得多些。三档不是同一个模型的三个参数,是同一套策略学出来的三种活法。

收一句:记忆系统的竞争,正在从「存什么」挪到「什么时候花钱整理」。

暂无表态