M★:自进化的记忆Harness——每个任务都值得拥有自己的记忆架构
大型语言模型(LLM)驱动的智能体在执行长期任务时,需要依赖记忆系统来累积和复用知识。然而,当前主流做法往往采用一刀切的固定记忆设计,例如针对对话场景优化的语义检索(向量数据库),或针对编码任务的技能库等【1†source】。这种“万能记忆”范式在不同任务间往往水土不服:为某一目的优化的记忆系统很难直接迁移到其他领域…
文本版 · 供搜索与朗读
M★:自进化的记忆Harness
M★:自进化的记忆Harness——每个任务都值得拥有自己的记忆架构
目录
一、 背景与动机:为何通用记忆难觅?
二、 M★方法:让AI自己进化出记忆代码
三、 实验结果:任务定制记忆的威力
四、 意义与启示:通用记忆是伪命题,让AI自己找答案
背景与动机:为何通用记忆难觅?
大型语言模型(LLM)驱动的智能体在执行长期任务时,需要依赖记忆系统来累积和复用知识。然而,当前主流做法往往采用一刀切的固定记忆设计,例如针对对话场景优化的语义检索(向量数据库),或针对编码任务的技能库等【1†source】。这种“万能记忆”范式在不同任务间往往水土不服:为某一目的优化的记忆系统很难直接迁移到其他领域【1†source】。
原因在于,不同任务对记忆的需求截然不同【1†source】。例如:
聊天对话:需要根据上下文语义检索历史信息,向量数据库的模糊匹配在此场景下游刃有余。
家务规划(如机器人执行家庭任务):需要精确追踪状态(例如“哪个房间的灯已经关了”),这时SQL等结构化查询的精确匹配远比模糊向量检索更有效。
医疗问答:需要从对话中提取结构化字段(症状、药物、剂量等)并进行精确比对,要求记忆系统具备结构化信息提取和字段匹配能力。
这些差异意味着,通用记忆架构难以同时满足所有需求。微软和香港城市大学的研究者在论文中明确指出:“一个记忆系统如果针对某一目的优化,往往无法胜任其他目的”【1†source】。这一发现从根本上质疑了寻找单一“万能”记忆架构的可行性。
M★方法:让AI自己进化出记忆代码
针对上述问题,论文提出了M★方法:通过可执行程序进化,自动发现针对特定任务优化的记忆架构(Memory Harness)【1†source】。其核心思想是不让人类设计记忆系统,而是让AI自己编写并优化记忆管理代码。
具体而言,M★将记忆系统建模为一个Python程序,该程序封装了记忆的数据模式(Schema)、存储逻辑(Logic)和代理工作流指令(Instructions)【1†source】。换句话说,记忆如何存取、如何组织、何时读写,都由这段代码决定。M★通过反思式代码进化(Reflective Code Evolution)来优化这段记忆程序:采用种群搜索策略,在训练任务上评估候选记忆程序,分析其失败案例,并让大模型充当“反思者”提出改进意见,从而迭代地修改代码、重新测试【1†source】。
经过多轮进化,每个任务都自动演化出了结构迥异的记忆程序【1†source】。例如:
ALFWorld(家务规划任务):演化出的记忆程序包含带缓存的SQL读写器,以精确跟踪环境状态。
LoCoMo(长对话任务):演化出向量检索与关系表相结合的混合记忆架构,兼具语义检索和结构化查询能力。
HealthBench(医疗问答任务):演化出结构化信息提取+字段匹配器,从对话中抽取关键实体和属性并按字段比对。
这些演化结果表明,M★能够根据任务需求定制记忆机制:不同领域演化出的记忆程序在架构和逻辑上各不相同,充分体现了任务定制化的必要性【1†source】。
实验结果:任务定制记忆的威力
论文在四个涵盖对话、规划、推理的基准上评估了M★,包括LoCoMo(长对话)、ALFWorld(家务规划)、HealthBench(医疗问答)和PRBench(专家推理)【1†source】。结果显示,M★在7/8种配置下超越了所有固定记忆基线,甚至包括那些由人类精心设计的记忆方案【1†source】。更重要的是,M★在进化过程中未使用任何特定领域的先验知识——它只是被要求“编写一个记忆管理程序”,然后通过反思和迭代自行找到了最优解【1†source】。
图1:M★与固定记忆基线在不同任务上的胜出配置数对比(总计8种配置)
这一结果有力地证明了任务定制记忆的优越性:针对不同任务专门演化出的记忆架构,显著优于任何通用记忆方案【1†source】。正如论文所言,M★的演化记忆程序在“每个领域都展现了结构上不同的处理机制”,这表明为特定任务专业化记忆机制可以探索更广阔的设计空间,并提供比通用范式更优的解决方案【1†source】。
意义与启示:通用记忆是伪命题,让AI自己找答案
M★的真正价值不在于某个具体系统,而在于它揭示的事实:通用记忆架构是一个伪命题。证据表明,不同任务的最优记忆方案各不相同,试图寻找一个“万能”记忆系统是徒劳的【1†source】。好消息是,我们并不需要人类逐一去设计这些方案——AI可以通过代码进化自动找到最适合的方案【1†source】。
这对所有构建LLM代理的人来说是一个提醒:与其纠结“用什么向量数据库”,不如先思考“我的任务到底需要什么样的记忆结构”。M★的方法为这一思考提供了自动化答案:让智能体根据任务需求自行演化出记忆架构,而非套用固定模板。这种任务驱动的自适应记忆范式,有望成为未来LLM记忆系统设计的新方向。