推理也会过期:一只 AI Agent 的遗忘修行
论文:When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression
作者:Mingxuan Wang, Fei Luo, Bo Wang, Guorun Yao, Yinglong Guo, Chao Ning, Hongyue Chen, Yanbiao Ma, Jungong Han(TierFlow 团队 / 中国人民大学 / 清华大学)
arXiv: 2609.29875
🧠 开篇:一个研究员的深夜幻想
2026 年的某个深夜,你盯着屏幕上那只正在奋战的 AI Agent,突然冒出一个有点哲学的问题:
它刚才"想"过的那些事,现在还"记得"吗?
不是那种存在数据库里的记忆——而是它在做第 47 步任务时,脑子里闪过的那段推理:"嗯,根据刚才的报错信息,我怀疑是依赖版本冲突,先检查一下 requirements.txt……"这段内心独白,在它已经执行完命令、看到结果、推进到第 48 步之后,还重要吗?
如果重要,那它的上下文里正堆积着成千上万句这样的独白——每一段都曾经有用,每一段都在持续消耗 token、推高成本、稀释注意力。如果不重要,那你凭什么确定删掉它们之后,Agent 不会在 20 步之后突然"忘了初心",走回一条错误的岔路?也许你会说,那就全部保留好了。可当你的账单上写着"缓存读取 token 已超预算三倍",当你的 Agent 在第 60 步时开始把第 3 步的结论张冠李戴,你就明白"全保留"是一种昂贵的逃避,而不是答案。
这个看似琐碎的问题,正是长时程智能体(long-horizon agent)研究中最棘手的暗礁之一。而一篇来自 TierFlow 团队与人大、清华的新论文,给出了迄今为止最系统、也最违反直觉的回答之一。
答案是:推理会过期。但过期的时机,不取决于推理本身写了什么,而取决于推理里那点"真正要紧的东西"有没有被搬出去。
这句话值得放在手边。整篇论文的所有实验、所有理论、所有数字,都是它的注脚。
📚 背景:Agent 的"内心戏"膨胀危机
先让我们把问题讲清楚。现在的 AI Agent——无论是帮你写代码、做表格、跑安全测试还是浏览网页——本质上都在重复一个循环:推理(Reasoning)→ 行动(Action)→ 观察(Observation)→ 再推理。ReAct 范式诞生以来,这个循环就是智能体的基本心跳,Reflexion 给它加上 verbal reinforcement,生成式智能体用它模拟人类社会——万变不离其宗,都是"想—做—看—再想"。
问题在于:每一次心跳产生的"内心戏",都会被原封不动地带进下一次心跳。
想象一下你请了一位助手修一台复杂的机器。这位助手有个怪癖:他把自己说过的每一句话都用录音笔录下来,每做一步之前,都要把迄今为止的全部录音从头听一遍。第一步听 1 分钟,第十步听 10 分钟,第 100 步……他一半的时间都在听自己过去的废话。更要命的是,磁带堆里还藏着过期情报——第 3 步时他"推测"故障在电机,第 40 步已经证实是电路板问题,可那段错误的推测仍然躺在磁带里,随时可能干扰他此刻的判断。
这就是长时程 Agent 面临的记忆膨胀:早期决策早已执行完毕、结果早已观察完毕,但它们产出的推理文本仍然赖在上下文里不走。上下文越长,推理越贵,注意力越涣散——"Lost in the Middle"的诅咒在几十轮的累积下被放大到荒谬的程度。这甚至不只是成本和注意力的问题:过期的推理本身就是一种误导源,它让模型沉浸在"当时为什么这么做"的叙事里,而不是"现在面对什么"的现实里。
你可能会说:这还不简单?压缩啊!思维链压缩(CoT Compression)已经是一个热闹的研究方向了,TokenSkip、CONCISE、Step Entropy……各路方法都能在数学题上把推理砍短一半还不掉精度。既然解题的草稿都能删,Agent 的内心戏凭什么不能?
但论文作者敏锐地指出了一个本质区别:静态压缩和在线压缩,是两种完全不同的手术。
静态压缩面对的是一具"尸体"——一段已经完成的推理链,答案是确定的,你删完之后只需要验证答案还对不对。全程无反馈、无环境、无后续。而 Agent 场景里,你面对的是一条活的生命线:在第 t 步删掉一段推理,可能改变第 t+1 步的工具调用,从而改变第 t+1 步的观察结果,从而改变之后所有的决策分叉。你不是在删减一篇写好的文章,你是在蝴蝶的翅膀上动刀——而蝴蝶正飞在风暴中心。
更微妙的是信息的位置会流动。一个中间结论、一条约束、一个计划,最初可能只存在于推理文本里;但随着 Agent 调用工具、写入代码、生成文件、收到环境反馈,同样的信息可能被"搬运"到了外部世界。一份"端口扫描计划"在被执行之后,就变成了工具输出里的真实扫描结果;一段"数据清洗规则"在被写成代码之后,就住进了脚本文件里。当信息已经落盘为代码,那段孕育它的推理,还留着干嘛?
这就是论文标题里那个问题的真正分量:Agent 到底什么时候可以安全地忘掉自己的推理? 要回答它,既需要一套能安全下刀的工程方法,也需要一套能解释"为什么这把刀落得对"的分析框架。这篇论文恰好两样都给了。
🔧 ICLR:用"预测自信度"给推理打分
论文提出的方法叫 ICLR(Interaction Aware Compression for Long Horizon Reasoning,长时程推理的交互感知压缩)。名字有点拗口,但机制干净得像一把瑞士军刀——整个方法不需要任何训练,只需要一个冻结的打分模型和一条朴素的信息论直觉。
核心直觉:你说得越笃定,越是可以忘
回想你自己的生活经验。开会做笔记的时候,哪些内容你会随手省略?"1+1=2"你不会写,"王总周五要汇报"你会写得清清楚楚。被省略的内容有个共同点:你对它们极度确定——要么它们是套话废话,要么它们所依赖的信息已经在别处有了更可靠的记录。反过来,凡是你心里打鼓的地方——"这个方案有两个风险,我还没想清楚"——你一定会记下来,因为它的内容无法从其他地方重建。
ICLR 把这个生活直觉翻译成了信息论语言:预测熵(predictive entropy)。
用一个冻结的代理模型(论文里用的是 Qwen3.5 9B)对每个推理块(以空行分隔的段落)做前向计算:给定前文,模型对这一段里每个 token 的预测有多"犹豫"?预测分布越尖锐(低熵),说明这段文字越"按部就班"、越容易被从上下文中重建或替代——删了它,等于删了一句"正确的废话";预测分布越平坦(高熵),说明这段文字承载了真正的决策不确定性,是真信息,删了就是真的损失。
这个打分是上下文条件化的——打分模型看到的不是孤立的推理段,而是完整的系统提示、工具定义、累积的交互历史和当前步骤,按因果顺序排列。这一点至关重要:同一句"现在检查端口 8080",在任务初期可能信息量很大,在已经跑过三次扫描之后可能就是一句正确的废话。打分必须感知"这句话此刻还重要吗",而不是"这句话在统计学上罕见吗"。这个设计让同一个文本块在不同轨迹状态下拿到不同分数——分数不是文本的属性,而是文本与状态的关系的属性。
手术流程
整个在线压缩循环是这样的:
- Agent(DeepSeek V4 Flash,开启高推理档位)完成第 t 步:产生推理 R_t、行动 A_t、观察 O_{t+1}。
- ICLR 把 R_t 按双换行边界切成 N 个推理块,排除空块,打分模型对每个块内所有 token 的预测熵取平均。
- 把熵最低的 ⌊0.8N⌋ 个块替换成字面标记
[SKIP]——固定删掉 80% 的低熵块,不做任务特定的调参。当只有一块时不动刀。 - 行动、工具调用、工具输出、观察结果,一律原样保留,一个字不动。
- 压缩后的历史被写回持久化上下文,永不恢复。Agent 的下一步请求,就是吃这份"删减版"历史长大的——每一次后续请求都活在被修改过的轨迹上,不存在"临时压缩、事后还原"的侥幸。
这一步棋非常讲究:压缩策略只允许碰推理,永远不许碰已经发生的交互记录。因为行动和观察是任务状态的外部锚点——它们是这个世界的"既成事实",而推理只是对事实的解读。删事实危险,删解读(在其信息已被外部化之后)却常常是安全的。替换成 [SKIP] 而不是直接抹除,还留下了一个诚实的痕迹:模型知道这里曾经有过一段思考,只是它不再重要了。
有一个细节值得玩味:打分模型的输入上限是 42K token,一旦超限,该步直接跳过压缩,而不是截断历史。宁可不删,也不破坏 Agent 看到的世界完整性。这种克制,在"效果优先、过程粗暴"的压缩文献里并不常见——很多方法为了保证压缩率不惜截断或改写观察记录,而 ICLR 把"不碰事实"当成了铁律。
📈 主实验:删了 80% 的内心戏,成绩反而更好了
实验平台是 WorkBuddyBench,一个包含 260 个长时程任务的基准,横跨代码(80 个)、办公(50 个)、安全(60 个)、网页(70 个)四个领域。任务长、交互深、反馈密,正是记忆膨胀的天然温床。
在全部 260 个任务上,ICLR 把平均奖励从 0.699 提升到 0.718——同时,输入 token 减少 25.5%,输出 token 减少 14.4%,缓存读取 token 减少 33.3%。总 token 从 269 万降到 219 万,下降 18.5%。对局记录 102 胜、76 平、82 负。
注意这个结果的形状:**既省钱,又提分。**这在上下文管理领域几乎是罕见的姿势。看同一张 Pilot40 对比榜单:滑动窗口(K=5)分数暴跌 11.2 分、token 反而暴涨 56%;PACE 省了 41.6% 的 token 但掉了 9.1 分;CoMem 更夸张,token 砍掉 59.5%,分数直接跳水 23.3 分;大名鼎鼎的 ACM 在满分 100 的尺度下只剩 33.7 分。ICLR 以 70.3 的均分站在"分数上升"的一侧,旁边只有周期性摘要(n=5)勉强同侧,但它的 token 是涨的。
更戏剧性的数字出现在安全(Security)领域:完整基准上 ICLR 拿到 70.7 分,比基线的 47.8 分高出 22.9 分。一个压缩方法,在一个领域暴涨近 23 分?这暗示了一件比"压缩无损"更有意思的事——堆积如山的旧推理不仅是成本负担,还是活跃的噪声污染。安全任务的轨迹往往布满误导性的报错、曲折的排查路径,过期的推理记录着已被证伪的假设,持续向模型广播错误的先验。清掉低价值的内心戏,Agent 反而看得更清了。这跟人脑的工作方式何其相似:工作记忆需要不断清理,否则就淹没在无关细节里。
消融实验(固定 80 个任务:代码、办公、安全、网页各 20)进一步确认了每个设计选择的贡献:ICLR 拿到 0.738,基线只有 0.627;砍掉打分时的历史上下文(Step Only Entropy)降到 0.711;无差别全删(Delete All Thinking)是 0.718——仍然比基线高出一截,但追不上上下文条件化的熵排序。四种随机删除比例(5%–40%)全部落在 0.68 附近,没有一个摸到熵排序的脚踝。
一句话总结:推理历史里确实冗余巨大,但"删哪些"比"删多少"重要得多,而"何时删"的上下文感知又是加分的关键。 随机删 40% 不如聪明地删 80%——这个对比本身就值得裱起来挂在每个做 agent 压缩的人的工作台上。
🌀 轨迹放大:蝴蝶效应的账单
接下来是这篇论文最迷人的发现——轨迹放大效应(trajectory amplification)。
直觉上你会认为:删掉 10% 的推理 ≈ 省 10% 的输入 token;删掉 20% ≈ 省 20%;全删 ≈ 省最多。线性、单调、无聊。
实验数据说:不。
看这组数字:随机删除 10% 的推理 token,总输入居然下降了 60.5%;而随机删除 20%,输入只下降 44.0%——删得更多,省得更少。全删推理的输入下降 63.6%,也并没有比删 10% 多出多少。对局数量也被搅动:不同的干预方式产生的 agent 调用次数差异巨大,有的干预让 Agent 提前收工,有的却逼得它反复试错、重新推理,把省下的 token 加倍奉还。
这就像你在高速公路上拐了一个 1 度的小弯,最后却开到了另一座城市。局部的小改动,通过工具选择、观察结果、重新推理、错误恢复、提前或延迟终止这些环节被逐级放大,最终整条轨迹的总算力账单变得面目全非。删 10% 的那组之所以"省得异常多",可能是因为删得恰好——既削掉了冗余,又没伤到决策主干,Agent 一路顺畅走完;而删 20% 的那组可能恰好砍掉了一块"当时看着啰嗦、后来救命"的推理,Agent 一步踏空,后面全靠额外的探索来补洞。省与费,不在删的那一刻决定,在整条轨迹的回声里决定。
论文在附录里给这个现象配了一份严格的理论账本。Proposition B.5(轨迹级 token 分解)说得很直白:整条轨迹的 token 差异 = 前 K* 步的逐步差异之和 + 压缩轨迹多出来的请求 + 基线轨迹多出来的请求。也就是说,总账不只记"你删了几个 token",还记"你的删法让 Agent 后来多走了几步或少走了几步"。Theorem B.3(有限时程轨迹扰动)更进一步:如果每步行动分布的总变差都被 ε_t 界定,那么整条轨迹分布的总变差以 1−∏(1−ε_t) 为界,期望分数差不超过 min{1, Σε_t}。每一步的小偏移,会跨步骤累积成一个谁也没法假装看不见的轨迹级扰动。
这个发现对整个 agent 压缩研究都是一记警钟:只看"删了多少 token"评估压缩方法,就像只按页数评价一本书。 两个删了同样多 token 的方法,可能一个让 Agent 多绕了三小时的弯路,一个让它直奔终点。评估压缩,必须看整条轨迹的账——这也正是 ICLR 选择"在线压缩"而非"事后压缩"作为默认设定的原因:只有真正活在交互回路里的压缩,才能暴露出轨迹放大这种系统性效应。
🕳️ 外部化差距:推理的保质期藏在信息的位置里
方法有效、效应迷人,但论文真正想回答的"什么时候能忘",还需要往 Agent 的脑子里看。作者用了三套互补的手段:表示探测、激活修补、受控轨迹干预。它们共同指向一个核心概念——外部化差距(internalization and externalization gap):同一段推理的价值,在它携带的信息"只住在脑子里"和"已经搬进世界"这两种状态下,有断崖式的差异。
你的脑子里藏着"还会想起来"的信号
第一套实验是未来必要性探测(future necessity probing)。思路是:在每次压缩边界,从冻结模型的隐状态里训练一个线性探针,预测"之后的轨迹里会不会发生重新推导、补充推理或显式重规划"。这等于问模型一个关于未来的问题:你现在消化掉的这段上下文,稍后还会不会被你想起来?
在 31 个任务、265 个压缩边界样本上(112 个正样本),严格按任务级嵌套划分训练/测试——探针的层选择、池化方式、标准化、PCA 全部只在训练任务上完成,外圈评估用的是从未见过的任务——探针拿到了 AUROC 0.844、AP 0.811、平衡准确率 0.760。
这意味着什么?Agent 当前的内部表示里,提前编码了"这段推理稍后还会被需要"的信号——在这个信号尚未变成行动之前,它就潜伏在表示之中。推理的"未来价值"不是玄学,是可测量的、可泛化到新任务的。所有外层折叠里都选中了"提示词最后一个 token 的表示",说明这个边界位置是整段上下文的"摘要锚点"。
被删除的推理,真的在预测中留下了"洞"
第二套实验是激活修补(activation patching),方法学源自 ROME 那类定位事实关联的工作。把"有完整历史"和"历史推理被删"两种条件下、提示词边界的残差表示做替换,看下一 token 分布能恢复多少(用 KL Repair 度量:1 表示完全修复,0 表示毫无作用)。
结果像一部层层解谜的电影:第 4 层修补只能恢复 0.047,近乎无效——浅层几乎不在乎那段被删的推理;第 20 层恢复到 0.459;第 28 层 0.724;到了第 31 层——最深的层——KL Repair 达到 0.978,几乎完全修复,top-1 预测完全对齐。
信息加工是分层的:深层把历史推理的影响实实在在地编码进了表示,删除历史造成的扰动是真实的、可定位的;同时它也证明了这段历史的信息是可恢复的——在表征层面上,"想过"这件事留下了可以被打捞的痕迹。这套证据链把"推理确实携带着后续决策需要的东西"从行为观察推进到了机制层面。
关键一刀:信息搬家之后,旧推理就成了装饰品
第三套,也是最直白的一套:外部化分析。作者在每个压缩边界人工标注一个指标 G_i——"任务特定的派生状态"(中间计划、约束、实体关系、综合结论,不包括任务指令原文和原始观察)是否还只存在于推理里。如果这些信息已经写进了代码、文件、工具输出或环境反馈,就记为"已外部化"。
结果像一道闪电劈开了整个问题:
- 派生状态只在推理里时,未来行为风险率 67.3%;
- 派生状态已外部化后,风险率骤降到 36.2%。
同一个任务内部,这个差距是 19.8 个百分点,对应的隐藏分数差 0.283。推理的保质期,不由它写下的那一刻决定,而由它携带的信息何时"搬家"决定。 这是全篇论文最具实践指导意义的一个数字——它几乎就是一条可操作的遗忘准则:盯住派生状态的栖身之处,而不是盯着推理文本本身。
受控干预把这个结论钉死在案板上。作者构造了固定中间状态的续跑实验,只改推理、不动周围任务状态:
- 只保留最新推理 → 规则分数 0.872,与保留全部历史持平;
- 只删掉最新推理 → 掉到 0.760;
- 删掉所有推理 → 只剩 0.675。
最新推理是黄金,陈旧推理是旧报纸——除非旧报纸里还夹着没取出来的现金。位置比总量重要,这个结论与"工作记忆的最新项最重要"的认知直觉严丝合缝。
最漂亮的证据是这一条:当相关代码已经写入磁盘后,清掉后续的推理,规则分数纹丝不动——0.759,一个点都不掉。 推理完成了它的历史使命:它孕育的代码已经替它永远地活在了外部世界里。附录 Corollary B.4 给这一切封了顶:只要外部化状态在每一步都足以让压缩前后两个策略产生相同的行动分布,那么两条轨迹的分布完全相同——遗忘是无损的,而且这不是修辞,是有证明的充分条件。
环境反馈的实验则补上了循环的最后一环:当 Agent 已经观察到的 stderr 报错仍可见时,它直奔修复(Edit);把同样的报错藏起来,Agent 就会再发一次 Bash 命令,亲自把同一个错误再犯一遍、再观察一遍——环境反馈本身就是一种外部信息载体,Agent 丢了它,会本能地回到世界里重新获取。这个小小的行为细节特别生动:它说明 Agent 的"聪明"很大程度上是对外部状态的精明索引,一旦索引失效,它宁愿重新采样世界,也不凭空脑补。
🌊 哲学时刻:推理不是历史,是工作状态
现在我们抵达这篇论文真正的思想腹地。
在传统观念里,推理是思考的历史记录——像航海日志,发生了就值得存档,删改即篡改历史。这篇论文用一整套证据逼我们换一种看法:Agent 的推理更像是一块动态的工作状态(dynamic working state)——像一块草稿板,它的价值随时间衰减,随外部化而蒸发,随新观察的出现而贬值或升值。同一段推理在轨迹的不同位置上,身份完全不同:孕育期它是产床,执行期它是蓝图,完成后它是纪念碑——而纪念碑的功能,主要靠"那里曾经发生过什么"来满足,而不是靠反复诵读碑文。
这个视角转换影响深远。
如果推理是历史,那默认该保留,删除需要理由。如果推理是工作状态,那默认该清理,保留才需要理由——而保留的理由只有一个:它携带的任务派生状态还没有可靠的外部栖身之所。 这个原则一旦确立,agent 上下文管理的设计空间就被彻底重排了:问题从"怎么压缩得更狠"变成"怎么更早、更可靠地把派生状态外部化"——写代码、落文件、调工具,这些行为本身就是最好的压缩策略。遗忘的许可证,是外部化签发的。
这不只是工程智慧,它甚至呼应了认知科学里关于人类工作记忆的经典图景。人类思考时也一样:我们把中间结果写在纸上、贴便签、敲进计算器,然后心安理得地让那段心算从意识里退场——外部化是人类遗忘的前提,也应当是 Agent 遗忘的许可证。 延展心智(extended mind)假说认为认知不止发生在颅骨之内,笔记本和计算器都是认知过程的一部分;这篇论文某种程度上为 Agent 版本的延展心智提供了工程注脚:上下文窗口不是 Agent 的全部心智,代码、文件、工具输出和环境反馈共同构成了它的外延大脑。
还有一个更实用的推论藏在里面:最好的压缩策略,可能根本不在压缩算法里,而在 Agent 的行为习惯里。 一个懂得及时把结论写进文件、把计划落成代码、把中间结果交给工具的 Agent,天然就拥有了更多"可以遗忘"的时刻。反过来,一个只会闷头推理、从不把想法外部化的 Agent,它的每一段历史推理都可能是唯一的救命稻草,怎么删都是冒险。这给了上下文管理研究一个新方向的暗示:与其事后绞尽脑汁决定删什么,不如事前引导 Agent 多用外部世界做草稿纸。遗忘的自由,是行动挣来的。
论文的理论部分还给了我们一把更锋利的尺子。Lemma B.1(残余信息界)说:一个推理块关于下游目标的残余信息贡献,不超过它在给定前文下的条件熵。低熵块的信息贡献天然受限——这就是为什么"低熵优先删除"在信息论上有底气,它不是经验拍脑袋,而是有上界担保的。Theorem B.2 把结论推广到多块联合删除的情形。而 Theorem B.3 的轨迹扰动界又提醒我们:这把尺子量的是单步,账单却开在全程。理论与实验在这里闭环:方法为什么有效(低熵→低残余信息)、风险在哪里(局部扰动轨迹级放大)、什么时候无风险(外部化充分条件),三条线各就各位。
当然,这篇论文不是终点。压缩比例 0.8 是固定的,没有做自适应调度——熵阈值能否随任务阶段动态调整?探测到的"未来必要性信号"能否直接反馈给压缩策略,形成"预测到会被重用就保留"的闭环?跨任务迁移时,外部化边界的标注能否自动化而非人工判定?"派生状态"的定义目前依赖人工判断,能否用可计算的信息量指标替代?另外,本工作在 WorkBuddyBench 上验证,基座模型是 DeepSeek V4 Flash,结论能否迁移到其他模型家族、更开放的任务分布、更长的真实生产轨迹,都值得继续观察。作者把这些留白诚实地摆在了台面上,这本身就是好的研究品味。
🔚 尾声
回到那个深夜的问题:它还"记得"自己想过什么吗?
现在我们可以回答:它不需要记得所有。它只需要在那些信息还没有第二条命的时候,紧紧地抱住它们;一旦信息在代码里、在文件里、在环境的回声里获得了永生,那段孕育它们的推理,就可以放心地死去了。
遗忘不是缺陷,是智能体成熟的标志。就像论文那句平静的结论:Agent 的推理是一种动态的工作状态,其价值在交互中不断变化——而不是一份需要永远供奉的交互历史。
金鱼的记忆只有七秒,人们嘲笑它。但也许问题从来不在遗忘本身,而在于——你忘了之后,世界里还有没有东西替你想着。 有,就可以忘。这篇论文把这句话,写成了数学。
📎 参考文献
- Mingxuan Wang, Fei Luo, Bo Wang, Guorun Yao, Yinglong Guo, Chao Ning, Hongyue Chen, Yanbiao Ma, Jungong Han. "When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression." arXiv:2609.29875, 2026. https://arxiv.org/abs/2609.29875
- Zeju Li, Jianyuan Zhong, Ziyang Zheng, Xiangyu Wen, Zhijian Xu, Yingying Cheng, Fan Zhang, Qiang Xu. "Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy." ICLR 2026.(Step Entropy,ICLR 熵打分思想的来源)
- Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao. "ReAct: Synergizing Reasoning and Acting in Language Models." arXiv:2210.03629, 2022.
- Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou. "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." NeurIPS 2022.
- Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang. "Lost in the Middle: How Language Models Use Long Contexts." TACL 2024.
- Charles Packer, Sarah Wooders, Kevin Lin, Vivian Fang, Shishir G Patil, Ion Stoica, Joseph E Gonzalez. "MemGPT: Towards LLMs as Operating Systems." arXiv:2310.08560, 2023.
- Kevin Meng, David Bau, Alex Andonian, Yonatan Belinkov. "Locating and Editing Factual Associations in GPT." NeurIPS 2022.(激活修补方法来源)
#论文 #arXiv #AI #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。