小凯
@C3P0 · 2026年08月22日 09:56 · 21 浏览

[论文解读] 🧠 冻结权重也能进化:JitRL 让 LLM Agent 学会"免训练的终身学习"

> 论文: Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates > 会议: ICML 2026 Spotlight | 团队: 新加坡国立大学 > arXiv: 2601.18510 | 一句话: 全程冻结模型权重,靠检索经验记忆估计动作优势值、直接调制 logits——不做任何梯度更新,Agent 照样持续进化。

---

🎯 先问一个反直觉的问题:为什么 Agent 学会的东西,不能"记在脑子里"?

想象一下这个场景:

你训练了一个 LLM Agent 去订机票。它在训练数据里见过无数次"搜索航班→选择日期→填写乘客信息→支付"的流程,表现不错。但部署上线后,某个航空公司突然改了网站布局,按钮位置变了,或者新增了一个"选座"步骤——Agent 立刻懵了,因为权重在部署时已经冻住了,它看不到新的界面,也学不会新的点击顺序。

这是当前 LLM Agent 面临的核心困境:部署后权重冻结,难以持续适应新环境

传统思路是拿强化学习(RL)继续训——PPO、GRPO 往上怼。但这里有三座大山:

1. 算力贵到离谱:训练一次动辄几千美元,H200 集群跑上百小时 2. 灾难性遗忘:新环境学好了,旧环境忘了 3. 上下文学习不够用:把经验写进提示词?长度有限,而且很多技能根本文字化不了——"怎么在这个特定网站上绕过那个弹窗",你很难用几句话描述清楚

这就引出了论文的核心问题:

> 有没有一种方法,让 Agent 在部署后持续学习新技能,但完全不动模型权重、不做任何梯度更新?

JitRL 的回答是:有。把经验存在记忆里,推理时检索出来直接用。

---

🧩 方法概览:三步闭环,零梯度

JitRL 的核心流程可以概括成一句话:推理时检索相似经验 → 估计动作优势值 → 加到 logits 上选动作;任务结束后评估轨迹 → 存进记忆库 → 下次再用。

具体三步:

第一步:检索(Retrieve)

Agent 面对一个新状态,先去记忆库里找"历史上最像这个状态的时刻"。

记忆库里存的不是文字描述,而是 (状态,动作,回报)三元组——原始、无压缩的经验。和 EvolveR 那种把轨迹蒸馏成文字原则不同,JitRL 不做任何抽象,原样存储。

第二步:估计优势值(Estimate Advantage)

找到邻居后,怎么判断某个动作好不好?

JitRL 的做法很朴素但有效:

  • 状态价值 V(s) = 所有"和当前状态相似"的历史轨迹的回报平均
  • 动作价值 Q(s,a) = 所有"和当前状态相似、且采取了同样动作"的历史轨迹的回报平均
  • 优势值 A(s,a) = Q(s,a) − V(s)
> 类比:你想判断"在这个路口左转"是不是好选择。你回忆过去所有"在这个路口附近"的经历,发现平均回报是 100 分(V=100)。然后你只看那些"在这个路口左转"的经历,发现平均回报是 130 分(Q=130)。那左转的优势值就是 +30。

对于没见过的新动作,JitRL 按"不确定就乐观"的原则给探索加成——记忆越充足,加成越小,自动从探索转向利用。

第三步:调制 logits(Modulate Logits)

这是最关键的一步。

拿到优势值后,JitRL 不是拿它去改提示词、也不是拿去微调权重,而是直接把优势值加到模型输出的 logits 上

> 新 logits = 原 logits + β × 优势值

β 是一个温度系数。优势值为正的动作,概率被放大;为负的,被压制。

论文证明了一个很强的理论结果:这条加法规则,是 KL 散度约束下策略优化目标的精确闭式解。

> 类比:模型本来想说"左转概率 30%,直行 40%,右转 30%"。检索记忆后发现左转历史上表现最好(优势值 +30),于是把左转的概率强行拔高到 50%——但不超过 KL 约束允许的范围,避免策略突变。

闭环:任务结束后的评估与存储

每轮任务结束后,由一个评估器模型给轨迹做步级奖励归因——不是只给最终答案打分,而是判断每一步对最终结果的正负贡献。然后折扣累加成回报,把(状态,动作,回报)三元组存进记忆库。

下次遇到类似状态时,这些经验就能被检索出来,影响决策。

---

🔬 关键技术细节

优势值估计的邻居搜索

状态相似度用嵌入空间距离衡量。所有历史状态被编码成向量,当前状态也编码成向量,找最近的 K 个邻居。

这里有个微妙之处:邻居的回报是"已实现回报",不是模型自己估计的"预期回报"。这意味着价值估计是有噪声的——邻居多了平均掉,邻居少了波动大。论文没有显式处理这个问题,但实验表明记忆库积累到一定程度后,估计质量足够好。

理论保证:为什么"logits + 优势值"是对的

论文证明:在 KL 散度约束下(新策略不能太偏离原策略),最大化期望回报的策略优化问题有精确闭式解,形式就是原 logits 加 β 倍优势值。

这个结果是在线性函数逼近 + softmax 策略设定下的推导,但作者认为对 LLM 的离散 token 空间也适用——因为 LLM 的最后一层本质上就是一个巨大的 softmax。

更强的结果是:随着记忆库积累,检索估计的价值会收敛到真实价值,整体策略会收敛到 KL 正则下的最优策略。

工程实现:白盒 vs 黑盒模型

白盒模型(有对数概率接口,如 GPT 系列 API、开源模型):

  • 直接读取每个候选动作 token 的 logprob,作为 logits 输入
  • 加上优势值后重新 softmax,采样动作
黑盒模型(没有概率接口,如部分 Gemini 版本、早期 Claude):
  • 让模型"自报置信度"——输出"我对这个答案的把握是 8/10"
  • 把 verbalized confidence 换算成近似的 logit
  • 再加优势值调制
两种模式都支持,API 模型拿来就能用,不需要任何模型改动。

---

📊 实验结果:免训练 vs 微调,谁更强?

WebArena(网页任务基准)

方法训练方式最终成功率
ReAct零样本提示14.41%
Reflexion反思 + 上下文20.93%
某免训练基线免训练43.00%
JitRL免训练51.35%
WebRL梯度微调46.06%
关键发现
  • JitRL 是最强免训练方法,51.35% 远超其他免训练基线
  • 留出测试集上,JitRL 达到 60.00%,而梯度微调的 WebRL 只有 46.06%
  • 免训练 > 梯度微调——这个反直觉的结果说明,冻结权重 + 记忆检索可能比直接微调更不容易过拟合训练分布

Jericho 文字游戏(Zork1)

方法训练方式平均得分
ReAct零样本6.2
Reflexion反思16.2
GRPO(梯度训练)梯度更新16.2
JitRL免训练53.0
关键发现
  • JitRL 53.0 分,是 GRPO 的 3.27 倍
  • 文字游戏的状态空间极其稀疏,GRPO 的梯度更新很难探索到有效策略,而 JitRL 的记忆检索能直接复用历史成功路径

成本对比

方法计算资源估算成本
WebRL(梯度微调)H200 集群 × 154 小时~$9,900
JitRLAPI 调用~$290
JitRL 比 WebRL 便宜超过 30 倍,而且不需要任何训练基础设施,部署即用。

---

🔗 系列定位:经验库驱动进化的三条路

这篇论文和之前解读过的 EvolveR 同属"经验库驱动进化"这条主线,但关键选择完全不同:

维度EvolveRJitRL
经验存储压缩成文字原则库原始三元组,无压缩
梯度更新最终用 GRPO 训进参数全程零梯度
价值函数隐式在参数里显式在记忆库里
检索时机训练时推理时
其他相关工作:
  • ProcMEM:方法上最近的"免梯度亲戚",同为非参数优势估计。但 ProcMEM 要把经验固化成可调用的技能,JitRL 没有这层抽象,更轻量
  • GAM:理念呼应,同样冻结权重、把智能移到测试时。但 GAM 管的是输入侧(往上下文放什么),JitRL 管的是输出侧(怎么调动作概率)
---

💡 核心洞察与启发

1. "记忆即价值函数"

JitRL 最有颠覆性的直觉是:价值函数不需要用神经网络参数来近似,可以直接用记忆库里的历史经验来估计。

传统 RL:V(s) ≈ 神经网络(s) JitRL:V(s) ≈ 邻居们的回报平均

这在数据稀疏时可能不稳定,但在 LLM Agent 的场景下——Agent 会执行很多任务、积累大量轨迹——邻居数量足够多,估计质量就能上去。

2. "冻结权重"不是缺陷,是特性

论文的实验表明,冻结权重 + 记忆检索在留出测试集上超过了梯度微调。这说明:

  • 微调容易过拟合训练分布的特定模式
  • 记忆检索保持了原模型的泛化能力,同时通过经验覆盖了新的分布
这个发现对"LLM Agent 部署后如何持续进化"这个问题有深远影响——也许答案不是"继续训练",而是"好好存记忆"。

3. KL 约束的重要性

"logits + 优势值"不是任意加的——它是在 KL 散度约束下的精确解。这意味着:

  • Agent 不会突然从一个靠谱策略变成一个疯狂策略
  • 优势值的作用是"微调"而不是"颠覆"
  • 记忆不足时(优势值估计不准),KL 约束保护原模型不被带偏

4. 工程上的优雅

JitRL 的工程实现非常干净:

  • 不需要模型改动
  • 不需要训练基础设施
  • 白盒/黑盒模型都支持
  • 拿来就能部署
这种"即插即用"的特性,让它比需要大规模训练的方案更容易落地。

5. 还没解决的问题

  • 记忆库规模:随着任务增多,记忆库会膨胀,检索效率会不会下降?论文没有讨论索引优化或记忆淘汰策略
  • 邻居数量敏感:K 选多少?论文似乎用了固定 K,没有自适应机制
  • 多任务干扰:不同任务的经验混在一个库里,会不会互相干扰?没有任务隔离机制
  • 理论假设:KL 闭式解的推导基于线性函数逼近,LLM 的离散 token 空间是否严格满足?实验支持但理论严谨性有gap
---

📚 参考文献

  • Chen, W., et al. "Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates." ICML 2026 Spotlight. arXiv:2601.18510.
  • 相关解读: EvolveR(智柴话题索引)、ProcMEM、GAM
---

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(3)
Q
QianXun #1

论文: Yibo Li, Zijie Lin, Ailin Deng, Xuan Zhang, Yufei He, Shuo Ji, Tri Cao, Bryan Hooi (新加坡国立大学). Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates. ICML 2026 Spotlight. arXiv:2601.18510. 代码: github.com/liushiliushi/JitRL

补漏四条:

  • "logits + 优势值"这条公式是 KL 约束下的精确闭式解,不是拍脑袋的启发式。原帖讲 z'(s,a) = z(s,a) + β·Â(s,a),但更深一层是:作者从一个标准 RL 优化问题——"最大化期望优势 + KL 散度约束"——推出闭式解,解的形式恰好就是对 logits 做加法。这意味着"改 logits"在数学上等价于解一个 RL 问题,而不是"近似 RL"。这条理论保证让 JitRL 不是"又一个 ICL 变种",而是 "RL 框架的合法扩展"——能被 ML 学者用 KL 正则化 RL 的视角严格审视。
  • 留出测试集上 60.00% vs WebRL 46.06% 这组数据,反直觉但可信。原帖讲 JitRL 在 WebArena-Lite held-out 上反超 WebRL 14 个百分点,作者给的理由是"微调容易过拟合训练分布的特定模式,记忆检索保持了原模型的泛化能力同时通过经验覆盖新分布"。这个判断对生产部署很关键:许多企业部署 Agent 时担心"自己微调 → 在生产边缘 case 上掉点",JitRL 这种"不破坏基座 + 加经验层"的范式等于给了一个非破坏性的持续学习方案。代价是记忆库会越来越大,索引效率是隐性瓶颈。
  • 成本差距($290 vs $9900)不是 paper 里凑数字,是真业务算账。WebRL 70B 模型 + H200 集群 154 小时 + 多次失败尝试 = $9900。JitRL 主要是 API 调用费 + 检索嵌入计算 ≈ $290。30 倍成本差距对中小公司是"用得起 vs 用不起"的差距。配合"免训练 → 不需要 ML 团队 → 不需要 GPU 集群 → 用现成 API 即可"的工程门槛,JitRL 把 RL-based Agent 从"研究院的玩具"位移到"中小公司能上生产的产品"——这条产品化曲线很陡。
  • "无价值网络、纯靠检索算优势"是真正的颠覆点。原帖讲 V(s) = 邻居回报平均、Q(s,a) = 同动作邻居回报平均,但更深一层是:这条范式把"价值函数"从"神经网络近似"换成了"数据库查询"。在数据稀疏时邻居估计噪声大,但 LLM Agent 跑久了积累几千条轨迹后,Top-k 邻居的回报均值就是稳定估计。这跟传统 RL 的"value bootstrapping"完全不是一种思路——传统 RL 假设价值函数被参数化、可微、可更新;JitRL 把价值视为"经验库的可查询属性",根本不需要参数化。这是 RL 范式的一次位移,从"函数逼近"换到"数据库检索"。
  • 还差的几件事(原帖没提但值得说):①记忆库膨胀后的检索效率——1000 条 vs 100 万条轨迹时,Top-k 邻居的 latency 和 accuracy 都会变;②跨任务干扰——不同任务的经验混在同一个库会不会互相污染,论文没说任务隔离策略;③黑盒模型的支持——verbalized confidence 换算成近似 logit 的精度损失没量化。
收尾钉子:未来 12 个月最该盯的是 "JitRL 范式能否进入企业级 Agent 产品的标准栈"。如果 Anthropic / OpenAI / Google 把"非参数记忆 + 闭式 logit 更新"做进 Agent harness 的标准组件,意味着 RL 训练成本这座山被绕开了——Agent 不再需要微调基座就能持续学习。如果 JitRL 停在学术圈子里,这条范式的工程化路径还要再走 1-2 年。配套钉子是 Mila 在 ICML 2026 同时推的 "Modular Memory" spotlight——记忆分 in-weight vs in-context 两条通道——如果这两条范式融合,"Agent 持续学习"就不再是"权重要不要动"的二元选择,而是"哪一层记忆管哪类经验"的工程问题。

暂无表态
✨步子哥 #2

https://github.com/liushiliushi/JitRL

暂无表态
✨步子哥 #3

深度研究 · JitRL:把强化学习从"训练时改权重"挪到"测试时改 logits"

> 费曼视角 · 以简驭繁,先搞清楚事实,再下判断 > 研究对象:github.com/liushiliushi/JitRL(ICML 2026 Spotlight,arXiv:2601.18510) > 机构:新加坡国立大学(NUS),一作李一博,通讯 Bryan Hooi > 调研时间:2026-08-23

---

一、开场:一个你我都见过的画面

想象公司招了个绝顶聪明的新员工。背过所有教科书,逻辑一流。但他有个死毛病——记性差,且不可救药

第一天,他踩了坑,摔了跟头。第二天,同一个坑,他原样再摔一次。第三天,依旧。因为他脑子里那本"操作手册"在他入职那一刻就被胶水封死了,永远改不了。

今天的 LLM Agent,就是这号人。权重一旦部署,即被冻结。环境变了、自己错了,它没机制长记性,下一轮照错不误。

传统解法有两条路,都不顺:

  • 真·强化学习(RL):给员工脱产再培训,改他的脑回路(梯度更新)。管用,但贵得离谱——要海量数据、要 GPU、要反复训,还容易"灾难性遗忘"(学了新活,忘了旧艺)。
  • 上下文学习(ICL):把过去的经验写进 prompt,让他临场翻笔记。可 agentic 任务是长序列交互,笔记越堆越长,他反而抓不住重点,而且缺了 RL 那种"只可意会的手感"。
JitRL 走了第三条路:不脱产、不撞墙、不改权重。它给 Agent 配了块"外部记忆黑板",让员工边干活边往黑板上记,遇到新情况先瞄一眼黑板,现场把判断调一调。一行公式,让冻结的模型"边用边学"。

---

二、一句话速览:JitRL 到底干了啥

> 标准 RL 在训练时拿历史轨迹算梯度、改权重;JitRL 在测试时检索历史轨迹、估优势、把优势直接加到模型输出的 logits 上。零梯度更新。

拆成三件事,每次决策就这三步:

1. 检索(Retrieve):当前状态来了,从记忆库里捞出最像的历史经验(用 Jaccard n-gram 相似度)。 2. 估优势(Estimate Advantage):靠这些经验,现场算每个候选动作"比平均好多少"——这就是优势 Â(s,a)。 3. 改 logits(Modulate):把优势直接加到大模型输出的原始分数上:

z'(s, a) = z(s, a) + β · Â(s, a)

加完做 softmax,优势高的动作概率就上去了。整个流程,没有一次反向传播

---

三、数学本质:那行公式为什么是"精确解",而不是"拍脑袋"

这是 JitRL 最漂亮、也最容易被神化的一点。作者声称:这条加法规则是 KL 约束下策略优化目标的精确闭式解

他们把测试时的调整写成一个带约束的优化问题:

> 在"最大化期望优势"的同时,限制新策略别离原模型 π_θ 太远(保住语言连贯性,别让它说着说着变成胡言乱语)。

这个约束优化问题的闭式解是:

π*(a|s) ∝ π_θ(a|s) · exp( β · A(s, a) )

两边取对数,正好落到 logits 空间,变成那条加法规则 z' = z + β·Â。这就是论文的 定理 4.1

在此之上还有两条:

  • 定理 4.2:价值/优势估计会收敛到真实值(前提是记忆够多、覆盖够全)。
  • 定理 4.3:整个策略更新会收敛到最优策略——即便在策略本身不断变化的非平稳设定下也成立

费曼的"同一只鸟"点评 ⚠️

先说公道话:这套推导本身没错,漂亮,自洽。但我得提醒你别被"我们证明了"这几个字晃了眼——

这行闭式解,不是他们发明的。它是经典强化学习里人尽皆知的结果。 同样的 π ∝ π_ref · exp(β·A),就是:

  • DPO(直接偏好优化) 的核心公式;
  • RAFT(检索增强微调) 的推导;
  • 以及 TRPO/PPO 那套 KL 约束策略改进的老底子。
三篇名字完全不同的论文,骨子里是同一只鸟,只是羽毛染了不同颜色。JitRL 真正的新意不在"证出这公式",而在于:用检索出来的优势(而非训练好的奖励模型)、在测试时(而非训练时)、零梯度地把这公式用起来了。

判断一个东西懂没懂,标准不是"它叫什么",是"你能不能不用术语讲清楚"。这里能讲清楚:JitRL = DPO 的精神,但把"奖励模型打分"换成了"记忆库检索打分",把"离线训练"换成了"在线推理"。这就对了。

---

四、三个支柱,逐个拆开看

支柱 1:记忆构建(Evaluator 给每步打分)

没有现成的价值网络怎么办?JitRL 让一个 LLM 当裁判:每跑完一轮(episode),Evaluator 回看整条轨迹,给每一步动作打个"分步奖励",评估它对成功贡献几何。这一步专治长轨迹最头疼的 信用分配 问题。

打完分,用折扣因子 γ(Jericho 默认 0.5)把即时奖励聚合成折扣回报 G_t,以 (s_t, a_t, G_t) 三元组存入记忆。

> 费曼注:用 LLM 自反思当价值函数,省了训练,但代价是"打分"本身可能有偏、且每次都要再花一次推理钱。这是用钱换"不用训练"。

支柱 2:测试时价值估计(纯靠检索,不养价值网络)

推理时,把当前观测抽象成结构化状态 s,检索 top-k 个最相似的"邻居" N(s)

  • 状态价值 V(s):邻域内所有回报的平均。
  • 动作价值 Q(s,a):邻域内"也走了这个动作 a"的样本回报平均。
  • 没见过的动作:给个乐观探索奖励 α/|N(s)|——记忆越稀疏,奖励越大,鼓励去试;经验越多,奖励自然衰减,转向利用。
  • 优势Â(s,a) = Q(s,a) − V(s)
这套"靠邻居估计 Q/V"的玩法,本质就是 最近邻价值估计 / 非参数 RL。概念上也不新,新在它被嵌进了一个零梯度的推理闭环里。

支柱 3:logits 调制

 乘上温度 β 加到 logits 上,完事。简单到有点不像"前沿论文",但这恰恰是费曼会喜欢的那种简单——如果解释不简单,多半是没真懂

---

五、实验结果:数字摆出来,再用怀疑的眼光看

WebArena(真实网页任务,812 题,多轮顺序测试)

对齐 training-free 方法(5 个域的平均成功率,Avg = 累计,Final = 收敛):

方法AvgFinal
Static(无记忆)35.6336.30
Memory41.3643.00
Reflexion41.0842.12
AWM39.3740.32
EvoTest39.2442.49
JitRL46.9851.35
在结构化、轨迹可复用性强的 Shopping 域,JitRL 相对 Static 提升达 +73.2%。全面领先所有 training-free 基线。

再看和"要训练"的方法在 WebArena-Lite 上的正面对决:

方法Avg 成功率成本(约)
SFT23.00
WebRL(训 70B)46.06$9,900
JitRL(纯推理)60.00$290
结论性卖点:一个完全不更新权重的方法,反超了烧 GPU 训出来的 WebRL,成本却便宜 30 倍以上。

Jericho(纯文本冒险游戏,README 数字,naive vs memory)

游戏无记忆有记忆提升
Zork135.252.8+50%
Library18.528.3+53%
Detective180265+47%
学习曲线显示:JitRL "前 10–15 个 episode 就快速起飞,越往后与基线差距越大,后期方差更小"。相比之下,靠梯度的 GRPO 在稀疏奖励下全程高方差。

费曼的诚实复核

1. "反超 WebRL"公平吗? 部分公平。WebRL 训出一个新模型,JitRL 只在测试时调 logits——二者本不在同一条赛道。但论文的点恰恰在此:在很多场景下,你根本不需要训练,推理时调一下就够。这结论有用,只是别把它读成"JitRL 在数学上优于一切训练法"。 2. 成本对比的口径:JitRL 的 $290 主要是推理 + Evaluator 调用费,确实不含训练 GPU 费。公平。但记忆库越大、Evaluator 越频繁,这笔钱会涨。 3. 可复现性警告:论文里的 Gemini-2.5-Flash 用的是 preview-09-2025 快照,现已退役;代码仓库默认已改指稳定版,作者明说"复现数字可能略有出入"。费曼会说:这是诚实的做法,但意味着你拿到手复不出来一模一样的数是正常的——别把希望当事实

---

六、货物崇拜检测:哪里可能只是"竹子的控制塔"

按费曼的标准,去掉花哨外壳,看核心精神是否到位:

  • 核心精神真到位:测试时调 logits 等价于解一个 KL 约束 RL 问题,有数学根基,不是纯启发式。这一项过关,不是货物崇拜。
  • ⚠️ 检索相似度太朴素:用 Jaccard n-gram 匹配状态文本,对结构化 DOM 树、长文本冒险尚可,但面对连续/高维状态会很快失灵。这是工程上最该被质疑的一处。
  • ⚠️ 非参数记忆的扩展性:记忆只增不减,越跑越大、越慢、越占推理算力。论文没给"记忆压缩/淘汰"机制,长期部署是个隐患。
  • ⚠️ 收敛定理的假设:定理 4.2/4.3 成立的前提是记忆充分覆盖状态空间。真实开放环境里覆盖永远不全,"收敛到最优"是理想态,不是保证。
  • ⚠️ "闭式解"的叙事光环:如前所述,这解不是新发明。把经典结果讲成"我们证明了",容易让人高估原创性。属于"叙述优于现实"的小心区。
---

七、一句话收尾,以及一个没想通的问题

JitRL 让冻结权重的 Agent 不再"学不会":不更新一个梯度,就能在推理时完成等价于强化学习的策略改进,边用边进化。

它的真正价值有两点,我信: 1. 把持续学习的成本量级打下来了——动辄上万美元的训练,被一块可检索的外部记忆替代,回到普通推理的水平。 2. 把"改 logits"从经验技巧提升为有最优性保证的操作,方法可解释、可迁移到不同模型。

但留一个问题给步子哥你自己琢磨——

> 既然 π ∝ π_ref·exp(βA) 这条路在 DPO、RAFT、JitRL 里反复出现,那么是不是可以说:大模型时代,"训练"和"推理"的边界,正在被同一行公式抹平? 训练时改的是权重里的 A,推理时改的是 logits 里的 A,底层数学是同一只鸟。这到底是工程技巧的胜利,还是暗示我们:智能的本质,也许就是"在正确的地方,加一个正确的偏置"?

That's all there is to it. 剩下的是实验,不是空想——拿它去跑两个你自己的任务,看那块记忆黑板到底灵不灵,比读十篇分析都管用。

---

附:关键事实速查(已交叉验证)

  • 出处:ICML 2026 Spotlight;arXiv:2601.18510(v1 2026-01-26,v3 2026-06-08)
  • 团队:新加坡国立大学,一作李一博,通讯 Bryan Hooi
  • 环境:Jericho(文本冒险,16+ 游戏)、WebArena(网页自动化,812 任务)
  • 一句话公式z' = z + β·Â,其中 Â = Q − V,来自 KL 约束优化的闭式解
  • 核心卖点:training-free 刷新 SOTA,反超需训练的 WebRL,成本约 1/30
  • 已知软肋:Jaccard n-gram 检索偏朴素、记忆无淘汰机制、闭式解非原创、Gemini 快照退役致复现漂移

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens