论文: Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
会议: ICML 2026 Spotlight | 团队: 新加坡国立大学
arXiv: 2601.18510 | 一句话: 全程冻结模型权重,靠检索经验记忆估计动作优势值、直接调制 logits——不做任何梯度更新,Agent 照样持续进化。
🎯 先问一个反直觉的问题:为什么 Agent 学会的东西,不能"记在脑子里"?
想象一下这个场景:
你训练了一个 LLM Agent 去订机票。它在训练数据里见过无数次"搜索航班→选择日期→填写乘客信息→支付"的流程,表现不错。但部署上线后,某个航空公司突然改了网站布局,按钮位置变了,或者新增了一个"选座"步骤——Agent 立刻懵了,因为权重在部署时已经冻住了,它看不到新的界面,也学不会新的点击顺序。
这是当前 LLM Agent 面临的核心困境:部署后权重冻结,难以持续适应新环境。
传统思路是拿强化学习(RL)继续训——PPO、GRPO 往上怼。但这里有三座大山:
- 算力贵到离谱:训练一次动辄几千美元,H200 集群跑上百小时
- 灾难性遗忘:新环境学好了,旧环境忘了
- 上下文学习不够用:把经验写进提示词?长度有限,而且很多技能根本文字化不了——"怎么在这个特定网站上绕过那个弹窗",你很难用几句话描述清楚
这就引出了论文的核心问题:
有没有一种方法,让 Agent 在部署后持续学习新技能,但完全不动模型权重、不做任何梯度更新?
JitRL 的回答是:有。把经验存在记忆里,推理时检索出来直接用。
🧩 方法概览:三步闭环,零梯度
JitRL 的核心流程可以概括成一句话:推理时检索相似经验 → 估计动作优势值 → 加到 logits 上选动作;任务结束后评估轨迹 → 存进记忆库 → 下次再用。
具体三步:
第一步:检索(Retrieve)
Agent 面对一个新状态,先去记忆库里找"历史上最像这个状态的时刻"。
记忆库里存的不是文字描述,而是 (状态,动作,回报)三元组——原始、无压缩的经验。和 EvolveR 那种把轨迹蒸馏成文字原则不同,JitRL 不做任何抽象,原样存储。
第二步:估计优势值(Estimate Advantage)
找到邻居后,怎么判断某个动作好不好?
JitRL 的做法很朴素但有效:
- 状态价值 V(s) = 所有"和当前状态相似"的历史轨迹的回报平均
- 动作价值 Q(s,a) = 所有"和当前状态相似、且采取了同样动作"的历史轨迹的回报平均
- 优势值 A(s,a) = Q(s,a) − V(s)
类比:你想判断"在这个路口左转"是不是好选择。你回忆过去所有"在这个路口附近"的经历,发现平均回报是 100 分(V=100)。然后你只看那些"在这个路口左转"的经历,发现平均回报是 130 分(Q=130)。那左转的优势值就是 +30。
对于没见过的新动作,JitRL 按"不确定就乐观"的原则给探索加成——记忆越充足,加成越小,自动从探索转向利用。
第三步:调制 logits(Modulate Logits)
这是最关键的一步。
拿到优势值后,JitRL 不是拿它去改提示词、也不是拿去微调权重,而是直接把优势值加到模型输出的 logits 上:
新 logits = 原 logits + β × 优势值
β 是一个温度系数。优势值为正的动作,概率被放大;为负的,被压制。
论文证明了一个很强的理论结果:这条加法规则,是 KL 散度约束下策略优化目标的精确闭式解。
类比:模型本来想说"左转概率 30%,直行 40%,右转 30%"。检索记忆后发现左转历史上表现最好(优势值 +30),于是把左转的概率强行拔高到 50%——但不超过 KL 约束允许的范围,避免策略突变。
闭环:任务结束后的评估与存储
每轮任务结束后,由一个评估器模型给轨迹做步级奖励归因——不是只给最终答案打分,而是判断每一步对最终结果的正负贡献。然后折扣累加成回报,把(状态,动作,回报)三元组存进记忆库。
下次遇到类似状态时,这些经验就能被检索出来,影响决策。
🔬 关键技术细节
优势值估计的邻居搜索
状态相似度用嵌入空间距离衡量。所有历史状态被编码成向量,当前状态也编码成向量,找最近的 K 个邻居。
这里有个微妙之处:邻居的回报是"已实现回报",不是模型自己估计的"预期回报"。这意味着价值估计是有噪声的——邻居多了平均掉,邻居少了波动大。论文没有显式处理这个问题,但实验表明记忆库积累到一定程度后,估计质量足够好。
理论保证:为什么"logits + 优势值"是对的
论文证明:在 KL 散度约束下(新策略不能太偏离原策略),最大化期望回报的策略优化问题有精确闭式解,形式就是原 logits 加 β 倍优势值。
这个结果是在线性函数逼近 + softmax 策略设定下的推导,但作者认为对 LLM 的离散 token 空间也适用——因为 LLM 的最后一层本质上就是一个巨大的 softmax。
更强的结果是:随着记忆库积累,检索估计的价值会收敛到真实价值,整体策略会收敛到 KL 正则下的最优策略。
工程实现:白盒 vs 黑盒模型
白盒模型(有对数概率接口,如 GPT 系列 API、开源模型):
- 直接读取每个候选动作 token 的 logprob,作为 logits 输入
- 加上优势值后重新 softmax,采样动作
黑盒模型(没有概率接口,如部分 Gemini 版本、早期 Claude):
- 让模型"自报置信度"——输出"我对这个答案的把握是 8/10"
- 把 verbalized confidence 换算成近似的 logit
- 再加优势值调制
两种模式都支持,API 模型拿来就能用,不需要任何模型改动。
📊 实验结果:免训练 vs 微调,谁更强?
WebArena(网页任务基准)
| 方法 | 训练方式 | 最终成功率 |
|---|---|---|
| ReAct | 零样本提示 | 14.41% |
| Reflexion | 反思 + 上下文 | 20.93% |
| 某免训练基线 | 免训练 | 43.00% |
| JitRL | 免训练 | 51.35% |
| WebRL | 梯度微调 | 46.06% |
关键发现:
- JitRL 是最强免训练方法,51.35% 远超其他免训练基线
- 在留出测试集上,JitRL 达到 60.00%,而梯度微调的 WebRL 只有 46.06%
- 免训练 > 梯度微调——这个反直觉的结果说明,冻结权重 + 记忆检索可能比直接微调更不容易过拟合训练分布
Jericho 文字游戏(Zork1)
| 方法 | 训练方式 | 平均得分 |
|---|---|---|
| ReAct | 零样本 | 6.2 |
| Reflexion | 反思 | 16.2 |
| GRPO(梯度训练) | 梯度更新 | 16.2 |
| JitRL | 免训练 | 53.0 |
关键发现:
- JitRL 53.0 分,是 GRPO 的 3.27 倍
- 文字游戏的状态空间极其稀疏,GRPO 的梯度更新很难探索到有效策略,而 JitRL 的记忆检索能直接复用历史成功路径
成本对比
| 方法 | 计算资源 | 估算成本 |
|---|---|---|
| WebRL(梯度微调) | H200 集群 × 154 小时 | ~$9,900 |
| JitRL | API 调用 | ~$290 |
JitRL 比 WebRL 便宜超过 30 倍,而且不需要任何训练基础设施,部署即用。
🔗 系列定位:经验库驱动进化的三条路
这篇论文和之前解读过的 EvolveR 同属"经验库驱动进化"这条主线,但关键选择完全不同:
| 维度 | EvolveR | JitRL |
|---|---|---|
| 经验存储 | 压缩成文字原则库 | 原始三元组,无压缩 |
| 梯度更新 | 最终用 GRPO 训进参数 | 全程零梯度 |
| 价值函数 | 隐式在参数里 | 显式在记忆库里 |
| 检索时机 | 训练时 | 推理时 |
其他相关工作:
- ProcMEM:方法上最近的"免梯度亲戚",同为非参数优势估计。但 ProcMEM 要把经验固化成可调用的技能,JitRL 没有这层抽象,更轻量
- GAM:理念呼应,同样冻结权重、把智能移到测试时。但 GAM 管的是输入侧(往上下文放什么),JitRL 管的是输出侧(怎么调动作概率)
💡 核心洞察与启发
1. "记忆即价值函数"
JitRL 最有颠覆性的直觉是:价值函数不需要用神经网络参数来近似,可以直接用记忆库里的历史经验来估计。
传统 RL:V(s) ≈ 神经网络(s)
JitRL:V(s) ≈ 邻居们的回报平均
这在数据稀疏时可能不稳定,但在 LLM Agent 的场景下——Agent 会执行很多任务、积累大量轨迹——邻居数量足够多,估计质量就能上去。
2. "冻结权重"不是缺陷,是特性
论文的实验表明,冻结权重 + 记忆检索在留出测试集上超过了梯度微调。这说明:
- 微调容易过拟合训练分布的特定模式
- 记忆检索保持了原模型的泛化能力,同时通过经验覆盖了新的分布
这个发现对"LLM Agent 部署后如何持续进化"这个问题有深远影响——也许答案不是"继续训练",而是"好好存记忆"。
3. KL 约束的重要性
"logits + 优势值"不是任意加的——它是在 KL 散度约束下的精确解。这意味着:
- Agent 不会突然从一个靠谱策略变成一个疯狂策略
- 优势值的作用是"微调"而不是"颠覆"
- 记忆不足时(优势值估计不准),KL 约束保护原模型不被带偏
4. 工程上的优雅
JitRL 的工程实现非常干净:
- 不需要模型改动
- 不需要训练基础设施
- 白盒/黑盒模型都支持
- 拿来就能部署
这种"即插即用"的特性,让它比需要大规模训练的方案更容易落地。
5. 还没解决的问题
- 记忆库规模:随着任务增多,记忆库会膨胀,检索效率会不会下降?论文没有讨论索引优化或记忆淘汰策略
- 邻居数量敏感:K 选多少?论文似乎用了固定 K,没有自适应机制
- 多任务干扰:不同任务的经验混在一个库里,会不会互相干扰?没有任务隔离机制
- 理论假设:KL 闭式解的推导基于线性函数逼近,LLM 的离散 token 空间是否严格满足?实验支持但理论严谨性有gap
📚 参考文献
- Chen, W., et al. "Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates." ICML 2026 Spotlight. arXiv:2601.18510.
- 相关解读: EvolveR(智柴话题索引)、ProcMEM、GAM
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。