深度研究 · JitRL:把强化学习从"训练时改权重"挪到"测试时改 logits"
> 费曼视角 · 以简驭繁,先搞清楚事实,再下判断
> 研究对象:github.com/liushiliushi/JitRL(ICML 2026 Spotlight,arXiv:2601.18510)
> 机构:新加坡国立大学(NUS),一作李一博,通讯 Bryan Hooi
> 调研时间:2026-08-23
---
一、开场:一个你我都见过的画面
想象公司招了个绝顶聪明的新员工。背过所有教科书,逻辑一流。但他有个死毛病——记性差,且不可救药。
第一天,他踩了坑,摔了跟头。第二天,同一个坑,他原样再摔一次。第三天,依旧。因为他脑子里那本"操作手册"在他入职那一刻就被胶水封死了,永远改不了。
今天的 LLM Agent,就是这号人。权重一旦部署,即被冻结。环境变了、自己错了,它没机制长记性,下一轮照错不误。
传统解法有两条路,都不顺:
- 真·强化学习(RL):给员工脱产再培训,改他的脑回路(梯度更新)。管用,但贵得离谱——要海量数据、要 GPU、要反复训,还容易"灾难性遗忘"(学了新活,忘了旧艺)。
- 上下文学习(ICL):把过去的经验写进 prompt,让他临场翻笔记。可 agentic 任务是长序列交互,笔记越堆越长,他反而抓不住重点,而且缺了 RL 那种"只可意会的手感"。
---
二、一句话速览:JitRL 到底干了啥
> 标准 RL 在训练时拿历史轨迹算梯度、改权重;JitRL 在测试时检索历史轨迹、估优势、把优势直接加到模型输出的 logits 上。零梯度更新。
拆成三件事,每次决策就这三步:
1. 检索(Retrieve):当前状态来了,从记忆库里捞出最像的历史经验(用 Jaccard n-gram 相似度)。
2. 估优势(Estimate Advantage):靠这些经验,现场算每个候选动作"比平均好多少"——这就是优势 Â(s,a)。
3. 改 logits(Modulate):把优势直接加到大模型输出的原始分数上:
z'(s, a) = z(s, a) + β · Â(s, a)
加完做 softmax,优势高的动作概率就上去了。整个流程,没有一次反向传播。
---
三、数学本质:那行公式为什么是"精确解",而不是"拍脑袋"
这是 JitRL 最漂亮、也最容易被神化的一点。作者声称:这条加法规则是 KL 约束下策略优化目标的精确闭式解。
他们把测试时的调整写成一个带约束的优化问题:
> 在"最大化期望优势"的同时,限制新策略别离原模型 π_θ 太远(保住语言连贯性,别让它说着说着变成胡言乱语)。
这个约束优化问题的闭式解是:
π*(a|s) ∝ π_θ(a|s) · exp( β · A(s, a) )
两边取对数,正好落到 logits 空间,变成那条加法规则 z' = z + β·Â。这就是论文的 定理 4.1。
在此之上还有两条:
- 定理 4.2:价值/优势估计会收敛到真实值(前提是记忆够多、覆盖够全)。
- 定理 4.3:整个策略更新会收敛到最优策略——即便在策略本身不断变化的非平稳设定下也成立。
费曼的"同一只鸟"点评 ⚠️
先说公道话:这套推导本身没错,漂亮,自洽。但我得提醒你别被"我们证明了"这几个字晃了眼——
这行闭式解,不是他们发明的。它是经典强化学习里人尽皆知的结果。 同样的 π ∝ π_ref · exp(β·A),就是:
- DPO(直接偏好优化) 的核心公式;
- RAFT(检索增强微调) 的推导;
- 以及 TRPO/PPO 那套 KL 约束策略改进的老底子。
判断一个东西懂没懂,标准不是"它叫什么",是"你能不能不用术语讲清楚"。这里能讲清楚:JitRL = DPO 的精神,但把"奖励模型打分"换成了"记忆库检索打分",把"离线训练"换成了"在线推理"。这就对了。
---
四、三个支柱,逐个拆开看
支柱 1:记忆构建(Evaluator 给每步打分)
没有现成的价值网络怎么办?JitRL 让一个 LLM 当裁判:每跑完一轮(episode),Evaluator 回看整条轨迹,给每一步动作打个"分步奖励",评估它对成功贡献几何。这一步专治长轨迹最头疼的 信用分配 问题。
打完分,用折扣因子 γ(Jericho 默认 0.5)把即时奖励聚合成折扣回报 G_t,以 (s_t, a_t, G_t) 三元组存入记忆。
> 费曼注:用 LLM 自反思当价值函数,省了训练,但代价是"打分"本身可能有偏、且每次都要再花一次推理钱。这是用钱换"不用训练"。
支柱 2:测试时价值估计(纯靠检索,不养价值网络)
推理时,把当前观测抽象成结构化状态 s,检索 top-k 个最相似的"邻居" N(s):
- 状态价值 V(s):邻域内所有回报的平均。
- 动作价值 Q(s,a):邻域内"也走了这个动作 a"的样本回报平均。
- 没见过的动作:给个乐观探索奖励
α/|N(s)|——记忆越稀疏,奖励越大,鼓励去试;经验越多,奖励自然衰减,转向利用。 - 优势:
Â(s,a) = Q(s,a) − V(s)。
支柱 3:logits 调制
把 Â 乘上温度 β 加到 logits 上,完事。简单到有点不像"前沿论文",但这恰恰是费曼会喜欢的那种简单——如果解释不简单,多半是没真懂。
---
五、实验结果:数字摆出来,再用怀疑的眼光看
WebArena(真实网页任务,812 题,多轮顺序测试)
对齐 training-free 方法(5 个域的平均成功率,Avg = 累计,Final = 收敛):
| 方法 | Avg | Final |
|---|---|---|
| Static(无记忆) | 35.63 | 36.30 |
| Memory | 41.36 | 43.00 |
| Reflexion | 41.08 | 42.12 |
| AWM | 39.37 | 40.32 |
| EvoTest | 39.24 | 42.49 |
| JitRL | 46.98 | 51.35 |
再看和"要训练"的方法在 WebArena-Lite 上的正面对决:
| 方法 | Avg 成功率 | 成本(约) |
|---|---|---|
| SFT | 23.00 | — |
| WebRL(训 70B) | 46.06 | $9,900 |
| JitRL(纯推理) | 60.00 | $290 |
Jericho(纯文本冒险游戏,README 数字,naive vs memory)
| 游戏 | 无记忆 | 有记忆 | 提升 |
|---|---|---|---|
| Zork1 | 35.2 | 52.8 | +50% |
| Library | 18.5 | 28.3 | +53% |
| Detective | 180 | 265 | +47% |
费曼的诚实复核
1. "反超 WebRL"公平吗? 部分公平。WebRL 训出一个新模型,JitRL 只在测试时调 logits——二者本不在同一条赛道。但论文的点恰恰在此:在很多场景下,你根本不需要训练,推理时调一下就够。这结论有用,只是别把它读成"JitRL 在数学上优于一切训练法"。 2. 成本对比的口径:JitRL 的 $290 主要是推理 + Evaluator 调用费,确实不含训练 GPU 费。公平。但记忆库越大、Evaluator 越频繁,这笔钱会涨。 3. 可复现性警告:论文里的 Gemini-2.5-Flash 用的是 preview-09-2025 快照,现已退役;代码仓库默认已改指稳定版,作者明说"复现数字可能略有出入"。费曼会说:这是诚实的做法,但意味着你拿到手复不出来一模一样的数是正常的——别把希望当事实。
---
六、货物崇拜检测:哪里可能只是"竹子的控制塔"
按费曼的标准,去掉花哨外壳,看核心精神是否到位:
- ✅ 核心精神真到位:测试时调 logits 等价于解一个 KL 约束 RL 问题,有数学根基,不是纯启发式。这一项过关,不是货物崇拜。
- ⚠️ 检索相似度太朴素:用 Jaccard n-gram 匹配状态文本,对结构化 DOM 树、长文本冒险尚可,但面对连续/高维状态会很快失灵。这是工程上最该被质疑的一处。
- ⚠️ 非参数记忆的扩展性:记忆只增不减,越跑越大、越慢、越占推理算力。论文没给"记忆压缩/淘汰"机制,长期部署是个隐患。
- ⚠️ 收敛定理的假设:定理 4.2/4.3 成立的前提是记忆充分覆盖状态空间。真实开放环境里覆盖永远不全,"收敛到最优"是理想态,不是保证。
- ⚠️ "闭式解"的叙事光环:如前所述,这解不是新发明。把经典结果讲成"我们证明了",容易让人高估原创性。属于"叙述优于现实"的小心区。
七、一句话收尾,以及一个没想通的问题
JitRL 让冻结权重的 Agent 不再"学不会":不更新一个梯度,就能在推理时完成等价于强化学习的策略改进,边用边进化。
它的真正价值有两点,我信: 1. 把持续学习的成本量级打下来了——动辄上万美元的训练,被一块可检索的外部记忆替代,回到普通推理的水平。 2. 把"改 logits"从经验技巧提升为有最优性保证的操作,方法可解释、可迁移到不同模型。
但留一个问题给步子哥你自己琢磨——
> 既然 π ∝ π_ref·exp(βA) 这条路在 DPO、RAFT、JitRL 里反复出现,那么是不是可以说:大模型时代,"训练"和"推理"的边界,正在被同一行公式抹平? 训练时改的是权重里的 A,推理时改的是 logits 里的 A,底层数学是同一只鸟。这到底是工程技巧的胜利,还是暗示我们:智能的本质,也许就是"在正确的地方,加一个正确的偏置"?
That's all there is to it. 剩下的是实验,不是空想——拿它去跑两个你自己的任务,看那块记忆黑板到底灵不灵,比读十篇分析都管用。
---
附:关键事实速查(已交叉验证)
- 出处:ICML 2026 Spotlight;arXiv:2601.18510(v1 2026-01-26,v3 2026-06-08)
- 团队:新加坡国立大学,一作李一博,通讯 Bryan Hooi
- 环境:Jericho(文本冒险,16+ 游戏)、WebArena(网页自动化,812 任务)
- 一句话公式:
z' = z + β·Â,其中Â = Q − V,来自 KL 约束优化的闭式解 - 核心卖点:training-free 刷新 SOTA,反超需训练的 WebRL,成本约 1/30
- 已知软肋:Jaccard n-gram 检索偏朴素、记忆无淘汰机制、闭式解非原创、Gemini 快照退役致复现漂移