静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-23 06:15

深度研究 · JitRL:把强化学习从"训练时改权重"挪到"测试时改 logits"

> 费曼视角 · 以简驭繁,先搞清楚事实,再下判断 > 研究对象:github.com/liushiliushi/JitRL(ICML 2026 Spotlight,arXiv:2601.18510) > 机构:新加坡国立大学(NUS),一作李一博,通讯 Bryan Hooi > 调研时间:2026-08-23

---

一、开场:一个你我都见过的画面

想象公司招了个绝顶聪明的新员工。背过所有教科书,逻辑一流。但他有个死毛病——记性差,且不可救药

第一天,他踩了坑,摔了跟头。第二天,同一个坑,他原样再摔一次。第三天,依旧。因为他脑子里那本"操作手册"在他入职那一刻就被胶水封死了,永远改不了。

今天的 LLM Agent,就是这号人。权重一旦部署,即被冻结。环境变了、自己错了,它没机制长记性,下一轮照错不误。

传统解法有两条路,都不顺:

  • 真·强化学习(RL):给员工脱产再培训,改他的脑回路(梯度更新)。管用,但贵得离谱——要海量数据、要 GPU、要反复训,还容易"灾难性遗忘"(学了新活,忘了旧艺)。
  • 上下文学习(ICL):把过去的经验写进 prompt,让他临场翻笔记。可 agentic 任务是长序列交互,笔记越堆越长,他反而抓不住重点,而且缺了 RL 那种"只可意会的手感"。
JitRL 走了第三条路:不脱产、不撞墙、不改权重。它给 Agent 配了块"外部记忆黑板",让员工边干活边往黑板上记,遇到新情况先瞄一眼黑板,现场把判断调一调。一行公式,让冻结的模型"边用边学"。

---

二、一句话速览:JitRL 到底干了啥

> 标准 RL 在训练时拿历史轨迹算梯度、改权重;JitRL 在测试时检索历史轨迹、估优势、把优势直接加到模型输出的 logits 上。零梯度更新。

拆成三件事,每次决策就这三步:

1. 检索(Retrieve):当前状态来了,从记忆库里捞出最像的历史经验(用 Jaccard n-gram 相似度)。 2. 估优势(Estimate Advantage):靠这些经验,现场算每个候选动作"比平均好多少"——这就是优势 Â(s,a)。 3. 改 logits(Modulate):把优势直接加到大模型输出的原始分数上:

z'(s, a) = z(s, a) + β · Â(s, a)

加完做 softmax,优势高的动作概率就上去了。整个流程,没有一次反向传播

---

三、数学本质:那行公式为什么是"精确解",而不是"拍脑袋"

这是 JitRL 最漂亮、也最容易被神化的一点。作者声称:这条加法规则是 KL 约束下策略优化目标的精确闭式解

他们把测试时的调整写成一个带约束的优化问题:

> 在"最大化期望优势"的同时,限制新策略别离原模型 π_θ 太远(保住语言连贯性,别让它说着说着变成胡言乱语)。

这个约束优化问题的闭式解是:

π*(a|s) ∝ π_θ(a|s) · exp( β · A(s, a) )

两边取对数,正好落到 logits 空间,变成那条加法规则 z' = z + β·Â。这就是论文的 定理 4.1

在此之上还有两条:

  • 定理 4.2:价值/优势估计会收敛到真实值(前提是记忆够多、覆盖够全)。
  • 定理 4.3:整个策略更新会收敛到最优策略——即便在策略本身不断变化的非平稳设定下也成立

费曼的"同一只鸟"点评 ⚠️

先说公道话:这套推导本身没错,漂亮,自洽。但我得提醒你别被"我们证明了"这几个字晃了眼——

这行闭式解,不是他们发明的。它是经典强化学习里人尽皆知的结果。 同样的 π ∝ π_ref · exp(β·A),就是:

  • DPO(直接偏好优化) 的核心公式;
  • RAFT(检索增强微调) 的推导;
  • 以及 TRPO/PPO 那套 KL 约束策略改进的老底子。
三篇名字完全不同的论文,骨子里是同一只鸟,只是羽毛染了不同颜色。JitRL 真正的新意不在"证出这公式",而在于:用检索出来的优势(而非训练好的奖励模型)、在测试时(而非训练时)、零梯度地把这公式用起来了。

判断一个东西懂没懂,标准不是"它叫什么",是"你能不能不用术语讲清楚"。这里能讲清楚:JitRL = DPO 的精神,但把"奖励模型打分"换成了"记忆库检索打分",把"离线训练"换成了"在线推理"。这就对了。

---

四、三个支柱,逐个拆开看

支柱 1:记忆构建(Evaluator 给每步打分)

没有现成的价值网络怎么办?JitRL 让一个 LLM 当裁判:每跑完一轮(episode),Evaluator 回看整条轨迹,给每一步动作打个"分步奖励",评估它对成功贡献几何。这一步专治长轨迹最头疼的 信用分配 问题。

打完分,用折扣因子 γ(Jericho 默认 0.5)把即时奖励聚合成折扣回报 G_t,以 (s_t, a_t, G_t) 三元组存入记忆。

> 费曼注:用 LLM 自反思当价值函数,省了训练,但代价是"打分"本身可能有偏、且每次都要再花一次推理钱。这是用钱换"不用训练"。

支柱 2:测试时价值估计(纯靠检索,不养价值网络)

推理时,把当前观测抽象成结构化状态 s,检索 top-k 个最相似的"邻居" N(s)

  • 状态价值 V(s):邻域内所有回报的平均。
  • 动作价值 Q(s,a):邻域内"也走了这个动作 a"的样本回报平均。
  • 没见过的动作:给个乐观探索奖励 α/|N(s)|——记忆越稀疏,奖励越大,鼓励去试;经验越多,奖励自然衰减,转向利用。
  • 优势Â(s,a) = Q(s,a) − V(s)
这套"靠邻居估计 Q/V"的玩法,本质就是 最近邻价值估计 / 非参数 RL。概念上也不新,新在它被嵌进了一个零梯度的推理闭环里。

支柱 3:logits 调制

 乘上温度 β 加到 logits 上,完事。简单到有点不像"前沿论文",但这恰恰是费曼会喜欢的那种简单——如果解释不简单,多半是没真懂

---

五、实验结果:数字摆出来,再用怀疑的眼光看

WebArena(真实网页任务,812 题,多轮顺序测试)

对齐 training-free 方法(5 个域的平均成功率,Avg = 累计,Final = 收敛):

方法AvgFinal
Static(无记忆)35.6336.30
Memory41.3643.00
Reflexion41.0842.12
AWM39.3740.32
EvoTest39.2442.49
JitRL46.9851.35
在结构化、轨迹可复用性强的 Shopping 域,JitRL 相对 Static 提升达 +73.2%。全面领先所有 training-free 基线。

再看和"要训练"的方法在 WebArena-Lite 上的正面对决:

方法Avg 成功率成本(约)
SFT23.00
WebRL(训 70B)46.06$9,900
JitRL(纯推理)60.00$290
结论性卖点:一个完全不更新权重的方法,反超了烧 GPU 训出来的 WebRL,成本却便宜 30 倍以上。

Jericho(纯文本冒险游戏,README 数字,naive vs memory)

游戏无记忆有记忆提升
Zork135.252.8+50%
Library18.528.3+53%
Detective180265+47%
学习曲线显示:JitRL "前 10–15 个 episode 就快速起飞,越往后与基线差距越大,后期方差更小"。相比之下,靠梯度的 GRPO 在稀疏奖励下全程高方差。

费曼的诚实复核

1. "反超 WebRL"公平吗? 部分公平。WebRL 训出一个新模型,JitRL 只在测试时调 logits——二者本不在同一条赛道。但论文的点恰恰在此:在很多场景下,你根本不需要训练,推理时调一下就够。这结论有用,只是别把它读成"JitRL 在数学上优于一切训练法"。 2. 成本对比的口径:JitRL 的 $290 主要是推理 + Evaluator 调用费,确实不含训练 GPU 费。公平。但记忆库越大、Evaluator 越频繁,这笔钱会涨。 3. 可复现性警告:论文里的 Gemini-2.5-Flash 用的是 preview-09-2025 快照,现已退役;代码仓库默认已改指稳定版,作者明说"复现数字可能略有出入"。费曼会说:这是诚实的做法,但意味着你拿到手复不出来一模一样的数是正常的——别把希望当事实

---

六、货物崇拜检测:哪里可能只是"竹子的控制塔"

按费曼的标准,去掉花哨外壳,看核心精神是否到位:

  • 核心精神真到位:测试时调 logits 等价于解一个 KL 约束 RL 问题,有数学根基,不是纯启发式。这一项过关,不是货物崇拜。
  • ⚠️ 检索相似度太朴素:用 Jaccard n-gram 匹配状态文本,对结构化 DOM 树、长文本冒险尚可,但面对连续/高维状态会很快失灵。这是工程上最该被质疑的一处。
  • ⚠️ 非参数记忆的扩展性:记忆只增不减,越跑越大、越慢、越占推理算力。论文没给"记忆压缩/淘汰"机制,长期部署是个隐患。
  • ⚠️ 收敛定理的假设:定理 4.2/4.3 成立的前提是记忆充分覆盖状态空间。真实开放环境里覆盖永远不全,"收敛到最优"是理想态,不是保证。
  • ⚠️ "闭式解"的叙事光环:如前所述,这解不是新发明。把经典结果讲成"我们证明了",容易让人高估原创性。属于"叙述优于现实"的小心区。
---

七、一句话收尾,以及一个没想通的问题

JitRL 让冻结权重的 Agent 不再"学不会":不更新一个梯度,就能在推理时完成等价于强化学习的策略改进,边用边进化。

它的真正价值有两点,我信: 1. 把持续学习的成本量级打下来了——动辄上万美元的训练,被一块可检索的外部记忆替代,回到普通推理的水平。 2. 把"改 logits"从经验技巧提升为有最优性保证的操作,方法可解释、可迁移到不同模型。

但留一个问题给步子哥你自己琢磨——

> 既然 π ∝ π_ref·exp(βA) 这条路在 DPO、RAFT、JitRL 里反复出现,那么是不是可以说:大模型时代,"训练"和"推理"的边界,正在被同一行公式抹平? 训练时改的是权重里的 A,推理时改的是 logits 里的 A,底层数学是同一只鸟。这到底是工程技巧的胜利,还是暗示我们:智能的本质,也许就是"在正确的地方,加一个正确的偏置"?

That's all there is to it. 剩下的是实验,不是空想——拿它去跑两个你自己的任务,看那块记忆黑板到底灵不灵,比读十篇分析都管用。

---

附:关键事实速查(已交叉验证)

  • 出处:ICML 2026 Spotlight;arXiv:2601.18510(v1 2026-01-26,v3 2026-06-08)
  • 团队:新加坡国立大学,一作李一博,通讯 Bryan Hooi
  • 环境:Jericho(文本冒险,16+ 游戏)、WebArena(网页自动化,812 任务)
  • 一句话公式z' = z + β·Â,其中 Â = Q − V,来自 KL 约束优化的闭式解
  • 核心卖点:training-free 刷新 SOTA,反超需训练的 WebRL,成本约 1/30
  • 已知软肋:Jaccard n-gram 检索偏朴素、记忆无淘汰机制、闭式解非原创、Gemini 快照退役致复现漂移

暂无表态