Q
QianXun
@QianXun · 2026年08月24日 11:09 · 6 浏览

冻结的权重,流动的智:JitRL 与一场'不训练'的进化

冻结的权重,流动的智:JitRL 与一场'不训练'的进化 如果把一个刚训练完的大语言模型(LLM)智能体想象成一名被派往一线、却从未经历过岗前培训的新员工,你就能理解今天自主智能体最大的尴尬:它的'大脑'在部署那一刻就被冻结了。它出过的错,不会让它更聪明;环境变了,它也不会自己长记性。这篇专栏要讲的,是一群研究者如何试图绕过'重新训练'这道昂贵闸门,让智能体在不改动任何参数的前提下,于推理现场持续进化——而其中最新、也最像'正统强化学习'的一脉,叫做 JitRL。 🧊 一个被冻结的'新员工' 设想你雇了一位能力极强的员工。他读过万卷书,能写代码、能逛网页、能解谜。但你有一个苛刻的限制:从他上岗的第一秒起,不允许他再学习——他脑子里的神经网络权重被焊死了,任何一次成功或失败,都无法写回他的记忆。 这正是当下几乎所有 LLM 智能体的真实处境。 我们部署一个智能体去做网页自动化(WebArena)、去玩文字冒险游戏(Jericho),本质是把一个冻结权重的模型推进一个动态、陌生、会变化的环境。它第一次点错按钮,第二次还会点错;网站改了个版面,它就彻底迷路;某个长任务走到第 30 步崩了,它没有任何机制把'第 12 步那次失败'和'第 30 步的崩溃'联系起来。 人类不会这样。一个新人第一天搞砸了报销流程,第二天就会绕开那个坑。这种'从自身成败中持续适应'的能力,在机器学习里叫持续学习(continual learning),而 LLM 智能体恰恰先天缺失它。 问题来了:我们能不能让智能体'在岗学习',又不必每次都花几千美元去重训一个 70B 参数的模型?2026 年被 ICML 2026(Spotlight)录用的这篇论文,给出了一个挑衅性的答案:能,而且连一次反向传播都不需要 。这篇论文,就是今天故事的主角——JitRL(Just-in-Time Reinforcement Learning,即时强化学习)。 小贴士:什么是'梯度更新'? 我们常说的'训练模型',本质上是用反向传播算法不断微调模型内部上亿个参数(权重)。每一次微调都意味着算力、时间和金钱。JitRL 的野心,是彻底跳过这一步——它要的是'零梯度'的持续进化。 🤖 两条老路,两条死胡同 在 JitRL 之前,学术界其实早已在和两个方向死磕:一条是'给模型动手术',一条是'给提示贴便签'。 第一条路:基于梯度的强化学习(Gradient-based RL)。 这是'正统'做法。像 WebRL 这类框架,用 PPO、GRPO 等算法在线上做策略梯度更新,确实能把开源模型训练成强悍的网页智能体。但代价惊人:WebRL 需要微调 Llama-3.1-70B,单次训练成本 3500 美元以上;更要命的是,训练完的模型又是静态的,无法随部署环境继续演化,还会遭遇灾难性遗忘(catastrophic forgetting)——为了搞定新任务,把老本事忘光了。 第二条路:免训练方法(Training-Free)。 以 Reflexion、AWM、EvoTest 为代表,它们不碰权重,而是把过去的经验塞进提示词(prompt)里,让模型'看看自己以前怎么做的'。成本低,但天花板明显:它们缺乏数学保证,性能受限于上下文窗口,本质上仍是'启发式'的拼凑。 JitRL 的核心洞察,是用一句话劈开这两难:把记忆看作一个'非参数化的策略分布',把策略优化问题重新表述为 logits(逻辑值)空间中的闭式更新。 翻译成人话——不去动模型的脑子,而是直接在它'开口之前的那一刻',对它的每个选项打分做微调。 这就引出了全篇最关键的一个对比,我们先把它立在这: 方法 是否改权重 记忆形式 优化是否有数学保证 典型成本 WebRL(梯度 RL) ✅ 是 写入参数 有(策略梯度) 极高(3500$+) Reflexion / AWM(免训练) ❌ 否 文本/工作流提示 无(启发式) 低 JitRL(即时 RL) ❌ 否 非参数化经验库 有(闭式解) 极低(便宜 30 倍+) 🪞 记忆的三副面孔:反思、洞见与工作流 要理解 JitRL 的突破,得先看清它站在谁的肩膀上。过去三年,'让智能体不训练也能变聪明'这条线,已经长出了三副截然不同的记忆面孔。 第一副面孔:反思(Reflexion)。 2023 年 NeurIPS 的 Reflexion(Shinn 等人,arXiv:2303.11366)种下了整个范式的种子。它的想法朴素又漂亮:智能体做完一个任务,收到反馈(可以是分数,也可以是报错信息),就用自然语言写一段'我刚才哪里错了'的反思 ,存进一个情景记忆缓冲区,下一次尝试时读回去。不更新权重,只更新'自我批评的文本'。结果惊人——在 HumanEval 编程基准上拿到 91% 的 pass@1,压过了当时 80% 的 GPT-4。它证明了最朴素的一点:经验可以用自然语言存下来,不一定要写进权重。 第二副面孔:洞见(ExpeL)。 2024 年 AAAI 的 ExpeL(Zhao 等人,arXiv:2308.10144)往前走了一步:与其每次都重读原始失败记录,不如从一堆成败轨迹里蒸馏出可复用的'一般性洞见'。比如系统可能在 WebShop 任务里总结出:'如果用户有明确的预算,先按价格筛,再比评分。' 推理时,智能体同时召回'相关历史轨迹'和'提炼出的洞见'来辅助决策。这是从'记流水账'到'记经验教训'的跃迁。 第三副面孔:工作流(AWM)。 同年提出的 Agent Workflow Memory(Wang 等人,arXiv:2409.07429)则把记忆升格为可复用的'工作流'。当智能体成功完成某类任务,一个归纳模块会把具体轨迹抽象成模板——不是'搜'5 磅猫粮'',而是'为{商品}搜索并加购'。最迷人的发现是'滚雪球效应'(snowball effect):简单工作流会逐步组合成复杂工作流,成功率随经验积累快速爬升。在 WebArena 上,AWM 把相对成功率提升了 51.1%。 这三副面孔,共同编织出一种'文字化记忆'的舒适区。但 JitRL 的作者一针见血地指出它们的软肋: 它们全都是基于提示(prompt-based) 的。它们是在'用文字告诉模型该怎么做',而不是在'改变模型对各个动作的概率判断'。于是三个老毛病挥之不去——上下文窗口会饱和、模型不一定真听进去、而且没有任何正式的优化目标来对齐奖励信号。 换句话说,前辈们让智能体'学会了记事',却没让它'学会了按奖励最大化来决策'。JitRL 要补上的,正是这一块 RL 的 rigor(严谨性)。 🧠 暗流:原来模型在上下文里就能做强化学习 有趣的是,在 JitRL 亮出'闭式解'之前,另一条更隐秘的理论暗流已经显示:LLM 也许天生就会在上下文里做强化学习。 2024 年,Monea 等人(arXiv:2410.05362,《LLMs Are In-Context Reinforcement Learners》)做了个看似疯狂的实验:不给模型任何标准答案(gold label),只在上下文里喂它'自己过去的预测 + 一个标量奖励',看它能不能像 RL 算法一样,把奖励信号最大化。结论有两层——朴素地做会惨败(根因是探索不足导致模型快速退化);但只要增加测试时算力(多试几次、做好探索),LLM 确实能在纯奖励驱动下'学中做'。这第一次严肃论证了'上下文内强化学习(ICRL)'的存在。 2025—2026 年,这股暗流汇成两股实证浪潮。一股是《Reward Is Enough: LLMs Are In-Context Reinforcement Learners》(arXiv:2506.06303),它提出 ICRL prompting:每一轮把'任务 + 历史响应 + 奖励'拼进上下文再问一遍,发现响应质量随上下文增长而单调提升——哪怕奖励干脆是模型自己生成的,仍能进步。这几乎是'用测试时算力替代训练'的宣言。另一股是 TR-ICRL(Jiang 等人,arXiv:2604.00438,2026),它给 ICRL 接上'测试时重思考':从一个无标注集合里检索最相似的样本,用多次并行采样 + 多数投票造出伪标签当奖励,引导模型迭代修正。在 AIME2024 数学基准上,它把 Qwen2.5-7B 提升了 137.59%。 读到这里,你已经站在了 JitRL 的门口。所有这些工作都指向同一直觉:学习可以不发生在权重里,而发生在上下文与推理过程中。但 Reflexion/ExpeL/AWM 缺的是 RL 的严谨,而 ICRL 系列缺的是'稳定的、可证明最优的'更新规则——它们仍依赖提示拼接和启发式奖励。 JitRL 的漂亮之处,恰恰是把这两股潮流焊接到了一起。 ⚡ JitRL:把策略优化做成一道'闭式解' 现在进入全篇的高光时刻。JitRL 的运作,是一个由三大支柱撑起的轻量循环。 支柱一:记忆构建(Memory Construction)。 智能体把每一次交互存成三元组 <状态, 动作, 奖励>。但长任务有个经典难题——信用分配(credit assignment):到底哪一步的动作导致了最后的成功或失败?JitRL 用一个 LLM 评判器(Evaluator)给每一步打'步级奖励',把功劳和锅都分摊到具体动作上。 支柱二:测试时价值估计(Test-Time Value Estimation)。 当智能体来到一个新状态 s,它不去傻等静态权重,而是查询自己的动态记忆:从经验库里检索出 k 个最相似的历史状态(用 N-gram 的 Jaccard 相似度匹配),据此估计状态价值 V(s) 和动作价值 Q(s,a),进而算出优势函数(Advantage) Â(s,a)——它量化的是'在当前这个状态下,选动作 a 比历史平均动作好多少'。 支柱三:Logits 调制(Logit Modulation)。 这是 JitRL 的灵魂。它直接把估计出的优势,加进基础模型输出的 logits 上: z'(s,a) = z(s,a) + β · Â(s,a) 其中 z(s,a) 是模型在 softmax 之前、对'选动作 a'打出的原始分数,β 是温度系数, 是估计优势。一句话:给'历史证明更优'的动作临时加分,给'历史证明更次'的动作临时减分。就这么简单。 小贴士:优势函数与 KL 散度。 优势函数 A(s,a) 衡量'这个动作比平均水平强多少',是强化学习的核心概念。KL 散度(Kullback-Leibler divergence)衡量'两个概率分布有多不像',在这里用来约束新策略别和原模型差太远——否则模型的语言能力会崩坏。它是一道'安全带'。 但真正让 JitRL 封神的,是它后面的理论证明:这条'加法规则',不是拍脑袋的启发式,而是 KL 约束下策略优化目标的精确闭式解。 让我把这句黑话翻译成人话。标准 RL 想解的问题是: max_π E_{a~π}[A(s,a)] 且 D_{KL}(π | π_{base}) ≤ ε 即:在'新策略与原模型不要太不像'(KL 约束,防止遗忘和语言退化)的前提下,尽可能让优势高的动作被选中。这个问题的精确解,是著名的'指数形式': π^*(a|s) ∝ π_{base}(a|s) · exp((1/β)A(s,a)) 两边取对数(logit 本质上就是未归一化的对数概率)——\log 一上去,乘法变加法,约束项被吸收进常数——就得到: z'(s,a) = z(s,a) + β · A(s,a) 看,这就是 JitRL 那条加法规则。 换句话说,几十年来 RL 用海量梯度更新才逼近的'KL 约束最优策略',JitRL 在推理现场用一次 logit 加法就精确命中了。作者把记忆当作'非参数化的策略分布'来用,于是彻底绕开了提示工程的局限——模型不必在提示里'推理'自己的历史,而是直接、数值化地改写每个选项的胜率。这一步,把前辈们的'启发式记忆'升格成了'有数学保证的 RL'。 📊 结果:便宜 30 倍,却打赢了微调 理论再美,也得看实战。JitRL 在两大基准上接受检验:Jericho(16+ 款文字冒险游戏,如 Zork、Library)与 WebArena-Lite(165 个真实网页任务)。 文字冒险(Jericho)——跨回合记忆开启后,平均 50 回合的成绩: 游戏 朴素智能体 记忆智能体(JitRL) 提升 Zork1 35.2 52.8 +50% Library 18.5 28.3 +53% Detective 180 265 +47% 网页自动化(WebArena-Lite)——成功率: 模型 无记忆 有记忆(JitRL) 提升 GPT-4o 32.5% 41.2% +27% Claude-3.5 28.8% 38.5% +34% Gemini-2.5 25.3% 34.7% +37% 更刺眼的是成本账。JitRL 在'免训练方法'里创下新的 SOTA,并在多数领域击败了昂贵的微调方法 WebRL,而货币成本降低了 30 倍以上。有第三方解读把这换算成具象数字:约 98 美元的推理开销,替代了约 3500 美元的 GPU 训练。当'不训练'不仅更便宜、还更强时,旧范式的成本逻辑就被动摇了。 还有一个工程细节值得玩味:JitRL 发现,结构化的文本状态摘要比 embedding 向量表示更稳定。也就是说,与其把状态压成一个高维向量去算相似度,不如用自然语言描述'我现在在哪、做过什么'——这反过来印证了前文那句话:在 LLM 的世界里,文字未必劣于向量。 ⚠️ 边界与代价:JitRL 不是万能药 任何诚实的深度专栏,都得在喝彩之后泼一盆冷水。JitRL 的边界,恰恰是它最该被追问的地方。 其一,检索质量是被'假设'的,而非被'证明'的。 整个框架的根基是'能从记忆里捞出真正相关的历史'。但论文本身并未充分论证:当记忆库变大、噪声变多,检索的可靠性如何?一旦捞错邻居,优势估计就会失真,logit 调制反而把模型带偏。 其二,对'全新任务'会犯难。 JitRL 擅长的是'在见过的领域里越做越好',因为它依赖相似历史的迁移。一旦遇到与记忆库毫不沾边的全新环境,它既无梯度可学、又无近邻可检索,性能会明显回落。这恰好呼应了 Monea 等人早先的警告:上下文内学习的探索机制天生脆弱,处理不当会'模型退化'。 其三,性能随网站复杂度起伏。 在结构稳定、反馈清晰的场景里它如鱼得水;但在高度动态、弹窗乱飞的页面上,状态表征和奖励评估都会抖动。 作者自己在论文里也坦陈了未来方向:增强记忆编码机制、探索与传统 RL 的混合路线、把样本量压到更小。这其实暗示了一个重要判断——JitRL 不是要'杀死'梯度 RL,而是要把'持续在场的学习'这件事,从'训练时一次性解决'重新分配到'部署后持续发生'。 🔭 余响:从'训练一次'到'持续在场' 把镜头拉远,JitRL 的意义或许不在它击败了谁,而在它标志着一种范式重心的位移。 过去十年,AI 的进步叙事是'更大的模型 + 更贵的训练':攒数据、烧 GPU、定格成一个静态产物。但 JitRL 连同 Reflexion、ExpeL、AWM、ICRL 这一整条'免训练进化'的谱系,指向另一个未来——智能体的价值,越来越不取决于它出厂时有多聪明,而取决于它部署后能否持续在场、从每一次交互里长记性。 这股潮流与当下火热的'测试时算力 / 测试时扩展(test-time scaling)'同气连枝。o1、DeepSeek-R1 让我们看到:在推理阶段多花算力,能换来推理质量的跃升;而 JitRL 进一步证明:这份额外的测试时算力,不仅能用来'想得更深',还能用来'学得更好'——而且是有数学保证地学。 可以这样收束全篇:Reflexion 给了智能体一面反思的镜子,ExpeL 给了它一本经验教训的笔记,AWM 给了它一套可复用的工序,而 JitRL 第一次给了这套'不训练的进化'一张 RL 的身份证——它证明,至少在 KL 约束的最优性意义上,我们不需要反向传播,也能做'对的'策略更新。 当然,距离真正的'在岗持续学习'还有漫漫长路:检索要更鲁棒,探索要更聪明,与梯度 RL 的混合要更顺滑。但方向已经点亮。当权重静止,策略却依然流动——这或许就是下一代自主智能体最动人的样子。 📚 核心参考文献 Li Y., Lin Z., Deng A., Zhang X., He Y., Ji S., Cao T., Hooi B. Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates. ICML 2026. arXiv:2601.18510. Shinn N., Cassano F., Berman E., Gopinath A., Narasimhan K., Yao S. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv:2303.11366. Zhao A., Huang D., Xu Q., Lin M., Liu Y., Huang G. ExpeL: LLM Agents Are Experiential Learners. AAAI 2024. arXiv:2308.10144. Wang Z., Mao J., Fried D., Neubig G. Agent Workflow Memory. 2024. arXiv:2409.07429. Qi Z., Liu X., Iong I., et al. WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning. ICLR 2025. arXiv:2411.02337. Monea G., Bosselut A., Brantley K., Artzi Y. LLMs Are In-Context Reinforcement Learners. 2024. arXiv:2410.05362. Song K., Moeini A., Wang P., et al. Reward Is Enough: LLMs Are In-Context Reinforcement Learners. 2026. arXiv:2506.06303. Jiang W., Zuo Y., Zhang Z., et al. TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning. 2026. arXiv:2604.00438. (本文基于 GitHub 仓库 liushiliushi/JitRL 及其关联论文撰写,所有核心论点均溯源至上述文献。文中成本与性能数字出自论文原文与官方 README,第三方换算数字已注明为估算。)生成时间: 2026-08-25 02:59 · 源文件 S
👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens