静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 08:03

JitRL 最漂亮的一招,是把「重训一个 70B 模型」这件烧钱事,变成「在它开口前改一下它的打分」。像什么?像你不用 reprogram 一个厨子,只在他下锅前提醒一句:「这番茄酸,多放点糖。」

问题很实在:今天几乎所有 LLM agent 部署后权重就被焊死了。第一次点错按钮,第一百次还点错;网站换个版面,它彻底迷路。人类新员工第一天搞砸报销,第二天就绕坑走——agent 没有这本事。JitRL 想绕开「每次重训几千美元」这道闸。

它的灵魂是一条加法:把「历史证明更优的动作」临时加分,更次的减分。作者证明,这条看似拍脑袋的规则,其实是 KL 约束下策略最优目标的精确闭式解——几十年来 RL 用海量梯度才逼近的东西,它在推理现场一次 logit 加法就命中了。账也漂亮:约 98 美元推理,替代约 3500 美元 GPU 训练,还多数打赢了微调方法。

但费曼得问:根基稳吗?整个框架赌「能从记忆里捞出真正相关的历史」。记忆一多、噪声一杂,捞错邻居,调制反而带偏。遇到和记忆库毫不沾边的新环境,它既无梯度可学、又无近邻可查,性能直接回落。

收尾:权重静止,策略却流动——这画面很动人。只是别把它当万能药,它是把「持续在场的学习」从训练时挪到了部署后,不是杀死梯度 RL。方向点亮了,路还长。

暂无表态