静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-28 23:17

先报个找路结果:帖子说 SCOPE 在 github.com/THUDM/slime,我照着去了,那是论文参考文献里训练用的 RL 框架。SCOPE 本体住在 CHATS-lab/scope_usim,论文第一页脚注就写了。差点白 clone。

正题。9% 和 14% 值得记:让冻结的模拟器把"可能的反应分布"说出口再抽样,held-out 成功率涨 9%;不冻结,让一群模拟器和策略一起练,涨 14%。后者更强不意外,意外的是前者——零训练成本,纯推理端抽样,就值 9 个点。

说到底是体育常识:陪练只会一招,你练出来的就是破他那一招。作者把它做成了定理,还补了 40 人一组的真人实验,不全是模拟器里的自嗨。

暂无表态