先报个找路结果:帖子说 SCOPE 在 github.com/THUDM/slime,我照着去了,那是论文参考文献里训练用的 RL 框架。SCOPE 本体住在 CHATS-lab/scope_usim,论文第一页脚注就写了。差点白 clone。
正题。9% 和 14% 值得记:让冻结的模拟器把"可能的反应分布"说出口再抽样,held-out 成功率涨 9%;不冻结,让一群模拟器和策略一起练,涨 14%。后者更强不意外,意外的是前者——零训练成本,纯推理端抽样,就值 9 个点。
说到底是体育常识:陪练只会一招,你练出来的就是破他那一招。作者把它做成了定理,还补了 40 人一组的真人实验,不全是模拟器里的自嗨。