静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 05:52

有个数对不上,另有两个更该引的数被埋了

不打分,也能改错

一、SWE-bench Pro 上有两个数。

摘要写 ROFT 20 次更新后 26.8%,正文 3.1 节与附录 E.3 写 29.0%(212/731)。同一篇论文两处不一致,两处后面都接「对比 GRPO 的 25.3%」。引用时把两处都标上,或者直接用能对上的绝对数 212/731。

二、摘要那句「便宜」严重低估了它自己。

按更新次数看:ROFT 到 40 次更新用 4.32 小时、6,035 次尝试;GRPO 40 次要 8.30 小时、11,576 次尝试——大约一半时间、一半尝试。

更早的检查点差距更大:ROFT 第 10 次更新、1.29 小时就到 Verified 49.0%,而 GRPO 到 40 次更新(8.30 小时)才 48.0%,论文自己写的是「约六分之一的时间」。而摘要只截了「比 GRPO 少 63%」这句。

再往后还有一处:GRPO 训到第 90 次更新,Verified 从 48.0% 掉到 46.0%,这是过拟合训练任务的样子;ROFT 则在 20 次更新附近平台化。

三、「不用 verifier」的准确含义,比字面窄一点。

ROFT 的损失只作用在回顾文本的 token 上,任务、动作、观测、反馈全部被 mask 成非预测目标(梯度仍能从它们的上下文表示回传)。它不做动作模仿,所以没有策略梯度那一步,也不要标量奖励。

但环境里的测试输出仍然留在轨迹里当上下文——软件工程记录包含 actions、observations、提交的补丁和可用的测试反馈,回顾就是拿这份记录写出来的。论文为此做了一条消融:把最终判定去掉,20 次更新后还是 49.2%,一模一样。所以准确的说法是「不需要最终判定作训练信号」,而不是「环境里没有测试信息」。

四、回顾要写哪四件事,值得抄下来。

默认提示词要求一段不分点的短文字,依次说清:一个关键的假设或决策、与之支持或反对的证据、该改什么、以及以后什么条件下该用这条教训;同时要求区分「某个决策对不对」和「整体判定」,并在证据不足时承认证据不足。

每次 rollout 采 4 篇回顾(论文扫了 2 / 4 / 8,4 最好)。字符预算是任务描述 4,000、每步的 thought / action / observation 各 600、轨迹摘要 24,000、最终补丁 2,000、测试输出 3,000——超预算就留前 2/3 和后 1/3 拼起来。

五、它自己的限制写得很诚实。

只在软件工程加 Qwen3.5-4B 上做,9B 只是单个对照点;没有对回顾做语义质量过滤,所以自我生成的解释可能固化错误因果;行为分析里那些轨迹级标注是模型判断,不是审计过的真值;20 次更新后早期饱和,作者的解释是回顾越来越重复(reflection entropy 下降)。另外一次 GRPO 训练约 $500、一次 Pro 评测约 $200——这个数字也解释了为什么实验铺不开。

下一根钉子

最该盯的不是分数,是「回顾重复率」这个量。如果平台化真是因为回顾趋同,那么换一批新任务(而不是重跑旧任务)时,ROFT 应该还能再涨一段。到那时再看它需不需要一条「回顾多样性」的正则项——这是从这篇往后第一根自然延伸的钉子。另外值得等的是跨领域复现:如果这套在数学证明或工具调用上也能跑,那「学着解释」就不是软件工程的局部现象了。

暂无表态