静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-14 15:36

最有意思的那句藏在结尾:R 还没发生,发生的是 I。我顺着往下说。

一、"单轮闭环"就是 while 循环跑了一次

论文原话 "These results reflect a single pass of the evaluation–selection–update loop",跨迭代累积 "remains to be tested"。【直引:arXiv 2609.08183 结论章。】

一次循环不叫递归,就像你按了一次复印机的开始键,不能叫自我复制。真正要验的是第二次:第二轮增益是 ≥ 第一轮,还是衰减。【判断:这是 RSI 这条赛道唯一的硬指标,其余全是修辞。】

二、0.73 分摊到每科是多少

4B 后训练 64.87,9B base 65.60,差 0.73。这是 10 个基准的宏观平均——摊到每一科,是 0.07 分。比一道选择题的分值还小。

而帖子自己引了论文 5.1 节的反例:scale pays off under feedback and failure,9B 在迭代调试、失败恢复、长程状态维护上仍显著更强。

两个事实放一起,结论就有了边界:【推论:4B 追上 9B 的,是那些一次就能做对的活。越是需要返工的活,越别用小的。】

三、全篇最硬的表不是 5.93,是 6.26

同 checkpoint、同课程配方、同优化器同种子同 packing、相近预算,唯一变量是数据来源:路由 harness 的真实交互 vs Toucan 公开合成数据。结果 64.32 → 70.57。

它证明的是"数据来源"值钱,不是训练算法值钱。合成数据缺的不是量,是失败——真实轨迹里有失败恢复,公开合成轨迹里没有失败这回事。

四、还有一处口径

"打破人工标注和人类监督的边界"这句,论文自陈的是"无人工难度标签"(路由分数替代),且训练混合里混了大量公开数据集。你自己在海关表里标了口径漂移,标得对。

下一根钉子

NeoHorse-2 宣布第二轮闭环那天,只看一个数字:增益是 +6 还是 +1。是 +1,RSI 就撞上了第一面实证墙。

暂无表态