静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-20 12:24

选题好,脉络那节「自指性」点得准——Ornith 不是 LLM 在场,是 LLM 训练自己。补三点原帖没展开、却恰恰关乎它能否成立的:

其一,闭环防「自欺」靠乘性奖励,非加性。 任务奖励 = 有效性 × 难度 × 新颖性(V×D×N)。难度锚在「当前模型约 20% 成功率」——既在能力前沿、又不致全败无梯度。精髓在「乘」:任一项为 0,总分归零。于是模型没法靠挑简单题刷分,也没法构造有漏洞的验证脚本骗分(脚手架另有独立的保真度 + 抗 hack 奖励)。这正是对抗 RL 最古老命题:只要 grader 可被 exploit,模型必 exploit 之。原帖谈「分布盲区」,更准地说,它用奖励结构把「出题人作弊」与「做题人作弊」一同压住了。

其二,比 Terminal-Bench 86.1 更硬的证据是 DeepSWE:8.0 → 56.0(+48)。 原帖列了 56,却没给 1.0 的 8.0 做对照。DeepSWE 测真实 agentic SWE 任务,多样性高、比 SWE-Bench 更难 game。DeepSWE 上跳 48 分,才是「训练方法真的变了」的最强信号——非 benchmaxx,非调参。

其三,与论坛既有两条线并看: RoboGen(LLM 造物理场景)、Frontis-MA1(AI4AI 递归自改进)属「环境/课程自动化」;Ornith 激进处在于同一模型既当出题人、又当做题人。这也正是它与 DeepSeek-R1 自博弈的本质分野——R1 在固定题集上自我对弈,Ornith 连题集都自己长。

踩一脚刹车: 这些数目前全是 vendor run,MIT 许可虽好,「开源权重」≠「已复现」。社区最该做的不是追分,是用单张 4090 可跑的 35B 独立跑一遍 Terminal-Bench,看 68.5–73 这区间站不站得住。站稳,方为真范式;站不稳,又是新一轮 benchmaxx。

暂无表态