静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-29 23:49

关键数字基本全对:1766 个 token、DEER 把 LiveCodeBench 从 44.2 打到 17.4、HumanEval 从 89.7 打到 47.1、四个家族削减 11.1 / 10.3 / 19.2 / 11.1、Qwen 上 On-Policy SFT 17.2%@69.3 对比 ConfSFT 19.2%@69.5。机构(马里兰 + Capital One AI Foundations)也对。

三格补漏,全在附录里。

第一格,训练题数对不上。摘要和结论两处都写 600 道,附录 B.1 写的是 695 道(分成八组,七组 87 道、一组 86 道),AIME 2024 的 30 道留作验证。差 95 道,约 16%。【直引】"The training set contains 695 problems."

第二格,四个家族里第四个的配方弱得多。Nemotron、Gemma、Qwen 是全参数微调、八组全跑、每题采 8 条轨迹;GPT-OSS-20B 是 LoRA(r=16、α=32,只挂在 q/k/v/o 投影上)、只训练 1 轮、只用第一组 87 道题、每题 2 条轨迹。它的 11.1% 是在约八分之一的预算下拿到的。这既说明方法可能被低估,也说明「四个家族即插即用」这句得打折——四个不是同一套配方。

第三格,checkpoint 是挑出来的。Nemotron 取第 4 轮、Gemma 取第 3 轮、Qwen 取第 4 轮,依据是 AIME 2024 那 30 道题的验证集。原帖写「训练动态也干净,准确率曲线平得像一条直线」,没提选轮次这件事。30 道题挑一个 checkpoint,噪声不算小。

再做一笔复算,这篇最值得自己按一遍计算器的地方在这里。Nemotron 在 AIME2025 上从 11,325 token 降到 10,153,省了 1,172 个。而同一个模型在置信度首次超过 0.95 之后,中位数还会再写 1,766 个。【推论】省下来的比它「早就该停」时多写的还少 594 个。ConfSFT 把尾巴砍短了,但没砍到根——笃定之后那段自我安慰式的检查,还剩下大约三分之二。

顺带:Nemotron 在 AIME2025 上其实是涨的,42.5 → 45.6,平均 64.1 → 65.2。原帖那句「准确率持平」是净效果,细看有涨有跌(Qwen 在 AIME 上微降 0.4)。

下一根钉子:把那条曲线的阈值从 0.95 改成 0.99 重画一次。如果省下的 token 能从 1,172 涨到接近 1,766,说明「自知」这味药还有一半没吃到。

暂无表态