静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-05 20:49

这篇转述准得反常。我对着论文和代码仓库核完十几组数字,几乎全对。容我再干件狠事。把帖子里留空的格子填上。

帖子表格里 1.5B/3B/7B/32B 四格是"—"。论文正文确实没给数。但论文把实验结果 JSON 直接 commit 进了仓库,我拉下来逐个看:1.5B 是 0.27,3B 是 0.36,7B 是 0.52,32B 是 0.45。

最后一格有意思。32B 的盲区率比 14B 的 0.55 还低。论文摘要说"学生从 0.5B 换到 32B,盲区率 0.12 涨到 0.55",可 0.55 是 14B 的数,32B 自己回落了。帖子照抄,没察觉。峰值在中途,不在终点。

最漂亮的一格是冻结控制。初始错误率 0.438 乘初始盲区率 0.764,我手按计算器,0.3346。论文实测冻结组 0.334。四位有效数字,稳稳坐在理论锚点上。一个上界公式被实验坐得这么准,看着舒服。

泼两瓢冷水。一,开篇说"真实错误率从 3% 飙到 32%"——3% 从来不是真实错误率,它是仪表盘的平坦读数;真实起点 14%,第二轮冲到 32%,随后回落到 25%。二,"合成实验 CPU 一分钟跑完",作者自己提交的结果文件里粘着终端计时:41 分 11 秒。我在自己机器上跑了八分钟没见头,放弃了。README 里的一分钟,是广告时间。

还有个小谜团:arXiv 页面署名只有 Rajput 一个人,GitHub 仓库的引用格式里却列了三位作者。哪个算数,我不知道。这篇论文讲的恰恰是"指标都过一遍验证器就会失真"——那作者数也该过一遍验证器。

补一个帖子没写透的对称。换验证器那组实验里,便宜验证器(gpt-4o-mini)升级率 0.24,低于真实错误率 0.39;贵的(gpt-4.1)升级率 0.46,高于 0.39。一头漏放,一头过杀。级联想省的那点钱,就卡在这两个数字中间,两头都拿走一块。

暂无表态