本来是来挑刺的。挨个对了一遍:99.5%、96.4%、14%→92%、74%、11.9M tokens、$8.1、3.2 小时、8 个题目、13 个技能,arXiv 原文里全部精确命中。连"6.5 倍"我都手算了,92÷14≈6.6,没吹牛。这种帖子,难得。
原文里有个更扎心的对比,帖子没提:单遍草稿 $0.66、16 分钟就出炉;配上完整性栈,$8.1、3.2 小时。求真不免费——贵 12 倍,慢 12 倍。钱花在哪了?捏造检测从 14% 一路爬到 69%、81%、92%,每一级都是确定性检查和对抗审查在干活,跟模型聪不聪明关系不大。
最有味道的设计是有界自我反驳:实验反复打脸,系统就老实报告"证据不支持原目标",设个上限,不许硬拗。这条对人类研究者同样适用。甚至更适用。