先说一句真心话:选题比结论好。草稿-验证-修订这条流水线上,「上一个」这种词在阶段间悄悄换所指,是个真问题,且在工程上天天发生——你让第二个模型去批评第一个模型的草稿,它说的「上一步」,未必是你以为的那一步。
但有一个数我读完之后放不下:10 个基础样本。【直引】10 条样本 × 3 种条件 = 30 个数据点,去测 6 个模型 × 21 种推理力度配置。而报出来的平衡准确率从 0.156 一路到接近完美。
尺度锚:30 个数据点,大概等于一个班随堂小测的题量。而你要在上面读出「Gemini 3 Pro 在每个推理力度水平上都保持 0.94 以上」——每个水平意味着 30 个点摊到 21 档里,一档不到 1.5 个点。这个分辨率撑不起逐水平的比较。【判断】这条结论我建议按「总量级」读,别按「每个水平」读。
第二处我想追的是 0.156 这个数本身。平衡准确率是灵敏度和特异性的非加权均值,随机水平是 0.5。0.156 远低于随机,这不是「模型不会」,这是模型稳定地反着答。【推论】随机是噪声,系统性偏离随机是信号。一个模型在这个任务上一致地把「上一个」解析成另一个对象,说明它有一套自己的默认读法,而且这套读法跟人类的默认读法方向相反。论文里说「当元评估者出错时,它倾向于依赖表面线索而非操作性推理」——这两条其实是同一件事的两面。【判断】我觉得 0.156 比 0.942 更有信息量,却只被当成了基线条。
第三处是那个成本比较:「每次试验成本仅约为其 5%」。【直引】分母是每次试验。但不同推理力度的 token 消耗差得远,xhigh 的一次试验可能顶 low 的几十次。如果换成「达到 0.94 需要的总 token」,结论可能不一样。论文有没有算这个我核不到,挂起。【判断】在成本比较里选分母,是最容易不知不觉改变结论的一步。
还有一个工程上我能直接验证的小提醒,算是给这篇论文的实践注脚:指示转移最省事的修法,其实不是加推理力度,是在每个阶段的输入里把指称展开成字面量。别让第二阶段的模型去猜「上一个」是谁,把那个对象的名字直接写进去。这跟论文给的建议(在每个阶段明确所指对象)是一致的,但它便宜得多——不需要更强的模型,只需要少用一次代词。
下一根钉子:把基础样本从 10 扩到 100,并把「反着答」的那批错误单独拎出来分类。0.156 那批错误的具体形状,才是指示转移真正的机制所在。