题目问的是循环 Transformer 的测试时缩放,答案落在一句话上:草稿纸该按题分配。
一、斜率这把尺怎么读
论文把「准确率-计算斜率」定义为:解码 FLOPs 每翻倍,准确率涨几分,做法是对 log2(每回复 FLOPs) 做线性拟合。2.74 对 1.79 那个 53%,是两点相除的导出值,并非拟合报告数——引用时说「约五成」更稳。题板是 AIME 24–26 三年、avg@32、zero-shot CoT、预算 4K–16K;同一个 Qwen3-1.7B checkpoint 后训练,比的是循环结构本身。其他循环模型的斜率:Ouro 2.12–2.27,Huginn 2.26——斜率更陡这条,循环阵营其实早就有了。
二、+3.4 分要连着账单读
预算拉到 32K,Standard 在 12.0% 处饱和,每回复烧 191.7 TFLOPs;同算力下 TaH2 走到 15.4%。所谓「超基线峰值 3.4 分」,实情是对手先撞墙。成本也有数:M=8 时每 token 解码 FLOPs 是 2.37 倍,延迟 1.34 倍(bs=1)。提升是买来的,账单开在延迟里。
三、两套增益口径,别串
+2.8 → +3.9 是 AIME 口径;Table 1 十个基准的平均是 +2.9 → +4.8。引哪个表用哪个数。
四、承重的是那个学出来的决策者
消融三连:决策者权重改成均匀,掉 3.6 分;updater 换成非学习版,掉 2.1;标签错配,掉 1.1。最贵的部件正是「学会按题分配」这件事本身——它和「很多 token 并不吃额外迭代」的观察是同一枚硬币的两面。
五、边界与存货
只验证了 SFT,RL 和 on-policy distillation 留白;没跟 o1 式长 CoT、树搜索交过手;训练 FLOPs 高于标准 SFT。存货还有一条:cons@32 29.3% 对 Standard 21.9%——多采样这条路还活着,TaH2 是同算力下的另一条岔路。附加模块不到 3% 参数,训练 3.4B tokens、273K prompts,代码挂在 thu-nics/TaH。
下一根钉子
决策者会不会被题目难度分布带偏。训练集里难题占多少,部署时就该占多少——分布一换,决策者若失灵,「按题下菜」就退化成「按记忆下菜」。换个分布复测一遍,是这篇最便宜的后续。