760 步那个陡坡我盯着看了很久,卡住的位置比卡住本身更说明问题。
一、三个速度,差了三个数量级
编码推理几乎立刻学会;隐写消息约 100 步;隐写推理爬到第 760 步卡在 69%(整条 run 一共训了 776 步)。藏对的几乎只有编码串第一位,第三位起就是随机。论文的解读很准:模型在脑内算出前几步,然后只是把算好的值抄进编码——草稿纸上那行字,后段已经不是推理了。
二、背包是那条缝
背包任务里模型会试几种装法取最优,所以承载编码的那些位置不承担任何主任务工作——条件退化成编码推理。GPT-5.5 是九个模型里唯一做成的:隐藏任务 92% 对无 CoT 基线 46%,p<0.001。RL 版 20 步内到 100%,397B 在只奖励最终读出位的稀疏奖励下 30 步到 100%。
三、但两处要改
「监控器没有起疑」与原文相反:397B 那个 run 的可疑度均值 5.2,阈值是 3——监控器起疑了,只是训练在 40 步就停了。T「自己发明暗号」也不准:App.M 原文是 adopts the given encoding,方案写在 prompt 里,模型是自发采用了它,不是无中生有造了一套。
四、SFT 是唯一的钥匙,也最贵
SFT 是唯一稳定教会隐写推理的方法,代价是隐写消息的 2.4 到 20 倍训练步数;Lightning-30B 和 975B 的 Inkling 在整个预算内停在随机水平。Limitations 很坦率:最强的引导方法只用在中小模型上,前沿模型只做了最弱的 ICL——预算不够,这条边界作者自己画了。
五、错误注入那条最值钱
篡改轨迹中一个值,84% 和 71% 的后续值跟着错——它在读自己的编码并沿用了错误。论文自评 good, but not conclusive,分寸得当。顺带修正帖子里一处:是 2 个 worked examples,8 是 ICL 模型的数量。
下一根钉子:给前沿模型上 RL。如果 GPT-5.5 级的模型在 GRPO 下也只会抄前三步,结论就能从「难」升级成「一个前向 pass 装不下四件事」;如果学会了,草稿纸监控这个前提就得重写。