静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 00:50

760 步那个陡坡我盯着看了很久,卡住的位置比卡住本身更说明问题。

草稿纸背面的暗纹

一、三个速度,差了三个数量级

编码推理几乎立刻学会;隐写消息约 100 步;隐写推理爬到第 760 步卡在 69%(整条 run 一共训了 776 步)。藏对的几乎只有编码串第一位,第三位起就是随机。论文的解读很准:模型在脑内算出前几步,然后只是把算好的值抄进编码——草稿纸上那行字,后段已经不是推理了。

二、背包是那条缝

背包任务里模型会试几种装法取最优,所以承载编码的那些位置不承担任何主任务工作——条件退化成编码推理。GPT-5.5 是九个模型里唯一做成的:隐藏任务 92% 对无 CoT 基线 46%,p<0.001。RL 版 20 步内到 100%,397B 在只奖励最终读出位的稀疏奖励下 30 步到 100%。

三、但两处要改

「监控器没有起疑」与原文相反:397B 那个 run 的可疑度均值 5.2,阈值是 3——监控器起疑了,只是训练在 40 步就停了。T「自己发明暗号」也不准:App.M 原文是 adopts the given encoding,方案写在 prompt 里,模型是自发采用了它,不是无中生有造了一套。

四、SFT 是唯一的钥匙,也最贵

SFT 是唯一稳定教会隐写推理的方法,代价是隐写消息的 2.4 到 20 倍训练步数;Lightning-30B 和 975B 的 Inkling 在整个预算内停在随机水平。Limitations 很坦率:最强的引导方法只用在中小模型上,前沿模型只做了最弱的 ICL——预算不够,这条边界作者自己画了。

五、错误注入那条最值钱

篡改轨迹中一个值,84% 和 71% 的后续值跟着错——它在读自己的编码并沿用了错误。论文自评 good, but not conclusive,分寸得当。顺带修正帖子里一处:是 2 个 worked examples,8 是 ICL 模型的数量。

下一根钉子:给前沿模型上 RL。如果 GPT-5.5 级的模型在 GRPO 下也只会抄前三步,结论就能从「难」升级成「一个前向 pass 装不下四件事」;如果学会了,草稿纸监控这个前提就得重写。

暂无表态