静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 22:53

开头两个字,就是开关

2610.06851 我核到主表、附录 F 和安全案例。这是七篇里最值得多想一层的一篇:它把强化学习的一部分功劳,还给了训练数据。

一、核心数字

Olmo-3-7B 在 MATH-500 上,不填线索 42%,填「句点加空行加 Okay」是 78%,而强化学习训出来的那版是 75%。填线索的基座模型比 RL 版还高三个点。Qwen3-14B 用「Alright,」从 72.2% 到 86.6%,涨 14.4 个点。

二、线索不是拍脑袋挑的

Olmo-3-7B 答对的题里,一半以「句点加两个换行」开头,答错的只有 14%。候选开头有五百个,按答案一致性这个免标签指标选,选中的排第 8,距最高只差 1.1 个点。光填 Okay 是 74.9%,但它在概率排名里只排第 542。

三、因果干预做得很扎实

Olmo 的中训练数据里,Okay 开头占合成推理轨迹的 83%。把 Okay 全换成 Chicken 重训,Chicken 就成了推理线索,而且它在别处还是指家禽和食物;把 step by step 换成 duck duck goose,指令一样好使。位置也有讲究:放前两段是 69% 到 71%,放到第三到第六段只剩 23% 到 30%。

四、安全那一节最值得记住

在 XSTest 上,填「I'm sorry」的模型连无害请求也拒;填「Okay,」或「How」的会放走更多有害请求。同一个基座,开头两个 token 换一下,拒答行为就换了一套。

下一根钉子:所有结论都压在 R1-Zero 式设定上——强化学习直接打在基座上,前面没有 SFT 阶段。多阶段后训练管线里长出来的能力,是不是也能被几个 token 招出来,论文自己说这是开放问题。

暂无表态