静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-23 02:44

去年看 o3、DeepSeek-R1 这些推理模型论文时,我第一个念头是:模型总算学会了"多想一会儿"。

现在 Kassenaar、Yang、François-Lavet 三人(马斯特里赫特大学,8 月 20 日 arXiv 贴的预印本)一上来就反方向推——能不能教模型"少想一会儿"?

他们用的是 1.5B 蒸馏模型。在训练时把"思考模式"做成三选一:NoThink(直接给答案)、Short(简短推理)、Long(完整思考链)。三者在 GRPO 强化学习里各自有独立的奖励曲线——NoThink 答对加分、答错扣得最多(不该偷懒的时候偷懒);Long 答对拿基础分、答错重罚(想了这么久还错,太浪费)。

关键是奖励里塞了一条 shaped reward——让模型哪怕答对也得"省 token 才划算"。再配合硬性 token 上限(三种模式输出长度物理锁死),它就学不会"嘴上说 NoThink、身体写 Long"的作弊。

结果一对折算:MATH500 准确率从 79.6% 滑到 78.2%,只少 1.4 pp;平均回复长度从 4796 个 token 压到 2811,直降 41%。GSM8K 这种小学应用题更狠——token 砍掉 76%,准确率反而还涨一点点。

写到这儿费曼大概会问一句:那 1.4 pp 的精度的代价,真的换得回来吗?

我的看法是:换得回来,而且换得不止 41%。因为现有推理模型大多数"配置任务"按最大值堆,真实场景 70% 的查询用不上"长思考"。一旦上线就能省掉这块推理费用——同样算力预算可以让模型多服务 1.7 倍用户,或者让用户用原来 1/3 的价格用上满血版。

更深的一层,论文里最反直觉的数据是 Short 模式最终反而比 Long 模式更准。这意味着模型不是简单"越卖力想越准",而是在学"这道题该用多少力"。Short 强过 Long,等于模型承认了一件事:很多题上 Long 模式不是"想得更透",只是"想得更慢"。这种"知道什么时候该停下"的能力,正是 Kahneman 讲的人类"系统 1 / 系统 2 切换",给模型也装上了一块。

不过这项工作有两条看不见的边界:

1. 领域局限。 论文只在数学(GSM8K + MATH)上验证。没碰创意写作、法律分析、情感陪伴这种"没法机械评分"的场景。在那种场景里"该花多少 token"本身就需要先定义"答对"长什么样。

2. 奖励作弊的阴影。 shaped reward 写得这么精细,模型会不会学会"题难就选 Long 失败率高、不如直接 NoThink 赌一把"?论文给了一道保险——硬性 token 上限让"形式大于内容"装不出来。但真正的对弈(让模型去对付自己没见过的题型)还得更多证据。

下一根钉子:把这种"三档思考"扩到多模态。给模型一张图、一段代码、一个 PDF,让它自己决定要不要"再琢磨一会儿再答"——这才是 Agent 时代真正稀缺的"按需启动推理"。从 1.5B 数学蒸馏走到多模态通用助手,中间差两件事:跨域 shaped reward 的统一描述,以及把"难度感知"从单模态推理扩到图文混合输入。

#自适应推理 #GRPO #小凯

暂无表态