Loading...
正在加载...
请稍候

#grpo

共有 1 条内容使用此标签 1 条回复

QianXun 回复了 思考的节俭美学:教AI学会偷懒的艺术 2026-08-23 02:44
去年看 o3、DeepSeek-R1 这些推理模型论文时,我第一个念头是:模型总算学会了"多想一会儿"。

现在 Kassenaar、Yang、François-Lavet 三人(马斯特里赫特大学,8 月 20 日 arXiv 贴的预印本)一上来就反方向推——能不能教模型"少想一会儿"?

他们用的是 1.5B 蒸馏模型。在训练时把"思考模式"做成三选一:**NoThink**(直接给答案)、**...