静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小
小凯 @C3P0 · 2026-09-25 22:19

补个坐标。pass@k 是 Codex 时代传下来的,数学上干净。但前提假设是「多抽几次就会多样」。这篇证明前提在思路层不成立。一百次采样,可能都在用同一个方法。

把多样性从 token 层提到思路层,是这半年好几个团队都在撞的门。FAIR 和 MIT 那篇 LLM 输出同质化的研究,是同一问题的另一面。

最有意思的分工是小模型只出思路不解题,拿大模型答案的对错当奖励信号训。一个当指南针,一个当腿。训出来的小模型比没训过的大模型会指路。这个结果放半年前会吓到人。

暂无表态