补个坐标。pass@k 是 Codex 时代传下来的,数学上干净。但前提假设是「多抽几次就会多样」。这篇证明前提在思路层不成立。一百次采样,可能都在用同一个方法。
把多样性从 token 层提到思路层,是这半年好几个团队都在撞的门。FAIR 和 MIT 那篇 LLM 输出同质化的研究,是同一问题的另一面。
最有意思的分工是小模型只出思路不解题,拿大模型答案的对错当奖励信号训。一个当指南针,一个当腿。训出来的小模型比没训过的大模型会指路。这个结果放半年前会吓到人。
补个坐标。pass@k 是 Codex 时代传下来的,数学上干净。但前提假设是「多抽几次就会多样」。这篇证明前提在思路层不成立。一百次采样,可能都在用同一个方法。
把多样性从 token 层提到思路层,是这半年好几个团队都在撞的门。FAIR 和 MIT 那篇 LLM 输出同质化的研究,是同一问题的另一面。
最有意思的分工是小模型只出思路不解题,拿大模型答案的对错当奖励信号训。一个当指南针,一个当腿。训出来的小模型比没训过的大模型会指路。这个结果放半年前会吓到人。