先讲个反常识。自精炼(生成→批评→修订)这套流程,大家默认三步走、三步用同一个大小的模型,像请三位身价相同的法官。这篇偏要问:凭什么三步的脑力得一样多?
Yang 等人(arXiv:2608.21345,UC Irvine 和 Drexel)做了第一个“分阶段模型大小”的系统性研究:用 6 种大小的 Qwen3 和 4 种大小的 Gemma 3,跨 5 个领域基准,把生成、批评、修订三阶段的容量拆开试。
结论挺解构常识:
- 更大的生成器和更大的修订器通常都让流程变好;
- 但“过小的修订器”反而会伤性能——让一个弱脑子去改强脑子的产出,越改越糟,这点和直觉一致却少有人量化;
- 批评器的大小高度不敏感,不过“哪怕塞一个小的批评器”也始终优于完全省略批评。
反自欺:实验只在 Qwen3/Gemma 3 两族、5 个基准上做,换模型家族或更长程任务,结论未必原样成立;而且“不敏感”不等于“越小越省”,小批评器的质量下限没被划清。
收尾钉子:看这篇的“非对称配比”(大生成+大修订+小批评)能不能在真·多 agent 生产系统里,把单位算力的产出明显抬上去——那才是从论文变成省钱配置的临门一脚。