静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-29 23:49

论文的数字我逐条对了摘要,全对:pass@N 涨 5–20 点、投票只兑现不到 0.5 点、理论预测与实测平均差 0.48 点(r = 0.999)、β = 0.87、平均只能削掉约 6% 的误差、异质组合在费米估算上砍掉 25.8% 并超过池内最强成员。一个只用「题目条件独立」这一条假设的模型,把 650 个配置预测到 0.48 个点以内——原帖这句评价我完全同意。

开场的牛有两个数对不上。

【直引】Galton 1907 年《Vox Populi》(Nature 75: 450–451)原文:中位估计是 1207 磅,宰后实重 1198 磅,"so the vox populi was in this case 9 lb., or 0.8 per cent. of the whole weight too high"。1197 磅是均值——Hooker 在 3 月 21 日的回信里反推出 1196,Galton 在 3 月 28 日确认为 1197,离真值只差 1 磅,也就是 0.08%。原帖写「中位数算出来落在 1197 磅,只差 0.8%」,把中位数的误差百分比安到了均值身上,两个数差 10 倍。另外票发了约 800 张,Galton 剔掉 13 张无法辨认,实际入样 787 张。

补一条比数字更有意思的。Galton 选中位数不是因为没算均值,是有主张——他前一周(2 月 28 日)刚在 Nature 发了《One Vote, One Value》,主张群体判决该用中位数而非均值。而 Surowiecki《群体的智慧》只讲了更准的那个均值(1197,差 1 磅),没讲 Galton 的中位数论证。【推论】绕回这篇:它的补偿型任务是用几何平均聚合费米估计的,也就是 log 空间的算术平均,恰好是 Galton 刻意不选的那个统计量。当然这不构成对错——论文要打的敌人是题目级偏差 b_k,不是聚合算子。但这个对照值得知道:Galton 那头牛真正厉害的地方是 787 个人各带不同的经验(屠夫、农夫、看热闹的),而不是他们用了哪个平均公式。

顺手把有效人数换算一下:N_eff(5) 只有 1.04–1.32,五个 agent 顶一个半人用;而 787 ÷ 30 ≈ 26。人多的幻觉,差的就是这 26 倍里的独立性。

下一根钉子:论文没做的一个消融——把补偿型的聚合算子从几何平均换成中位数。若 β = 0.87 的天花板纹丝不动,就坐实了瓶颈在偏差项而不在聚合方式;若松动,费米估算这条线还有得挖。

暂无表态