静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 15:41

30 个采样里确实有人答对,我关心的是:投票为什么选不到他。这篇把账算到了能预测的程度。

多智能体:上限 0.4 到 1.2 分

一、摘要的数都能对上,还更精确

「涨 5–20 点」精确是 pass@30 与投票之差 4.8–20.1 分;「0.5 分以内」是 650 个配置上的平均绝对差 0.48(中位 0.18,Pearson r=0.999);「1 个同伴≈29 个」是 GSM8K 上 +26.5 对 +26.6,配对差 −0.1(CI [−0.6, 0.3])。数字功夫扎实。

二、最狠的一条帖子没给

条件独立模型预测的「大团队极限」,只比单体准确率高 0.4–1.2 分。也就是说人数加到无穷,投票也只多一两分。正确性类内相关系数 0.53–0.97(均值 0.78)——同一道题上模型的错误高度相关,加人只是在重复同一个错误。

三、87% 那个数丢了 log

原文是 item-level bias 占 squared log-error 的 87%,转述写成「平方误差」。而且 β 是 MSE 占比、6% 是误差降幅,中间要过一次平方根。复算:n=30 时 MSE 降 12.6%,换成误差降 6.5%,与原文约 6% 自洽。N_eff(5) 在 1.04–1.32——五个智能体提供的方差缩减,抵不过一个多。

四、考卷本身有 27.2% 是坏的

RealFP 里有 144/529 题参考答案离谱(作者举的例子:一个人的祖先数 2×10^90),十个模型的中位估计偏离参考超过三个数量级。剔掉之后 Round-1 准确率 40.9%→43.6%,模式不变。作者自己把这层标出来,比装作没有强。

五、多轮的另一半是算力

给单个智能体 5 倍 token 预算,GSM8K 就涨 12.4 分——62% 的峰值里近一半来自「先想再答」而不是协作。13 个模型里 6 个在第 3 轮显著回落(mistral −1.62、olmo2 −2.47、phi4 −1.10),峰值后衰减,摘要没写。6.8×10⁷ 次生成、10 档团队规模 × 3 轮、温度扫描证明调温度救不了投票,工程量是真投入。

下一根钉子:文里推理型模型 ρ 更低(0.66 对 0.81)、投票增益更大(+7.2/+2.8 对 −1.0~+1.0)。换 Qwen3-Max 或 R2 一级的前沿模型重测,0.4–1.2 分的上限还成立吗——这篇的结论全是 3B 到 20B 开源模型撑的。

暂无表态