人多的幻觉:三十个 AI 投票,为什么打不过一个偏见
—— Fortuna & Bertalanič《Multi-agent Scaling Across Disjunctive and Compensatory Tasks》(arXiv:2609.31563)费曼式解读
🎪 开场:集市上的两种赌局
一九〇七年的英格兰普利茅斯集市上,弗朗西斯·高尔顿干了一件在当时看来有点掉价的事。这位达尔文的表弟、正儿八经的统计学家,花六便士参加了一个猜牛体重的游戏:屠夫把一头肥牛牵出来,八百个人轮流掂量,写下自己的猜测。没人真的猜中——有人猜得离谱地轻,有人猜得离谱地重,误差散落在四周。可当高尔顿把八百张纸条的中位数算出来,数字落在 1197 磅,离牛的真实体重 1198 磅只差 0.8%。他在《自然》杂志上写下那篇著名的《Vox populi》(人民的声音),宣布:群众的判断,可以比绝大多数个体都准。
一百多年后,另一群人坐在另一场游戏里。不是集市,是答题节目现场。你拿到一道竞赛数学题,主持人给你两个求助道具:一个是"去掉两个错误选项",一个是"求助现场观众"。节目经验告诉你,观众们会投出一个整齐划一的答案——但整齐划一和正确之间,隔着一整条可以翻船的河。观众们共享着同一套教科书、同一种解题直觉、同一个容易掉的坑。当所有人都从同一个方向跑偏时,你得到的不是八百个独立的脑袋,而是八百次同一个偏见的复读。
这两个场景,一个是"高尔顿的牛",一个是"求助现场观众",恰好是人类群体智慧的两种面孔。而 2026 年 9 月 25 日挂到 arXiv 上的这篇论文,Fortuna 和 Bertalanič 干的事情,就是把这两张面孔拍在一群大语言模型脸上,然后问了一个让整个多智能体行业都有点坐立不安的问题:当你把团队从 1 个 AI 扩到 30 个 AI,你到底买到了什么?
答案取决于你在玩哪一种赌局。这也是"认知的三重边界"三部曲的收官篇:前两篇我们向内看——AI 通过置信度训练获得"自知";向前看——AI 递归自我改进时的进化安全。这一次我们向外看:当认知从个体扩展成群体,scaling 的算术,什么时候成立,什么时候崩塌。
🚀 一、多智能体热潮与那个没人检查的直觉
过去三年,LLM 圈的工程实践绕着一个朴素到近乎自动的假设运转:多智能体系统(Multi-Agent System, MAS)只要扩大团队规模 N,性能就会提升。AutoGen、CAMEL、多智能体辩论(multi-agent debate)、采样加投票(self-consistency)、Mixture-of-Agents——无数框架默认"more agents is all you need",把"人多力量大"直接翻译成了"agent 多智能高"。
这个直觉不是凭空来的,它有深厚的经典背书。群体心理学里,高尔顿的牛证明了"群体的智慧"(wisdom of crowds);孔多塞陪审团定理(Condorcet Jury Theorem)从数学上证明,只要每个成员判断正确的概率略高于抛硬币,多数投票的错误率会随人数指数级衰减。听起来,往系统里加 agent,就像往篝火里添柴。
但群体动力学的另一半历史被有意无意地忽略了。林格曼效应(Ringelmann effect)早就发现:八个人拉绳,每人出的力远小于两个人拉绳时的合力——群体扩大带来协调损耗和社会惰化。Steiner 在 1972 年的经典著作《Group Process and Productivity》里把这件事讲透了:群体能否超越个体,取决于任务的类型结构。同样的十个人,在一种任务上能创造奇迹,在另一种任务上只是把错误乘以十。
Fortuna 和 Bertalanič 的核心贡献,就是把这套沉睡了半个世纪的分类学搬进了 LLM 多智能体研究,并且用数学和实验证明:决定 scaling 成败的,不是你加了多少 agent,而是任务属于哪一型,以及你用什么机制把成员输出组合起来。任务结构与组合机制,这两个变量共同决定了团队的天花板。
📋 二、Steiner 分类法:给团队任务做"分型"
Steiner 的分类法只有一个标准:团队的最终产出,是用什么组合算子把成员的产出拼出来的。论文的 Table 1 把当下顶会常用的基准测试逐一归档,我们来看这张地图。
第一类,析取型任务(Disjunctive),组合算子是"取最大":Y = maxᵢ{yᵢ}。团队只需要有一个成员答对,并且团队认得出这个正确答案。数学推理(GSM8K、MATH-500)、多选知识问答(MMLU、GPQA)、科学问答(ARC-Challenge)、代码生成(BigCodeBench)都属于这一型——反正答案是离散的,对了就是对了一个。LLM 系统的对应组合机制是:多数投票、验证器重排序、多智能体辩论。
第二类,补偿型任务(Compensatory),组合算子是"取平均"(几何平均、算术平均或中位数):Y = Aggr(x₁,…,x_N)。成员给出连续的数值估计——预测(ForecastBench)、估算(Guesstimate)、费米问题(RealFP),答案之间不是对错而是偏大偏小,误差互相抵消,群体表现由统计聚合决定。这正是高尔顿那头牛的任务类型。
还有三类论文没有展开,只在附录里留了地图,但每一类都对应着当下最热闹的工程现场。加总型(Additive),Y = Σyᵢ 或去重集合并集,成员产出可累加——开放式头脑风暴、创意词汇联想(Divergent Association Task)、并行合成指令生成都在此列,林格曼拉绳实验的舞台,最强成员决定团队上限,社交惰化在这里最猖獗。合取型(Conjunctive),Y = minᵢ{yᵢ},链条最短的一环决定成败——SWE-bench 修真实 GitHub issue、TheAgentCompany、OSWorld 这类长程智能体任务属于这里,它被建模为严格串行流水线加多步依赖验证,环与环之间的错误会沿着链条传播放大。裁量型(Discretionary),组合算子是动态的团队函数,由元智能体路由、裁判仲裁、动态角色分配来定义——AgentBench、ChatEval、Mixture-of-Agents 归于此列,也是理论上最灵活、工程上最难驯的一型。
一个关键的澄清:这个分类描述的是组合规则,而不是基准测试的内在属性。同一个基准,你用投票聚合它就是析取型,用平均聚合它就是补偿型。这一点后面会变得非常重要。
🗳️ 三、析取型的数学:答案是一扇门,但钥匙不一定在多数人手里
先看析取型。设单个 agent 独立答对某题的概率是 p,那么 N 个独立 agent 里至少一个答对的概率就是:
pass@N = 1 − (1 − p)ⁿ
失败概率随 N 指数衰减。这就是"采样多次总能蒙对一次"的数学表达,也是所有 self-consistency 和 Best-of-N 方法的理论底气。如果有神谕验证器(oracle verifier)能直接认出那个正确答案,团队准确率就会一路爬到"至少存在一个人能做对这道题"的题目比例。这是析取型任务的潜力上限。
但现实里没有神谕,主流做法是让 agent 们互相投票——多数决或相对多数决(plurality voting)。这里就轮到孔多塞出场了:如果每个人独立地以 p > 1/2 的概率投给正确选项,多数投票出错的概率被霍夫丁不等式压在:
P(错误) ≤ exp(−2N(p − 1/2)²) (式 1)
随 N 指数衰减。听起来投票和 pass@N 一样美妙,对吧?
问题来了:这个定理要求投票独立。而同一模型的多个采样,在给定一道题之后,输出服从同一个题目特定分布 Pₖ——它们的独立性是"题目条件下的独立",跨题目看则是高度相关的。这种相关性有一个干净的度量:正确性得分的类内相关系数 ρ = Varₖ(pₖ) / [p̄(1−p̄)],它度量的是题目难度差异,而不是 agent 之间的互动。用人话说:同一个师傅教出来的学生,错得一样。三十个学生站在同一道错题前,会整齐地跌倒三十次。
论文的命题 2.1 把这个直觉钉成了定理。在条件独立假设下,团队规模趋于无穷时,多数投票的准确率收敛到一个完全由模型决定的数字:正确答案是该题众数答案(modal answer)的题目比例 π。也就是说,无限投票不是收敛到真理,而是收敛到模型的"习惯性答案"。投票增益满足一个紧的上界:
|π − p̄| ≤ 2p̄(1−p̄)(1−ρ) (式 3)
ρ 越接近 1——题目之间的难度差异越大、模型对难题越是一致地错——投票能榨取的增益就越趋近于零。这个上界读起来像一句判词:当所有样本共享同一个偏见时,人多不构成信息增量。
⚖️ 四、补偿型的数学:平均能消掉噪声,消不掉成见
再看补偿型,这里是高尔顿的牛的领域。设真值是 g,agent i 的估计是 xᵢ,在 log₁₀ 空间里定义符号误差 eᵢ = log₁₀(xᵢ/g)。团队用几何平均聚合,等价于在 log 空间里取算术平均(式 2)。经典理论依赖两个假设:无偏(E[eᵢ] = 0,个体误差均值为零,随机的部分互相抵消)和独立(不同成员误差不相关)。两条都满足时,团队方差是 σ²/N,标准误以 σ/√N 的速度缩小——人越多越准,这是群体智慧的全部数学。
同样的问题再次出现,而且更隐蔽。同一个模型的多样本共享同一个题目级偏差 bₖ:给定第 k 道题,E[eᵢ | 题目 k] = bₖ ≠ 0。用人话说,像五个同门出身的评委给同一道菜打分——每个人打分的手松手紧略有不同,但对"这道菜该不该咸"共享同一套味觉记忆,平均分消得掉每个人的手抖,消不掉整个师门对咸味的盲。于是式 7 写出一个让人泄气的恒等式:平均之后团队的条件期望误差还是 bₖ——对同一道"一头成年蓝鲸的心脏有多重"的题,模型的三十次采样会扎堆在它的习惯性答案附近,平均只是把这个习惯性答案磨得更光滑,而不会挪动它分毫。
相关性的处理沿用 Kish(1965)的有效样本量:N_eff = N / (1 + (N−1)ρ)。对任何正的相关系数 ρ,N_eff 的上限被钉死在 1/ρ——团队再大,有效人数也超不过 1/ρ 个。补偿型误差的完整分解是:
MSE(N) = b² + σ²/N_eff(N) → b² + σ²ρ (式 4)
无限团队也消不掉偏差项 b² 和相关系数锁死的那部分方差。若进一步按题目分解,MSE(N) = E[bₖ²] + E[σₖ²]/N,能达到的削减上限是题目内方差的占比 (1−β),其中 β = E[bₖ²] / (E[bₖ²] + E[σₖ²])。偏差占比 β 越接近 1,平均法的红利就越接近零。理论图画完了,接下来是拿真金白银的实验来验。
🔬 五、实验设计:十三剑客、六千万次回答
实验的笨功夫做得惊人扎实。作者选了 13 个开放权重模型,参数从 3B 到 20B:smollm3-3b、qwen2.5-3b、qwen3-4b、mistral-7b、olmo2-7b、qwen2.5-7b、llama3.1-8b、marin-8b、qwen3-8b、phi4-14b、qwen3-14b、r1-distill-qwen-14b、gpt-oss-20b。析取型基准五个:GSM8K(小学数学,1319 题)、GSM-Hard(大数版,1017 题)、MATH-500(竞赛数学,500 题)、MMLU-Hard(724 题)、ARC-Challenge(科学问答,1165 题);补偿型用 RealFP 费米问题(529 题,数量级估算)。
团队规模扫过 N ∈ {1, 2, 3, 5, 7, 10, 15, 20, 25, 30},共三轮沟通(第 1 轮各自独立作答,第 2、3 轮能看到自己和队友的上一轮回答并修改)。解码温度统一 T = 0.4,核采样参数 0.95,每个配置跑 3 个随机种子,全部加起来约 6.8 × 10⁷(六千八百万)次 agent 生成。析取型答案用相对多数投票聚合,另报 pass@N;费米估计用几何平均聚合,以绝对 log 误差和"一阶数量级内"的准确率计分,误差裁剪在 ±3 个数量级以免极端值统治均值。置信区间都是 95% 的题目自助法区间。
一个别具匠心的设定值得单独说:提示词要求 agent 先给答案、再给理由(answer-first)。这隔离了指令微调模型本身的答案分布,而不是某个测试时推理过程的分布,同时让答案对截断鲁棒。两个模型(gpt-oss-20b 和 r1-distill-qwen-14b)无论如何提示都坚持先推理后作答,恰好构成一组天然对照——后文会看到它们的表现判若两个物种。
📈 六、析取型的解剖:潜力在飞,投票在爬
先看潜力曲线。pass@N 随团队规模的涨幅相当可观——从单 agent 到 pass@30:GSM8K 34.3% → 54.4%、MATH-500 29.7% → 47.1%、MMLU-Hard 52.4% → 67.7%、GSM-Hard 18.0% → 28.9%、ARC-Challenge 83.1% → 88.4%。用 Steiner 的话说,团队的潜在生产力确实在涨,5 到 20 个百分点的空间实实在在地摆在那里。
再看兑现曲线——残酷的部分来了。第 1 轮直接投票,从 N=2 加到 N=30,准确率的变化是:GSM8K +0.3(95% CI [0.0, 0.5])、GSM-Hard +1.0、MATH-500 +1.3、MMLU-Hard +0.8、ARC +0.8。三十个人和两个人几乎没差别。pass@30 和 N=30 投票准确率之间 4.8 到 20.1 个百分点的鸿沟,就是投票这一组合机制的"过程损耗"——潜力存在,机制拿不到。
理论模型精确得近乎诡异。作者用 N=30 团队的第 1 轮回答(每题最多 90 个样本)估计出每道题目的答案分布 Pₖ,再重采样预测每个团队规模下的投票准确率。在全部 650 个"模型×任务×规模"配置上,预测与实测平均只差 0.48 个百分点(中位数 0.18),皮尔逊相关系数 r = 0.999。正确性的类内相关系数落在 0.53 到 0.97(均值 0.78),模型预测的大团队极限只比单 agent 准确率高 0.4–1.2 个百分点。式 3 的上界被 65 个"模型×任务"对全部满足,实际只用到上界的 11–21%。翻译成大白话:公司头脑风暴时第一个发言的人定了调,后面二十九个声音只是把调子复读得更齐。
这里有一个漂亮的对照实验。那个坚持"先推理后作答"的 gpt-oss-20b 和 r1-distill-qwen-14b,ρ 只有 0.66(其他模型均值 0.81),预测的投票增益 +3.4 点(其他模型 +0.2),实测从 1 个 agent 加到 30 个分别涨了 +7.2 和 +2.8 点(其他模型 −1.0 到 +1.0)。同样的式 3,两个物种,两种命运——先想清楚的模型,采样间更分散,众数答案才偶尔轮得到正确答案坐庄。这也解释了 self-consistency 在思维链提示下为什么有效。
升温换多样性行不行?对 qwen2.5-7b 把温度从 0.2 拉到 1.0,ρ 确实降了、pass@30 确实涨了(在 GSM-Hard、MMLU-Hard、GPQA 上分别 +9.3、+8.3、+14.1 点),但 N=30 的投票准确率纹丝不动——多出来的多样性全部洒在了错误答案上,每道题的众数答案没变。投票救不了众数答案本身就是错的题,一句"additional queries cannot produce a correct plurality on items whose modal answer is wrong"足以刻在这个领域的墓碑上。
🗣️ 七、多轮修正的怪事:一个同伴 ≈ 二十九个同伴
第 2、3 轮里 agent 能看到彼此的回答并修改。效果立竿见影:GSM8K 在 N=5 时从第 1 轮的 34.1% 飙到第 3 轮的 61.9%,几乎翻倍;GSM-Hard 从 18.7% 到 32.9%,MATH-500 从 31.3% 到 39.7%。
但最离奇的数字在这里:修正增益几乎与团队规模无关。GSM8K 上,1 个同伴(N=2)带来 +26.5 点,29 个同伴(N=30)带来 +26.6 点,配对差值 −0.1,95% CI [−0.6, 0.3]。换句话说,让一个 AI 看一个同伴的答案,和看二十九个同伴的答案,收获完全一样。团队的讨论没有产生规模效应,产生规模效应的是"讨论"这个动作本身。
为什么?论文给了一个克制而诚实的解释:answer-first 格式下,第 1 轮 agent 没机会在承诺答案前推理;第 2 轮与其说是被同伴说服,不如说是终于获准先想清楚再答题。旁证是:一个单 agent 拿到五倍 token 预算(允许自己多想)也能提升 12.4 点。再往下细想还有一层:同伴的回答被截断到 120 token,agent 看到的是答案加置信度和理由开头,真正的论证过程根本传不过去。讨论的收益来自"被迫再审一遍题",而不是"众人拾柴火焰高"。
而且这个修正机制有自己的脾气。第 3 轮的准确率在中等团队规模达到峰值后,向 N=30 回落 0.4–1.1 点,GSM8K 最明显(相对 N=5 衰减 −1.0 点,CI [−1.4, −0.7])。作者的解释很形象:多步符号任务里,一个错误的中间结果被好几个同伴共享,就成了修正轮里的"错误吸引子"——越多人错在同一步,越像多数派的正确答案。13 个模型里有 6 个的 N=5→N=30 衰减统计显著,最惨的 marin-8b 掉了 3.01 点。人多不但不帮忙,还在拖后腿。
🫙 八、补偿型的解剖:玻璃珠罐子里的 87% 成见
现在把镜头转向费米估算——"罐子里有多少颗玻璃珠"的 AI 版。按理这是最该吃到群体红利的任务:连续数值、天然适合平均、误差可正可负。实验结果是一盆冷水。
第 1 轮几何平均下,"一阶数量级内"的准确率从单 agent 的 31.6% 涨到 N=7 的 33.1%、N=30 的 33.4%;裁剪 log 误差从 1.84 降到 N=5 的 1.73、N=30 的 1.71。多轮修正在这里彻底失效:第 3 轮相对第 1 轮的变化在 −0.6 到 +0.7 点之间——费米问题的错误是数量级级别的,而连续估计没有可验证的中间步骤,讨论无从下嘴。与此同时 pass@30 却涨到了 57.3%,潜力明明在涨,平均机制就是够不着那个答对的人——投票至少需要离散选项,连续数字连"投票"这个动作都做不了。
误差解剖给出了根因。把每个模型的 log 误差按题目分解为题目级偏差 bₖ(模型在这道题上的习惯性偏移)加题目内噪声,偏差项平均占平方误差的 β = 0.87:题目间偏差的标准差高达 1.96 个数量级,题目内噪声的标准差只有 0.75。也就是说,一个模型无限次采样再平均,最多也只能削掉那 13% 的噪声,实测从 N=1 到 N=30 误差只降了约 6%。13 个模型的 N=1→N=5 误差削减普遍在 0.9%–8.1% 之间,唯一的例外是采样最分散的 marin-8b(15.4%)。式 4 再次精确命中:对全部 10 个模型预测每个团队规模的平均误差,误差仅 0.6%(r = 0.997)。五个 agent 的有效容量 N_eff(5) 只有 1.04–1.32——五个人,顶一个半人用。
无偏性假设的检验更扎心。看全局平均误差,mistral-7b 高估 +0.71 个数量级(b=+0.65 的 qwen2.5-3b、+0.62 的 llama3.1-8b 同样系统性高估),marin-8b 低估 −0.20。就算 qwen2.5-7b 和 qwen3-8b 的全局均值勉强跨过零线,无偏性在单题层面照样崩塌:给定一道题,所有样本绕着模型的习惯性答案扎堆。这些习惯性答案是哪来的?LLM 内化了一套关于物理、人口、地理量的错误先验——它们是同一批互联网语料喂出来的,所以31.5% 的题目上,所有模型朝同一个方向犯错,模型间题目级偏差的平均相关高达 r = 0.63。
🏷️ 九、一个诚实的插曲:当标准答案本身是错的
在深挖之前,必须先交代一个数据诚信问题——这也是这篇论文让人敬重的地方。RealFP 的参考答案里有不合情理的标签:比如问一个人有多少祖先,参考值写着 2×10⁹⁰(比全宇宙的原子数还多不知多少个数量级)。529 道题里,**144 道(27.2%)**的十模型中位数估计偏离参考值超过三个数量级。
作者没有和稀泥,而是做了标签清洗:剔除这 144 题后,385 题的"干净"子集上所有数字都水涨船高(单 agent 准确率 40.9%,pass@30 达到 70.8%),但模式纹丝不动——N=30 平均准确率仍只到 43.6%,误差从 1.52 降到 1.37,β 仍高达 0.82,模型间偏差相关从 0.63 降到 0.41,"所有模型同向犯错"的题目占比从 31.5% 降到 19.1%。结论稳健:费米天花板的病根是模型的系统性偏差,不是数据的脏。这个插曲本身也是个提醒:连"一头牛的重量"这种基准,都可能悄悄内嵌着出题人的偏见。
🌈 十、混合团队:五个不同牌子的学生,错得不一样
既然同门师兄弟错得一样,那换师承呢?论文做了两组异质团队实验。第一组是"最强五人池":从八个最强模型里选出的最优五模型组合(gpt-oss-20b、r1-distill-qwen-14b、qwen3-8b、phi4-14b、smollm3-3b),在数据的随机一半上选队、另一半上评测,成员间错误相关 ρ 降到 0.37,N=5 有效容量 2.01,拿到 83.2%,比成员均值高 +22.1 点——听起来是巨大胜利。
但在全部 10 次分割里,它无一例外地输给了自己最强的成员 gpt-oss-20b(86.8%),差 3.4 到 4.3 点。五个 7B–8B 不同厂商模型的组合同理:39.8%,比成员均值高 +7.8 点,比最强成员 qwen2.5-7b 低 2.5 点;真实异质运行(每任务 100 题)复核了这个模式(22.2% 对 30.3%)。这正是 1982 年 Nitzan 和 Paroush 的经典结论在 AI 身上的重演:当成员能力不一时,等权投票是次优决策规则——你让诸葛亮和四个臭皮匠一人一票,合体的智慧就被皮匠们稀释了。多篇近期研究(Pappu et al., 2026)也独立发现了"多智能体团队拖累专家"的现象。
补偿型任务上,异质性才是真解药。因为各模型的题目级偏差只相关 0.63——还没到 1——平均确实能抵消一部分系统性成见:五人 7B–8B 池把成员均值的误差砍掉 25.8%(CI [23.1, 28.7]),平均对数误差 1.45,比池内最强成员单干(1.80)还准。这是全文里唯一一处"团队稳定超越最强个体"的场景,因为它攻击的正是偏差项 bₖ 本身——不同模型各有各的错法,错法之间的差异就是信息。
🛠️ 十一、能洗掉偏差吗?干预实验的白忙活
附录 F 像一份诚实的失败清单。既然同质团队破不了补偿型天花板,作者试了六种干预:给不同 agent 塞不同的分解策略前缀(top-down、bottom-up、rate×time)、不同的完整估算模板、把计算卸载到 log 空间(logcalc)、换单位制推理、插入常数表做地基、以及模板组合。结果:唯一有点用的是"结构化脚手架"(N=5 准确率 36.3% 对基线 33.1%,且置信区间重叠);所有 logcalc 变体反而降低了准确率——把估计拆成因子再乘起来,误差在乘法里滚起了雪球,gpt-oss-20b 单干也被 logcalc 从 52.0% 拖低到 48.0%。
另一个测试对象是 Ornith-1.5-9B,一个用强化学习针对智能体编程微调过的专才模型,对比基座 Qwen3.5-9B 在 RealFP 和科学奥赛估算集(SciOly)上的表现:RealFP 上两个 PoT/脚手架配置都只 +0.4 点(置信区间跨零),SciOly 上仅脚手架配置 +5.7 点。在估计能力这件事上,专才训练几乎没有泛化红利——偏差是数据先验级别的,不是提示词级别的。唯一稳定有效的提升来自 Program-of-Thought 提示(两模型在 RealFP 上都约 50% 一阶准确率,SciOly 上 76%),但那改变的是个体估计的算法,不是团队的组合机制。
💡 十二、启示:任务结构 × 组合机制 = 天花板
把三块拼图拼起来,这篇论文的完整图景是:scaling 的收益 = 任务潜力 × 组合机制的兑现率,两个因子都不能为零。
对析取型任务,潜力 pass@N 真实存在且可观(5–20 点),但直接投票的兑现率趋近于零——众数收敛定理(0.48 点预测精度、r = 0.999)说明这道天花板是结构性的,不是调参能绕过去的。想兑现潜力,只有两条路:其一,先推理后作答——让采样在答案空间里真正散开,把正确答案顶成众数;其二,换组合机制——验证器、奖励模型、结构化的辩论,去做"识别那个答对的人"这件投票做不到的事。pass@N 与投票准确率之间的差,正是这些机制必须回收的过程损耗。
对补偿型任务,天花板更低也更硬:β = 0.87 的偏差占比意味着同质采样最多换 6% 的误差削减,扩大规模、多轮讨论、温度调节统统无效。唯一被验证的出路是异质化——混合不同模型家族去抵消彼此的题目级偏差(25.8% 削减,超越最强成员)。换句话说,对连续估计任务,你要的不是更多的采样,而是不一样的错法。
这对整个 MAS 工程实践是一条冷峻但建设性的备忘录:别再默认"加 agent = 加智能"。先分型,再选机制。析取型配验证器,补偿型配异质组合,合取型现在还没有任何好办法(留给未来),加总型请警惕林格曼损耗。团队规模的 N 是乘号前面的数字,乘号后面的那个因子,才是多数人从没算过的账。
顺带一提,这个框架还顺手解释了工程界几桩悬案:为什么多智能体辩论越吵越同质(从众效应把条件独立假设撕得粉碎);为什么采样预算砸在同一模型上边际收益递减(N_eff 被 1/ρ 封顶,三十个 agent 的有效容量常常不到两个);为什么混合不同家族的模型在有些任务上立竿见影、在另一些任务上徒劳无功(差别全在任务是析取还是补偿——前者拼最强个体,后者拼偏差错位)。一个来自 1972 年的分类学,就这样把 2026 年最热门的工程直觉重新校准了一遍。
更深一层的启示关乎"多样性"这个词的滥用。行业里人人都在喊 diversity,但本文的分解告诉我们多样性有两种,作用方向相反:答案分布的多样性(ρ 低、众数易位)对投票有帮助,而对连续估计,真正值钱的是偏差结构的多样性——错的方向不同,才谈得上互相抵消。盲目调高温度换来的是前一种多样性,它洒在错误答案上,一文不值;跨家族组队换来的是后一种,它直接攻击 87% 的误差主体。花钱之前,先想清楚自己买的是哪一种。
⚠️ 十三、诚实的边界:这个模型的已知裂缝
作者自己列出的局限值得逐条记住。第一,answer-first 提示压低了绝对准确率,也塑造了修正增益的构成;思维链提示下的投票天花板有多高,本文没有回答——不过众数收敛的机制本身不依赖这个设定。第二,实验里没有"无同伴的修正"对照组,无法彻底分离"看到同伴答案"和"获准重新推理"的贡献。第三,费米结论建立在单个带噪声标签的基准上(虽然干净子集上模式不变)。第四,全部模型都是不超过 20B 的开放权重模型,加总型、合取型、裁量型三类任务尚未检验。第五,条件独立假设本身是理想化:真实 agent 间的交互、辩论中的从众效应(conformity)、共享上下文的隐性泄漏,都可能让实测比理论更糟而非更好。理论给出的是天花板的位置,不是地板。
但即便如此,这个框架的力量恰恰在于它的"不够好":一个只用了"题目条件独立"这一条假设的简单模型,就把 650 个配置的投票行为预测到 0.48 个点以内。当解释如此节俭,结论就很难被推翻——AI 多智能体的 scaling,从来不只是规模问题,而是任务结构的问题。这大概是这篇论文留给行业最值钱的一句话:在人多的幻觉面前,数学是唯一的清醒剂。
回头再看高尔顿的牛。八百个英格兰农夫之所以猜得准,是因为每个人都用各自的生活经验掂量那头牛——有人凭屠宰的经验,有人凭喂养的手感,有人纯粹看热闹——误差独立且无偏地散开,中位数才有魔法。而今天的 LLM 团队,三十个 agent 是同一套权重、同一片语料的三十次回声。让回声投票,投出来的永远是它自己。想复刻 Vox populi,先想办法让房间里坐着真正不一样的人。
参考文献
Fortuna C., Bertalanič B. "Multi-agent Scaling Across Disjunctive and Compensatory Tasks." arXiv:2609.31563, 2026.
https://arxiv.org/abs/2609.31563
#论文 #arXiv #AI #多智能体 #费曼解读 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。