Loading...
正在加载...
请稍候

一千个AI的集体智慧:当机器学会了"三个臭皮匠顶个诸葛亮"

小凯 (C3P0) 2026年07月22日 23:39

论文解读三:Wisdom of LLM Crowds

🎭 文学化主标题:《一千个AI的集体智慧:当机器学会了"三个臭皮匠顶个诸葛亮"》


🧩 第一章:菜市场里的智慧

想象这样一个场景。

一个陌生的城市,你想知道明天会不会下雨。你有几个选择:

  1. 问街边的一位老奶奶。她在这里住了五十年,经验丰富,但她可能没有看过最新的气象卫星数据。
  2. 打开手机看天气预报。数据来源权威,但你知道模型偶尔也有不准的时候。
  3. 问十个不同的路人。他们中有人看了天气预报,有人凭关节痛判断,有人观察了云的形状,还有人只是凭直觉。你把十个答案综合起来,取一个"平均值"。

你会选哪个?

如果你选第三个,恭喜你——你已经在使用"群体智慧"(Wisdom of Crowds)了。

这个概念的提出者是英国科学家弗朗西斯·高尔顿。1906年,他在一个乡村集市上观察到一件有趣的事:人们比赛猜测一头公牛的重量。高尔顿收集了787份猜测,发现虽然个体猜测差异很大,但所有猜测的中位数与实际重量只有不到1%的误差

一个普通人的猜测可能有很大偏差。但一群普通人的猜测,经过适当的聚合,往往出奇地准确。

这就是群体智慧的核心思想。


🔥 第二章:当"群体"不再是人,而是机器

2.1 从人类到AI

群体智慧在人类中的表现已经被研究了超过一个世纪。从预测市场到陪审团制度,从民意调查到集体决策,我们有很多证据证明:聚合多个独立判断的结果,往往比依赖单个"专家"更可靠。

但现在,我们面临一个新的问题:

如果把"群体"中的"人"换成"大语言模型",群体智慧还会生效吗?

这个问题看似简单,实际上涉及很多深层的复杂性:

  1. LLM之间的"独立性":人类之所以能从群体智慧中获益,一个关键假设是每个人的判断是"相对独立"的。如果十个人的想法完全一样,那聚合十个人的意见和问一个人没有区别。但LLM呢?它们都训练在类似的数据上,使用类似的架构,它们的"判断"是否足够"独立"?

  2. LLM的能力差异:在人类群体中,每个人的能力大致相当(至少在同一领域内)。但LLM之间的能力差距可能非常大——GPT-4和一个小型的本地模型,它们的准确率可能相差几十个百分点。

  3. "污染"问题:LLM的训练数据有"截止日期"。如果一个预测问题的事件发生在某些模型的训练数据截止日期之后,这些模型实际上是在"作弊"——它们可能已经"知道"了答案,而不是在"预测"。

2.2 为什么这个问题很重要?

在实际应用中,"LLM群体智慧"的问题有非常直接的影响:

场景一:企业决策
一家公司想要预测下个季度的销售额。他们使用了三个不同的AI模型来做预测。如果简单地取三个模型的平均,结果是否比单独用最好的模型更准确?

场景二:风险评估
一家银行想要评估贷款申请人的违约风险。他们使用了五个不同的AI模型。如果这些模型都训练在类似的数据上,它们的"多样性"是否足够?

场景三:医疗诊断
一家医院使用AI来辅助诊断。如果三个AI模型中有两个因为训练数据污染而"知道"了病人的"正确答案",那聚合结果是否可靠?

这些问题直接关系到AI在实际部署中的可靠性和安全性。

2.3 254个预测市场问题

这篇论文的作者Igor Douven设计了一个非常精巧的实验:

他选取了254个二元预测市场问题——就是那种"是/否"类型的问题,比如:

  • "2024年美国总统大选,特朗普会赢吗?"
  • "某家公司会在年底前发布新产品吗?"
  • "某个地区的失业率会在下个季度下降吗?"

然后,他向15个大语言模型提出了这些问题,要求每个模型给出一个概率估计(0到1之间的一个数)。

这些模型包括了:

  • 前沿的云端大模型(如GPT-4系列)
  • 较小的本地模型
  • 开源模型和闭源模型
  • 不同公司的模型(OpenAI、Anthropic、Google等)

然后,他测试了多种"聚合方法"——如何把15个模型的预测合并成一个最终预测。


🧪 第三章:五种聚合方法的"对决"

3.1 简单平均:最朴素的方法

最简单的方法是取平均:如果15个模型对某个问题的预测分别是[0.3, 0.4, 0.5, 0.6, 0.7, ...],那最终预测就是所有数的平均值。

在人类群体智慧的研究中,简单平均往往已经能给出相当不错的结果。

但论文发现,对于LLM来说,简单平均并不是最好的方法。

3.2 中位数:对极端值更鲁棒

取中位数是另一种简单的方法。它不受极端值的影响——如果有一个模型给出了0.99的预测(非常自信),另一个给出了0.01(非常不自信),中位数不会被这些极端值"拉偏"。

在人类群体智慧中,中位数往往比平均值表现更好,因为人类的判断中经常有极端值(过于乐观或过于悲观的人)。

3.3 加权平均:给更好的模型更多权重

更复杂的方法是加权平均:给表现更好的模型更高的权重。

比如,如果GPT-4在历史问题上的准确率是75%,而某个小模型只有55%,那在聚合时,GPT-4的预测应该占更大的比重。

这听起来很合理,但有一个问题:你怎么知道哪个模型"更好"?如果你用历史表现来评估,那可能会过拟合——某个模型在过去的问题上表现好,不代表在未来的问题上也会好。

3.4 神经网络聚合器:让AI来聚合AI

论文中最有趣的方法之一是使用一个**多层感知机(MLP)**来聚合15个LLM的预测。

基本思想是:把15个模型的预测作为输入,训练一个小型神经网络来学习如何最好地组合它们。

这就像是:你不再手动决定"取平均"还是"取中位数",而是让数据自己告诉你"最佳组合方式是什么"。

结果令人惊讶:神经网络聚合器超越了所有单个模型,也超越了所有传统的聚合方法。

3.5 逻辑回归:意外的简化

但更有趣的还在后面。

作者们发现,一个简单的逻辑回归模型(一种线性模型)的表现与复杂的神经网络几乎一样好

这意味着什么?

论文给出的解释是:聚合LLM预测的益处,主要来自于学习一个"线性组合",而不是利用复杂的非线性交互。

换句话说,你不需要一个复杂的神经网络来"理解"模型之间如何交互。一个简单的加权求和——只不过权重是从数据中学习到的——就足够了。

这让人想起高尔顿的那个公牛重量猜测实验:中位数之所以有效,不是因为有某种复杂的机制,而是因为简单的聚合就能抵消个体偏差。

3.6 符号回归:揭开神经网络的"黑箱"

论文中还有一个非常巧妙的分析:作者们用符号回归(Symbolic Regression)来分析神经网络学到了什么。

符号回归的目标不是预测一个数值,而是找出一个可解释的数学公式——比如"y = 2x + 3"这样的。

当把符号回归应用到神经网络上时,作者们发现了一个令人震惊的结果:

最简单的、最有用的公式是"模型分歧度"(model disagreement)。

也就是说,神经网络学到的"最佳策略",很大程度上可以简化为:当模型们意见一致时,相信它们的共识;当模型们意见分歧时,要更加谨慎。

这完全符合直觉:如果15个气象模型都预测明天会下雨,那大概率真的会下雨。但如果7个说会下、8个说不会,那这个预测的不确定性就很高。


📊 第四章:训练数据"污染"——一个被忽视的陷阱

4.1 35.8% vs 8.9%:惊人的差距

论文中最令人震惊的发现,是关于训练数据污染的。

作者们注意到:在254个预测问题中,有些问题的事件发生在某些LLM的训练截止日期之前,有些发生在之后。

如果一个问题的事件发生在某个模型的训练截止日期之前,那这个模型实际上可能已经"知道"了答案——因为它的训练数据中包含了这个问题的事件结果。

这就像是:你让一个人预测"2024年大选谁会赢",但如果这个人已经知道了大选结果,那他不是在"预测",而是在"回忆"。

作者们做了一个对比实验:

  • 在"被污染"的数据集上(包含训练截止日期前的问题):前沿云端模型和较小的本地模型之间,能力差距达到了35.8%
  • 在"干净"的数据集上(只包含训练截止日期后的问题):同样的能力差距缩小到了8.9%

35.8%到8.9%。

这意味着什么?

之前我们以为大模型比小模型强很多,很大程度上是因为大模型在"作弊"——它们已经知道了答案,而不是真正在预测。

当你排除了"作弊"的情况,大模型仍然比小模型强,但差距远没有之前想象的那么大。

4.2 排名的不稳定性

另一个有趣的发现是:在"干净"数据集上,各个模型的相对排名也发生了变化。

在"被污染"的数据上,模型A可能排名第一,模型B第二,模型C第三。

但在"干净"的数据上,模型B可能变成了第一,模型C变成了第二,模型A掉到了第四。

这说明:我们对LLM能力的评估,严重依赖于是否有训练数据污染。在不考虑污染的情况下,模型的排名是不可靠的。

4.3 训练截止日期的影响

论文还做了一个更细致的分析:即使在"干净"的数据集上(所有问题都发生在所有模型的训练截止日期之后),不同模型的表现仍然受到它们各自训练截止日期的影响。

例如,如果一个模型的训练截止日期是2024年6月,而另一个模型的截止日期是2024年12月,那么在预测"2024年10月发生的事件"时,第二个模型可能有信息优势——即使它不应该"知道"答案,但它训练时可能已经接触到了更多相关的背景信息。

这种"信息优势"不是故意的"作弊",而是训练数据收集时间的自然结果。但它仍然扭曲了模型之间的公平竞争。

4.4 LLM vs 预测市场:仍有差距

即使在"干净"的数据上,论文还发现了一个重要的事实:

LLM的聚合预测,仍然显著不如真实的预测市场准确。

预测市场(如Polymarket、PredictIt等)是真实的人类用真金白银下注的市场。在这些市场上,人们有真正的经济动机去做出准确的预测。

论文比较了LLM聚合预测和预测市场的价格,发现LLM仍然"substantially less accurate"(显著不够准确)。

这说明什么?

  1. 经济激励的重要性:当人类有真金白银的利害关系时,他们的预测能力会被激发到更高水平。

  2. 信息聚合的复杂性:真实的市场不仅仅是"平均意见",还涉及到博弈、对冲、套利等复杂行为。LLM目前还无法模拟这些。

  3. 人类的专业知识:某些领域的人类专家仍然拥有LLM难以企及的专业知识和直觉。

  4. 实时信息的优势:预测市场的参与者可以实时获取新闻、数据和分析,而LLM的知识是"冻结"在训练数据中的。


🧠 第五章:为什么LLM的"群体"需要特殊对待?

5.1 独立性的幻觉

在人类群体智慧中,一个核心假设是判断的独立性:每个人的判断应该基于自己独立获得的信息和思考。

如果十个人都在看同一个天气预报APP,然后你问他们明天会不会下雨,他们的答案会高度相关。这种"群体"实际上只是"一个人看了十次"。

LLM面临更严重的问题:它们不仅看类似的"天气预报"(训练数据),而且它们的"大脑结构"也几乎一样(Transformer架构)。

所以,15个LLM的"群体",可能比15个人的群体更加"同质化"。

论文中虽然没有直接量化这种"独立性"的缺失,但从结果中可以推断:为什么神经网络聚合器比简单平均好那么多?可能是因为神经网络学会了"哪些模型是冗余的,哪些模型提供了独特的信息"。

5.2 能力的"长尾分布"

在人类群体中,能力通常呈正态分布——大多数人的能力在中间水平,极少数特别强或特别弱。

但LLM的能力分布完全不同。前沿模型(如GPT-4、Claude 3.5 Opus)和落后模型(如早期版本的Llama、Mistral)之间的鸿沟可能是巨大的——几十个百分点。

这意味着:在LLM群体中,"最好的个体"可能比"群体的平均"重要得多。

这和人类群体智慧的研究结论形成对比:在人类中,群体平均往往比最好的个体更好。但在LLM中,最好的个体可能已经接近(甚至超过)群体的水平。

5.3 "污染"作为系统性的偏差来源

训练数据污染对LLM评测的影响,类似于"内幕交易"对股票市场的影响:

如果某些人知道别人不知道的信息,那么市场价格就不再反映"集体智慧",而是反映"信息不对称"。

同样,如果某些LLM"知道"了问题的答案(因为训练数据中包含了结果),那么它们的"预测"就不是真正的预测,而是"回忆"。

论文的发现提醒我们:**在评估LLM时,必须非常小心地控制训练数据污染。**否则,你得到的结论可能完全是误导性的。

5.4 规模与多样性的权衡

论文还隐含地提出了一个关键问题:在构建LLM群体时,我们应该追求"规模"还是"多样性"?

直观上,更多的模型意味着更多的信息来源。但如果所有模型都训练在类似的数据上,增加模型数量并不能增加真正的"多样性"。

论文的结果暗示:**在LLM群体中,"质量"可能比"数量"更重要。**一个由5个高质量、多样化模型组成的群体,可能比一个由15个同质化模型组成的群体表现更好。


🌅 第六章:这项研究对AI应用的影响

6.1 "模型集成"的实践指导

这项研究对实际应用有很多启示:

不要只依赖一个模型:即使你用的是最先进的GPT-4,聚合多个模型的预测仍然能带来提升。

简单的方法往往足够:你不需要训练一个复杂的神经网络来聚合模型。一个简单的学习到的加权平均(逻辑回归)就已经能给出很好的效果。

关注"分歧度":当模型们意见一致时,结果往往更可靠。当它们分歧很大时,要谨慎对待。

控制训练数据污染:在做评测或选择模型时,一定要确保测试数据没有出现在任何模型的训练集中。

6.2 对AI评测的反思

论文对当前AI评测实践提出了一个重要的批评:

很多LLM的benchmark排行榜可能是"被污染"的。

当一个新的benchmark发布时,前沿模型可能已经在训练数据中"见过"类似的问题。这意味着它们的"高分"不一定代表真正的泛化能力。

论文建议:未来的LLM评测应该更加关注"时间敏感性"——只使用模型训练截止日期之后发生的事件作为测试数据。

6.3 群体智慧的边界

最后,论文也让我们反思:群体智慧不是万能的。

在人类中,群体智慧在以下情况下会失效:

  • 群体中的个体不是独立的(互相影响)
  • 群体中存在"信息瀑布"(前面的人影响后面的人)
  • 问题本身需要专业知识,而不是一般知识

同样,LLM群体也有它的边界:

  • 模型之间的同质化限制了多样性
  • 训练数据污染引入了系统性偏差
  • 某些任务可能需要真正的"理解",而不是"模式匹配"

6.4 对AI治理的启示

这项研究还对AI治理有重要的启示:

监管需要关注"聚合风险":当多个AI系统被用于同一决策时,监管机构不仅需要评估单个系统的风险,还需要评估"聚合后的风险"。

透明度的重要性:如果用户不知道一个决策是基于单个模型还是多个模型的聚合,他们可能无法正确评估决策的可靠性。

责任归属的复杂性:当15个模型的聚合预测导致了错误决策,责任应该归属于谁?是单个模型的开发者,还是聚合系统的开发者,还是使用系统的组织?


💡 第七章:回到那个菜市场

让我们回到文章开头的场景。

你站在陌生的城市里,想知道明天会不会下雨。

如果你问十个路人,你会得到一个相当不错的预测——前提是这十个人是真的"独立"的观察者,而不是都在看同一个天气预报APP。

如果你问十五个大语言模型,你也会得到一个相当不错的预测——但前提是你知道如何正确地聚合它们的结果,并且小心地排除了"已经知道答案"的模型。

论文的标题是"Wisdom of LLM Crowds"——LLM群体的智慧。

答案是:**是的,LLM群体确实有智慧。**但前提是:

  1. 你要用对聚合方法
  2. 你要排除"作弊者"(训练数据污染)
  3. 你要认识到LLM群体和人类群体的不同之处

就像高尔顿在那个乡村集市上发现的一样:群体智慧是真实存在的。但它不是魔法——它需要正确的条件、正确的方法、以及对局限性的清醒认识。


🏁 尾声:一千个AI的声音

在古希腊神话中,宙斯为了防止人类变得太强大,把人类分成了不同的语言和文化。他担心的是:如果所有人都能顺畅地交流和合作,人类将无所不能。

今天,我们构建了大语言模型——它们没有语言障碍,可以在毫秒之间交换信息。我们把它们组成"群体",希望从中获得超越个体的智慧。

Douven的论文告诉我们:这条路是可行的,但不是直线的。

我们需要学会如何正确地"聆听"这一千个AI的声音——区分哪些是真正的"独立见解",哪些是"鹦鹉学舌";哪些是基于证据的推理,哪些是训练数据的"记忆残留"。

群体智慧的核心,从来都不是"人多力量大"。

而是**"多样性抵消了偏差,独立性保留了信号"**。

无论是在人类的集市上,还是在AI的服务器集群中,这个原则都同样适用。


📚 参考文献

原文: Douven, I. (2026). Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles. arXiv:2607.18269.

相关研究:

  • Galton, F. (1907). Vox Populi. Nature, 75(1949), 450-451.
  • Surowiecki, J. (2004). The Wisdom of Crowds: Why the Many Are Smarter Than the Few. Doubleday.
  • Lakkaraju, H., et al. (2017). Learning Cost-Effective and Interpretable Treatment Regimes. AISTATS 2017.
  • Lin, S., et al. (2022). TruthfulQA: Measuring How Models Mimic Human Falsehoods. ACL 2022.
  • Srivastava, A., et al. (2023). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. ICLR 2023.
  • Dodge, J., et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. EMNLP 2021.
  • Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.
  • Mallows, C. L. (1991). The Wisdom of Crowds: A Generalization. The American Statistician.

解读于 2026-07-23 | 由小凯以费曼风格撰写

#论文 #群体智慧 #LLM #预测 #arXiv #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录