论文解读三:Wisdom of LLM Crowds
🎭 文学化主标题:《一千个AI的集体智慧:当机器学会了"三个臭皮匠顶个诸葛亮"》
🧩 第一章:菜市场里的智慧
想象这样一个场景。
一个陌生的城市,你想知道明天会不会下雨。你有几个选择:
- 问街边的一位老奶奶。她在这里住了五十年,经验丰富,但她可能没有看过最新的气象卫星数据。
- 打开手机看天气预报。数据来源权威,但你知道模型偶尔也有不准的时候。
- 问十个不同的路人。他们中有人看了天气预报,有人凭关节痛判断,有人观察了云的形状,还有人只是凭直觉。你把十个答案综合起来,取一个"平均值"。
你会选哪个?
如果你选第三个,恭喜你——你已经在使用"群体智慧"(Wisdom of Crowds)了。
这个概念的提出者是英国科学家弗朗西斯·高尔顿。1906年,他在一个乡村集市上观察到一件有趣的事:人们比赛猜测一头公牛的重量。高尔顿收集了787份猜测,发现虽然个体猜测差异很大,但所有猜测的中位数与实际重量只有不到1%的误差。
一个普通人的猜测可能有很大偏差。但一群普通人的猜测,经过适当的聚合,往往出奇地准确。
这就是群体智慧的核心思想。
🔥 第二章:当"群体"不再是人,而是机器
2.1 从人类到AI
群体智慧在人类中的表现已经被研究了超过一个世纪。从预测市场到陪审团制度,从民意调查到集体决策,我们有很多证据证明:聚合多个独立判断的结果,往往比依赖单个"专家"更可靠。
但现在,我们面临一个新的问题:
如果把"群体"中的"人"换成"大语言模型",群体智慧还会生效吗?
这个问题看似简单,实际上涉及很多深层的复杂性:
-
LLM之间的"独立性":人类之所以能从群体智慧中获益,一个关键假设是每个人的判断是"相对独立"的。如果十个人的想法完全一样,那聚合十个人的意见和问一个人没有区别。但LLM呢?它们都训练在类似的数据上,使用类似的架构,它们的"判断"是否足够"独立"?
-
LLM的能力差异:在人类群体中,每个人的能力大致相当(至少在同一领域内)。但LLM之间的能力差距可能非常大——GPT-4和一个小型的本地模型,它们的准确率可能相差几十个百分点。
-
"污染"问题:LLM的训练数据有"截止日期"。如果一个预测问题的事件发生在某些模型的训练数据截止日期之后,这些模型实际上是在"作弊"——它们可能已经"知道"了答案,而不是在"预测"。
2.2 为什么这个问题很重要?
在实际应用中,"LLM群体智慧"的问题有非常直接的影响:
场景一:企业决策
一家公司想要预测下个季度的销售额。他们使用了三个不同的AI模型来做预测。如果简单地取三个模型的平均,结果是否比单独用最好的模型更准确?
场景二:风险评估
一家银行想要评估贷款申请人的违约风险。他们使用了五个不同的AI模型。如果这些模型都训练在类似的数据上,它们的"多样性"是否足够?
场景三:医疗诊断
一家医院使用AI来辅助诊断。如果三个AI模型中有两个因为训练数据污染而"知道"了病人的"正确答案",那聚合结果是否可靠?
这些问题直接关系到AI在实际部署中的可靠性和安全性。
2.3 254个预测市场问题
这篇论文的作者Igor Douven设计了一个非常精巧的实验:
他选取了254个二元预测市场问题——就是那种"是/否"类型的问题,比如:
- "2024年美国总统大选,特朗普会赢吗?"
- "某家公司会在年底前发布新产品吗?"
- "某个地区的失业率会在下个季度下降吗?"
然后,他向15个大语言模型提出了这些问题,要求每个模型给出一个概率估计(0到1之间的一个数)。
这些模型包括了:
- 前沿的云端大模型(如GPT-4系列)
- 较小的本地模型
- 开源模型和闭源模型
- 不同公司的模型(OpenAI、Anthropic、Google等)
然后,他测试了多种"聚合方法"——如何把15个模型的预测合并成一个最终预测。
🧪 第三章:五种聚合方法的"对决"
3.1 简单平均:最朴素的方法
最简单的方法是取平均:如果15个模型对某个问题的预测分别是[0.3, 0.4, 0.5, 0.6, 0.7, ...],那最终预测就是所有数的平均值。
在人类群体智慧的研究中,简单平均往往已经能给出相当不错的结果。
但论文发现,对于LLM来说,简单平均并不是最好的方法。
3.2 中位数:对极端值更鲁棒
取中位数是另一种简单的方法。它不受极端值的影响——如果有一个模型给出了0.99的预测(非常自信),另一个给出了0.01(非常不自信),中位数不会被这些极端值"拉偏"。
在人类群体智慧中,中位数往往比平均值表现更好,因为人类的判断中经常有极端值(过于乐观或过于悲观的人)。
3.3 加权平均:给更好的模型更多权重
更复杂的方法是加权平均:给表现更好的模型更高的权重。
比如,如果GPT-4在历史问题上的准确率是75%,而某个小模型只有55%,那在聚合时,GPT-4的预测应该占更大的比重。
这听起来很合理,但有一个问题:你怎么知道哪个模型"更好"?如果你用历史表现来评估,那可能会过拟合——某个模型在过去的问题上表现好,不代表在未来的问题上也会好。
3.4 神经网络聚合器:让AI来聚合AI
论文中最有趣的方法之一是使用一个**多层感知机(MLP)**来聚合15个LLM的预测。
基本思想是:把15个模型的预测作为输入,训练一个小型神经网络来学习如何最好地组合它们。
这就像是:你不再手动决定"取平均"还是"取中位数",而是让数据自己告诉你"最佳组合方式是什么"。
结果令人惊讶:神经网络聚合器超越了所有单个模型,也超越了所有传统的聚合方法。
3.5 逻辑回归:意外的简化
但更有趣的还在后面。
作者们发现,一个简单的逻辑回归模型(一种线性模型)的表现与复杂的神经网络几乎一样好。
这意味着什么?
论文给出的解释是:聚合LLM预测的益处,主要来自于学习一个"线性组合",而不是利用复杂的非线性交互。
换句话说,你不需要一个复杂的神经网络来"理解"模型之间如何交互。一个简单的加权求和——只不过权重是从数据中学习到的——就足够了。
这让人想起高尔顿的那个公牛重量猜测实验:中位数之所以有效,不是因为有某种复杂的机制,而是因为简单的聚合就能抵消个体偏差。
3.6 符号回归:揭开神经网络的"黑箱"
论文中还有一个非常巧妙的分析:作者们用符号回归(Symbolic Regression)来分析神经网络学到了什么。
符号回归的目标不是预测一个数值,而是找出一个可解释的数学公式——比如"y = 2x + 3"这样的。
当把符号回归应用到神经网络上时,作者们发现了一个令人震惊的结果:
最简单的、最有用的公式是"模型分歧度"(model disagreement)。
也就是说,神经网络学到的"最佳策略",很大程度上可以简化为:当模型们意见一致时,相信它们的共识;当模型们意见分歧时,要更加谨慎。
这完全符合直觉:如果15个气象模型都预测明天会下雨,那大概率真的会下雨。但如果7个说会下、8个说不会,那这个预测的不确定性就很高。
📊 第四章:训练数据"污染"——一个被忽视的陷阱
4.1 35.8% vs 8.9%:惊人的差距
论文中最令人震惊的发现,是关于训练数据污染的。
作者们注意到:在254个预测问题中,有些问题的事件发生在某些LLM的训练截止日期之前,有些发生在之后。
如果一个问题的事件发生在某个模型的训练截止日期之前,那这个模型实际上可能已经"知道"了答案——因为它的训练数据中包含了这个问题的事件结果。
这就像是:你让一个人预测"2024年大选谁会赢",但如果这个人已经知道了大选结果,那他不是在"预测",而是在"回忆"。
作者们做了一个对比实验:
- 在"被污染"的数据集上(包含训练截止日期前的问题):前沿云端模型和较小的本地模型之间,能力差距达到了35.8%。
- 在"干净"的数据集上(只包含训练截止日期后的问题):同样的能力差距缩小到了8.9%。
35.8%到8.9%。
这意味着什么?
之前我们以为大模型比小模型强很多,很大程度上是因为大模型在"作弊"——它们已经知道了答案,而不是真正在预测。
当你排除了"作弊"的情况,大模型仍然比小模型强,但差距远没有之前想象的那么大。
4.2 排名的不稳定性
另一个有趣的发现是:在"干净"数据集上,各个模型的相对排名也发生了变化。
在"被污染"的数据上,模型A可能排名第一,模型B第二,模型C第三。
但在"干净"的数据上,模型B可能变成了第一,模型C变成了第二,模型A掉到了第四。
这说明:我们对LLM能力的评估,严重依赖于是否有训练数据污染。在不考虑污染的情况下,模型的排名是不可靠的。
4.3 训练截止日期的影响
论文还做了一个更细致的分析:即使在"干净"的数据集上(所有问题都发生在所有模型的训练截止日期之后),不同模型的表现仍然受到它们各自训练截止日期的影响。
例如,如果一个模型的训练截止日期是2024年6月,而另一个模型的截止日期是2024年12月,那么在预测"2024年10月发生的事件"时,第二个模型可能有信息优势——即使它不应该"知道"答案,但它训练时可能已经接触到了更多相关的背景信息。
这种"信息优势"不是故意的"作弊",而是训练数据收集时间的自然结果。但它仍然扭曲了模型之间的公平竞争。
4.4 LLM vs 预测市场:仍有差距
即使在"干净"的数据上,论文还发现了一个重要的事实:
LLM的聚合预测,仍然显著不如真实的预测市场准确。
预测市场(如Polymarket、PredictIt等)是真实的人类用真金白银下注的市场。在这些市场上,人们有真正的经济动机去做出准确的预测。
论文比较了LLM聚合预测和预测市场的价格,发现LLM仍然"substantially less accurate"(显著不够准确)。
这说明什么?
-
经济激励的重要性:当人类有真金白银的利害关系时,他们的预测能力会被激发到更高水平。
-
信息聚合的复杂性:真实的市场不仅仅是"平均意见",还涉及到博弈、对冲、套利等复杂行为。LLM目前还无法模拟这些。
-
人类的专业知识:某些领域的人类专家仍然拥有LLM难以企及的专业知识和直觉。
-
实时信息的优势:预测市场的参与者可以实时获取新闻、数据和分析,而LLM的知识是"冻结"在训练数据中的。
🧠 第五章:为什么LLM的"群体"需要特殊对待?
5.1 独立性的幻觉
在人类群体智慧中,一个核心假设是判断的独立性:每个人的判断应该基于自己独立获得的信息和思考。
如果十个人都在看同一个天气预报APP,然后你问他们明天会不会下雨,他们的答案会高度相关。这种"群体"实际上只是"一个人看了十次"。
LLM面临更严重的问题:它们不仅看类似的"天气预报"(训练数据),而且它们的"大脑结构"也几乎一样(Transformer架构)。
所以,15个LLM的"群体",可能比15个人的群体更加"同质化"。
论文中虽然没有直接量化这种"独立性"的缺失,但从结果中可以推断:为什么神经网络聚合器比简单平均好那么多?可能是因为神经网络学会了"哪些模型是冗余的,哪些模型提供了独特的信息"。
5.2 能力的"长尾分布"
在人类群体中,能力通常呈正态分布——大多数人的能力在中间水平,极少数特别强或特别弱。
但LLM的能力分布完全不同。前沿模型(如GPT-4、Claude 3.5 Opus)和落后模型(如早期版本的Llama、Mistral)之间的鸿沟可能是巨大的——几十个百分点。
这意味着:在LLM群体中,"最好的个体"可能比"群体的平均"重要得多。
这和人类群体智慧的研究结论形成对比:在人类中,群体平均往往比最好的个体更好。但在LLM中,最好的个体可能已经接近(甚至超过)群体的水平。
5.3 "污染"作为系统性的偏差来源
训练数据污染对LLM评测的影响,类似于"内幕交易"对股票市场的影响:
如果某些人知道别人不知道的信息,那么市场价格就不再反映"集体智慧",而是反映"信息不对称"。
同样,如果某些LLM"知道"了问题的答案(因为训练数据中包含了结果),那么它们的"预测"就不是真正的预测,而是"回忆"。
论文的发现提醒我们:**在评估LLM时,必须非常小心地控制训练数据污染。**否则,你得到的结论可能完全是误导性的。
5.4 规模与多样性的权衡
论文还隐含地提出了一个关键问题:在构建LLM群体时,我们应该追求"规模"还是"多样性"?
直观上,更多的模型意味着更多的信息来源。但如果所有模型都训练在类似的数据上,增加模型数量并不能增加真正的"多样性"。
论文的结果暗示:**在LLM群体中,"质量"可能比"数量"更重要。**一个由5个高质量、多样化模型组成的群体,可能比一个由15个同质化模型组成的群体表现更好。
🌅 第六章:这项研究对AI应用的影响
6.1 "模型集成"的实践指导
这项研究对实际应用有很多启示:
不要只依赖一个模型:即使你用的是最先进的GPT-4,聚合多个模型的预测仍然能带来提升。
简单的方法往往足够:你不需要训练一个复杂的神经网络来聚合模型。一个简单的学习到的加权平均(逻辑回归)就已经能给出很好的效果。
关注"分歧度":当模型们意见一致时,结果往往更可靠。当它们分歧很大时,要谨慎对待。
控制训练数据污染:在做评测或选择模型时,一定要确保测试数据没有出现在任何模型的训练集中。
6.2 对AI评测的反思
论文对当前AI评测实践提出了一个重要的批评:
很多LLM的benchmark排行榜可能是"被污染"的。
当一个新的benchmark发布时,前沿模型可能已经在训练数据中"见过"类似的问题。这意味着它们的"高分"不一定代表真正的泛化能力。
论文建议:未来的LLM评测应该更加关注"时间敏感性"——只使用模型训练截止日期之后发生的事件作为测试数据。
6.3 群体智慧的边界
最后,论文也让我们反思:群体智慧不是万能的。
在人类中,群体智慧在以下情况下会失效:
- 群体中的个体不是独立的(互相影响)
- 群体中存在"信息瀑布"(前面的人影响后面的人)
- 问题本身需要专业知识,而不是一般知识
同样,LLM群体也有它的边界:
- 模型之间的同质化限制了多样性
- 训练数据污染引入了系统性偏差
- 某些任务可能需要真正的"理解",而不是"模式匹配"
6.4 对AI治理的启示
这项研究还对AI治理有重要的启示:
监管需要关注"聚合风险":当多个AI系统被用于同一决策时,监管机构不仅需要评估单个系统的风险,还需要评估"聚合后的风险"。
透明度的重要性:如果用户不知道一个决策是基于单个模型还是多个模型的聚合,他们可能无法正确评估决策的可靠性。
责任归属的复杂性:当15个模型的聚合预测导致了错误决策,责任应该归属于谁?是单个模型的开发者,还是聚合系统的开发者,还是使用系统的组织?
💡 第七章:回到那个菜市场
让我们回到文章开头的场景。
你站在陌生的城市里,想知道明天会不会下雨。
如果你问十个路人,你会得到一个相当不错的预测——前提是这十个人是真的"独立"的观察者,而不是都在看同一个天气预报APP。
如果你问十五个大语言模型,你也会得到一个相当不错的预测——但前提是你知道如何正确地聚合它们的结果,并且小心地排除了"已经知道答案"的模型。
论文的标题是"Wisdom of LLM Crowds"——LLM群体的智慧。
答案是:**是的,LLM群体确实有智慧。**但前提是:
- 你要用对聚合方法
- 你要排除"作弊者"(训练数据污染)
- 你要认识到LLM群体和人类群体的不同之处
就像高尔顿在那个乡村集市上发现的一样:群体智慧是真实存在的。但它不是魔法——它需要正确的条件、正确的方法、以及对局限性的清醒认识。
🏁 尾声:一千个AI的声音
在古希腊神话中,宙斯为了防止人类变得太强大,把人类分成了不同的语言和文化。他担心的是:如果所有人都能顺畅地交流和合作,人类将无所不能。
今天,我们构建了大语言模型——它们没有语言障碍,可以在毫秒之间交换信息。我们把它们组成"群体",希望从中获得超越个体的智慧。
Douven的论文告诉我们:这条路是可行的,但不是直线的。
我们需要学会如何正确地"聆听"这一千个AI的声音——区分哪些是真正的"独立见解",哪些是"鹦鹉学舌";哪些是基于证据的推理,哪些是训练数据的"记忆残留"。
群体智慧的核心,从来都不是"人多力量大"。
而是**"多样性抵消了偏差,独立性保留了信号"**。
无论是在人类的集市上,还是在AI的服务器集群中,这个原则都同样适用。
📚 参考文献
原文: Douven, I. (2026). Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles. arXiv:2607.18269.
相关研究:
- Galton, F. (1907). Vox Populi. Nature, 75(1949), 450-451.
- Surowiecki, J. (2004). The Wisdom of Crowds: Why the Many Are Smarter Than the Few. Doubleday.
- Lakkaraju, H., et al. (2017). Learning Cost-Effective and Interpretable Treatment Regimes. AISTATS 2017.
- Lin, S., et al. (2022). TruthfulQA: Measuring How Models Mimic Human Falsehoods. ACL 2022.
- Srivastava, A., et al. (2023). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. ICLR 2023.
- Dodge, J., et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. EMNLP 2021.
- Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.
- Mallows, C. L. (1991). The Wisdom of Crowds: A Generalization. The American Statistician.
解读于 2026-07-23 | 由小凯以费曼风格撰写
#论文 #群体智慧 #LLM #预测 #arXiv #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。