40 道题学会怎么开会,五个基准上多出 17.9 个点

15 道数学题,25 道研究生级别的知识题。斯坦福与 Together AI 的团队用这 40 道题训练智能体学会怎么组织协作,学完直接搬到没见过的基准上,策略一行不改。

15 道数学题,25 道研究生级别的知识题。斯坦福与 Together AI 的团队用这 40 道题训练智能体学会怎么组织协作,学完直接搬到没见过的基准上,策略一行不改。

论文 9 月 19 日挂上 arXiv,编号 2609.22682,已被 COLM 2026 与 EMNLP 2026 的 workshop 收录为 poster。

固定协议这道墙

集体智能不只取决于成员各自懂什么,还取决于他们怎么组织工作。这句话放在人类团队上是常识。当解的结构事先未知时,有用的角色和分工没法预先指定,团队只能边做边学怎么组织推理。人类团队天天这么干,现有 AI 智能体团队则依赖固定协议、显式任务分解或者路由。

SAT(Self-Organizing Agent Teams)的做法是给固定的智能体团队一套从既往协作中学来的可复用策略,用来组织角色、对话阶段、参与度与信息流。

作者给这套机制起了个名字,叫协作计算(collaborative computation):智能体交换、质疑、修补、综合彼此的部分推理,产出任何成员独立都得不到的解。

四个对照组摆在一起

在两个独立场景中,团队学到的协作策略原样迁移到未见基准上。五个数学与物理基准的平均准确率是这样排的。

对照平均准确率
自组织团队 SAT66.7%
最强成员单独作答48.8%
该成员在同等算力预算下的推理58.7%
对成员独立答案的完美路由59.0%
第三行值得停一下。给最强成员同样的算力预算,它从 48.8% 涨到 58.7%,说明涨的那部分里有一块是算力换来的。自组织团队仍然高出 8 个点。

第四行是更硬的对照。那个路由能看到所有成员独立给出的答案,只要有一个答对它就选对,这是独立作答这条路的天花板。SAT 比它高 7.7 个点,在 AIME 2026 上高出 13.4 个点。讨论过程中确实产出了没有任何成员单独想到的答案。

什么时候组队才划算

增益在不同基准之间差异不小,作者没有回避这件事,反而把它变成了论文里的第二个问题:什么时候自组织协作真的有用。

答案落在组织心理学的一个构念上,叫可论证性(demonstrability),指的是团队能不能分辨出正确与错误的推理。跨八个基准,这个指标与相对最强成员的改进幅度强相关,Spearman 相关系数 0.90,p 值 0.005。

换个说法:正确推理一旦出现就能被认出来的时候,团队获益最大。认不出来,多几个成员吵也吵不出结果。

这条相关有个实际用途。它把要不要上多智能体从一个信仰问题变成了一个可以先测的量:先测成员能不能认出正确推理,再决定值不值得付协作那份算力。

更宽的那句主张

论文最后把结论推到了一层:组织本身可以成为一种智能体能力。智能体团队能够学会如何一起推理,产出成员独立到不了的解。

这句话的分量在于它指的方向。过去两年提升多智能体性能的主流路径有两条,一条是训练更大的单个模型,一条是手工设计更精巧的编排协议。如果组织方式是可学的,就多了一条更便宜也更通用的路:成员不变,改的是它们之间怎么说话。

需要留在桌面上的限定

有三件事现在还不能说死。

作者自己在传播时说明,这些结果仍待独立复现。增益在不同基准之间差异很大,66.7% 是五个基准的平均,不是每个基准都涨。

那 40 道题的构成也值得留意。15 道数学题加 25 道研究生级别的知识题,练习量小是这套方法的卖点,同时也意味着学到的策略对练习集的选取会敏感。

还有一层是评估口径。完美路由这个对照组是在成员独立答案上做的,它没有覆盖成员在讨论中被提示后才答对的情形,而那个情形恰恰是协作计算的核心。所以 59.0% 这个天花板,位置本身就是按独立作答定义的。

参考信源

  • Aneesh Pappu、Mirac Suzgun、Yongchan Kwon、Federico Bianchi、Batu El、Mykel J. Kochenderfer、Hancheng Cao、James Zou《Self-Organizing Agent Teams Learn to Reason Together》,arXiv:2609.22682,2026-09-19 提交
  • 论文摘要中关于五个基准 66.7% 对 48.8%、算力匹配 58.7%、完美路由 59.0%,以及 AIME 2026 上 13.4 个点的表述
  • 跨八个基准可论证性与改进幅度的 Spearman 0.90、p 值 0.005
  • COLM 2026 与 EMNLP 2026 workshop poster 收录信息
#多智能体 #数学推理 #协作计算

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens