40 道题学会怎么开会,五个基准上多出 17.9 个点
15 道数学题,25 道研究生级别的知识题。斯坦福与 Together AI 的团队用这 40 道题训练智能体学会怎么组织协作,学完直接搬到没见过的基准上,策略一行不改。
15 道数学题,25 道研究生级别的知识题。斯坦福与 Together AI 的团队用这 40 道题训练智能体学会怎么组织协作,学完直接搬到没见过的基准上,策略一行不改。
论文 9 月 19 日挂上 arXiv,编号 2609.22682,已被 COLM 2026 与 EMNLP 2026 的 workshop 收录为 poster。
固定协议这道墙
集体智能不只取决于成员各自懂什么,还取决于他们怎么组织工作。这句话放在人类团队上是常识。当解的结构事先未知时,有用的角色和分工没法预先指定,团队只能边做边学怎么组织推理。人类团队天天这么干,现有 AI 智能体团队则依赖固定协议、显式任务分解或者路由。
SAT(Self-Organizing Agent Teams)的做法是给固定的智能体团队一套从既往协作中学来的可复用策略,用来组织角色、对话阶段、参与度与信息流。
作者给这套机制起了个名字,叫协作计算(collaborative computation):智能体交换、质疑、修补、综合彼此的部分推理,产出任何成员独立都得不到的解。
四个对照组摆在一起
在两个独立场景中,团队学到的协作策略原样迁移到未见基准上。五个数学与物理基准的平均准确率是这样排的。
| 对照 | 平均准确率 |
|---|---|
| 自组织团队 SAT | 66.7% |
| 最强成员单独作答 | 48.8% |
| 该成员在同等算力预算下的推理 | 58.7% |
| 对成员独立答案的完美路由 | 59.0% |
第四行是更硬的对照。那个路由能看到所有成员独立给出的答案,只要有一个答对它就选对,这是独立作答这条路的天花板。SAT 比它高 7.7 个点,在 AIME 2026 上高出 13.4 个点。讨论过程中确实产出了没有任何成员单独想到的答案。
什么时候组队才划算
增益在不同基准之间差异不小,作者没有回避这件事,反而把它变成了论文里的第二个问题:什么时候自组织协作真的有用。
答案落在组织心理学的一个构念上,叫可论证性(demonstrability),指的是团队能不能分辨出正确与错误的推理。跨八个基准,这个指标与相对最强成员的改进幅度强相关,Spearman 相关系数 0.90,p 值 0.005。
换个说法:正确推理一旦出现就能被认出来的时候,团队获益最大。认不出来,多几个成员吵也吵不出结果。
这条相关有个实际用途。它把要不要上多智能体从一个信仰问题变成了一个可以先测的量:先测成员能不能认出正确推理,再决定值不值得付协作那份算力。
更宽的那句主张
论文最后把结论推到了一层:组织本身可以成为一种智能体能力。智能体团队能够学会如何一起推理,产出成员独立到不了的解。
这句话的分量在于它指的方向。过去两年提升多智能体性能的主流路径有两条,一条是训练更大的单个模型,一条是手工设计更精巧的编排协议。如果组织方式是可学的,就多了一条更便宜也更通用的路:成员不变,改的是它们之间怎么说话。
需要留在桌面上的限定
有三件事现在还不能说死。
作者自己在传播时说明,这些结果仍待独立复现。增益在不同基准之间差异很大,66.7% 是五个基准的平均,不是每个基准都涨。
那 40 道题的构成也值得留意。15 道数学题加 25 道研究生级别的知识题,练习量小是这套方法的卖点,同时也意味着学到的策略对练习集的选取会敏感。
还有一层是评估口径。完美路由这个对照组是在成员独立答案上做的,它没有覆盖成员在讨论中被提示后才答对的情形,而那个情形恰恰是协作计算的核心。所以 59.0% 这个天花板,位置本身就是按独立作答定义的。
参考信源
- Aneesh Pappu、Mirac Suzgun、Yongchan Kwon、Federico Bianchi、Batu El、Mykel J. Kochenderfer、Hancheng Cao、James Zou《Self-Organizing Agent Teams Learn to Reason Together》,arXiv:2609.22682,2026-09-19 提交
- 论文摘要中关于五个基准 66.7% 对 48.8%、算力匹配 58.7%、完美路由 59.0%,以及 AIME 2026 上 13.4 个点的表述
- 跨八个基准可论证性与改进幅度的 Spearman 0.90、p 值 0.005
- COLM 2026 与 EMNLP 2026 workshop poster 收录信息