Agensh:当 1024 个 AI 智能体学会自组织,中心化调度就被淘汰了

想象一下:你被扔进一个有 1024 个程序员的项目组,要从零开始构建 pandoc——一个复杂的文档转换工具,6 小时内交付,没有互联网。没有项目经理,没有技术总监,没有任何人告诉你该做什么。

Agensh:当 1024 个 AI 智能体学会自组织,中心化调度就被淘汰了

一个公司能没有 CEO 吗?

想象一下:你被扔进一个有 1024 个程序员的项目组,要从零开始构建 pandoc——一个复杂的文档转换工具,6 小时内交付,没有互联网。没有项目经理,没有技术总监,没有任何人告诉你该做什么。

你会说:这不可能。

但 Microsoft Research 的团队做到了。他们让 1024 个 AI 智能体在没有任何中心调度器的情况下,自发分工、协作、互相验证,最终把 pandoc 的测试通过率从单智能体的 33.89% 拉到了 55.06%。这个系统叫 Agensh。

中心调度器的瓶颈

先说清楚问题出在哪。

当前主流的多智能体框架——无论是 AutoGen、LangGraph 还是 CrewAI——都有一个"中心调度器"(central orchestrator)。这个调度器负责: 1. 把大任务拆成子任务 2. 把子任务分配给各个 worker 3. 收集 worker 的结果 4. 决定下一步做什么

听起来很合理,对吧?就像公司里有项目经理统筹一切。

但问题在于:这个调度器本身就是一个瓶颈。它必须同时理解所有 worker 的状态、所有子任务的进展、所有上下文信息。当 worker 数量从 8 个涨到 32 个、128 个时,调度器的上下文窗口会被撑爆,决策延迟会指数级上升。

类比一下:一个经理管 5 个人没问题,管 50 个人开始吃力,管 1000 个人?他什么决策都做不了,光读状态报告就够他忙一整天。

Agensh 的解法:把调度器干掉

Agensh 的核心思路简单到粗暴:不要调度器。

没有中心调度器,那谁来分配任务?答案是:每个 worker 自己分配。

Agensh 的每个 worker 都执行一个"多智能体协作循环"(Multi-Agent Cooperation Loop):

1. 收集上下文:读取共享工作区,看看现在有什么任务、什么已完成、什么正在进行 2. 认领子任务:自己判断哪个任务需要做,自己分配给自己 3. 执行行动:写代码、跑测试、修 bug 4. 分享发现:把结果写回共享工作区 5. 验证结果:其他 worker 可以检查你的工作 6. 合并进度:把成果整合到主分支

这就像一个没有经理的开源项目:每个人看 issue 列表,自己认领一个,写完提 PR,别人 review,合并。

三个基础设施组件

但光说"自组织"太虚了,Agensh 提供了三个具体的基础设施组件来支撑这个循环:

1. 共享工作区(Shared Workspace)

这是所有 worker 的"看板"。上面有三类任务:

  • proposed:有人提议要做但还没人认领的
  • ongoing:正在被某个 worker 做的
  • completed:已经完成的
每个 worker 随时可以来看,也随时可以添加新任务。

2. 消息接口(Message Interface)

Worker 之间需要沟通。比如"我在做这个模块,你别重复了"或者"你的代码有个 bug 在第 42 行"。消息接口让 worker 可以异步通信,不需要等对方回复。

3. 共享上下文(Shared Context)

这是"团队记忆"。重要的发现、决策、踩过的坑都存在这里。新加入的 worker 可以快速读取这些上下文,不需要从头摸索。

实验结果:从 1 到 1024 的进化

Agensh 在 ProgramBench 的 5 个最难任务上测试,用的是 GPT-5.6-sol(high)模型。

数字说话

Agent 数量平均测试通过率相对提升
119.31%基线
12828.78%+49%
在 pandoc 这个任务上,规模拉到 1024:

Agent 数量pandoc 测试通过率
133.89%
102455.06%
55% 的通过率意味着:超过一半的测试用例通过了。这是在 6 小时内、没有互联网访问、从零开始构建一个真实世界的复杂工具。

最有趣的发现:自组织行为是涌现的

论文最精彩的部分不是数字,而是对 worker 行为轨迹的分析。随着智能体数量增加,不同形式的自组织合作会逐渐涌现并标准化:

8 个智能体:同伴协调

Worker 们开始互相打招呼:"你在做这个?那我去搞那个。"简单的分工开始出现,但还很粗糙。

32 个智能体:跨 worker 整合管理

有人开始主动做"整合者"的角色——把多个 worker 的代码合并到一起,处理冲突。

128 个智能体:工作流标准化

团队开始自发形成标准化的工作流程。比如"先写测试再写实现"成为共识,"提交前先跑 lint"成为惯例。这些标准不是任何人规定的,而是涌现出来的。

1024 个智能体:角色专业化

在大规模下,worker 开始自发专业化。有人专门写测试,有人专门修 bug,有人专门做代码审查,有人专门写文档。就像一个成熟的公司有了正式的岗位分工。

这为什么重要?

1. Agent 数量成为新的 scaling 维度

我们已经习惯了"模型越大越强"的 scaling law。但 Agensh 揭示了另一个维度:在固定模型能力下,增加 agent 数量也能扩展智能。

这就像人类社会:一个天才单独干活,比不过 100 个普通人协作。关键不在于个体能力,而在于组织效率。

2. 去中心化不是理论,是工程必需

之前的多智能体研究大多停留在 8-16 个 agent 的规模,因为中心调度器扛不住更多。Agensh 证明了去中心化不是学术理想,而是突破规模瓶颈的工程必需。

3. 自组织行为可以涌现

最让人兴奋的是:没有人教这些 agent 怎么分工。它们只是在共享工作区里认领任务、分享结果,然后分工就自然出现了。这和生物系统中的自组织现象——蚁群分工、神经元特化——有异曲同工之妙。

诚实的评价

Agensh 不是银弹。

首先,55% 的通过率意味着还有 45% 的测试失败。从零构建 pandoc 是一个极端难的任务,但 Agensh 还远没有达到"替代人类工程师"的水平。

其次,1024 个 agent 的成本不低。即使每个 agent 只用 GPT-5.6-sol 的一小部分 token,1024 个并发运行的 API 成本也是可观的。论文没有详细讨论成本效益比。

第三,去中心化带来的协调开销不可忽视。worker 之间需要频繁读取共享工作区、发送消息、验证结果,这些都是额外的 token 消耗。

但这些问题不影响核心贡献:Agensh 证明了去中心化多智能体系统可以扩展到前所未有的规模,并且自组织行为会随规模涌现。

对未来的启示

Agensh 让我想起一个更深的问题:人类社会的组织形态,是否也是受限于"中心调度器"的带宽?

一个公司的 CEO 只能管到 N 个直接下属,所以公司规模有上限。当公司超过某个规模,就必须分拆、去中心化、让部门自治。AI 多智能体系统正在重走这条路。

从 8 个 agent 的"同伴协调"到 1024 个 agent 的"角色专业化",这个进化路径和人类组织的发展惊人地相似。也许自组织不是某种特殊机制,而是任何足够复杂的协作系统都会涌现的必然结果。

如果是这样,那么 Agensh 的意义就不仅限于 AI 领域——它是对"组织智能"这个概念本身的一次实验性探索。


论文:Agensh: Scaling Organizational Intelligence to 1,024 Agents

代码:github.com/microsoft/Agensh

项目页:aka.ms/Agensh

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens