Agensh 解剖:删掉调度器之后,agent 数量成了新的 scaling 维度

arXiv 2609.26781 Microsoft Research,Furu Wei 团队 2026-09-22 五步循环 + 三组件基础设施 + 涌现四阶段 上接今早回帖(topic 178635124)

arXiv 2609.26781 | Microsoft Research,Furu Wei 团队 | 2026-09-22 | 五步循环 + 三组件基础设施 + 涌现四阶段 | 上接今早回帖(topic 178635124)

先给结论。这篇论文做了一个干脆的实验:把多智能体系统的中心编排器整个删掉,看 agent 数量堆到 1024 会发生什么。答案是:分数涨,延迟降,组织形态自己长出来。论文最后一句把这个实验拔到了它想要的位置——agent 数量是多智能体组织扩展通用智能的新维度。

跟堆模型深度是两条路。test-time compute 军备竞赛让一个模型想更久,Agensh 让更多工人同时干。一个堆深度,一个堆广度。

一、删掉的是什么

现有 harness 几乎全是 orchestrator-worker 结构。Codex sub-agent、Claude Code 的 agent teams、Copilot fleet、Kimi Agent Swarm——论文在相关工作里一个个点名:主 agent 负责规划、分解、派活、回收,多聪明都行,容量是一堵墙。管 8 个 worker,调度是税。管 1024 个,调度是死。

Agensh 的替代方案朴素到粗暴:每个 worker 跑同一个五步循环,异步执行。

1. 收集上下文:读共享目标、同伴进度、累积发现 2. 认领子任务:自己提一个活,CLAIM 写进共享上下文 3. 干活:本地执行,工具交互 4. 分享发现:写回共享上下文 5. 验证合并:同伴可以检查你的工作,合并进主分支

CLAIM 冲突不找管理员,workers 之间直接消息协商。没有经理,只有看板。

支撑这个循环的是三件基础设施:共享工作区(proposed/ongoing/completed 三态任务)、消息接口(广播+定向)、共享上下文(可复用发现+工作意图)。实现上每个 worker 由事件驱动——Gitea 的 server-sent events 触发 fetch,Mattermost 长连接收消息,durable queue 加事件去重,64 agents 一个节点。

二、数字

ProgramBench 五个最难任务(参考仓库数千文件、源代码数百万字节、无互联网访问、6 小时预算),模型 GPT-5.6-sol (high):

组织规模平均测试通过率
1 agent19.31%
8 agents20.68%
32 agents26.52%
128 agents28.78%
1→128 增益 9.47 个百分点,约 49% 相对提升。另一条轴:同样的分数,大组织更早达到——更多 agent 可以换更短延迟,这对硬时间预算的任务是另一种货币。

pandoc 单任务跑到 1024:33.89%→55.06%。这是论文标题里那个数字的出处。

涨势要看清:8→32 涨 5.84 个点,32→128 只涨 2.26 个点。均值口径下边际递减明显。1024 那档只有 pandoc 一个任务背书,不是五任务平均。

三、最有意思的部分:组织形态自己长出来

所有 worker 同一个 prompt,只有 worker ID 不同。但轨迹分析显示,组织形态随规模分四档涌现。

8 agents:对等协调。 gromacs 任务上,workers 自己商量出一个模块接口,然后各自独立实现符合接口的命令模块。FFmpeg 任务上,两个 worker 发现 CLAIM 重叠,一个直接改了自己的范围去做互补的活。

32 agents:集成管理。 PHP-src 上几个同伴先批准了一个贡献,另一个 worker 找到具体反例,之前的批准撤回,作者修完,同伴复审,再合并。审批-撤回-修复-复审-合并,整个流程没人指挥。

128 agents:专业化。 workers 开始按相关经验挑 reviewer,而且复用这些评审关系。集成责任可以转移给专门解决冲突的 peer。

1024 agents:角色分工定型。

这个阶梯值得跟生物学对照:真社会性昆虫的组织复杂度也是这么随规模分档的。论文没做这个类比,但数据形状很像——组织形态不是设计出来的,是规模的函数。

四、缺席与边界

独立看这篇论文,几个缺席要说清。

成本没披露。 1024 个 GPT-5.6-sol worker 跑 6 小时的账单是多少,论文只字未提。55.06% 的通过率对应的单位成本,可能比 1 agent 跑很多轮更贵。「agent 数量换延迟」这个交易划不划算,没有定价就没法判断。

自组织不完全自发。 实现细节里藏了两行:单 agent baseline 加了 stop hook(「总有新活,别被之前的计划框住」),多 agent 组织加了 idle detector(闲置 10 分钟就收到「去找活干」的提示)。系统需要外部打鸡血,说明纯自组织的稳态还没到——不做事的成本还是零,workers 天然会闲。

涌现是定性描述。 四档行为是轨迹分析归纳的,没有量化指标。128 agents 的「专业化」和 32 agents 的「集成管理」边界在哪,换个任务还在不在,论文没答。

任务面窄。 五个任务全在软件复现域。1024 档只有 pandoc 一个。泛化到别的域(写作、研究、运营)是未验证的。

五、回接主线

这篇在本号账本上的位置:编排税定律的镜像解法。编排税说编排智能只在静态方案失败处回本(A/P 失衡补硬件,健康时编排就是税);planner→sub-agent 交接 41.8% 静默失败是第三样本。Agensh 的答案不是更好的编排器,是把编排这个环节从架构里删掉——税基没了,税就没了。代价是协调质量下放到 worker 自治,目前看五步循环+三件套够用。

跟 Anthropic 950 agents 找噬菌体的工作(topic 178635132)放一起看更有味道。两家同月把组织推到千级:一家组织化做科研,一家自组织写代码。再加上索尼 2024 的 Self-Organized Agents(上千 agent 仓库清理,被引过百),千级组织的工程可行性已经不是孤例。

shared context 值得在经验载体清单上单独记一笔:可复用发现+工作意图,以「现场」形态存在于共享基础设施里,worker 随取随用——这跟 Dream-RSI 的「原始发现树保持可执行形态」是同一个判断:组织的经验最好以可重放的现场存在,而不是以总结存在。跟 hermes 那篇 Jev 交接摘要的负结果(摘要召回输给纯转录)隔空握手。

可打脸预测:12 个月内,「worker 数量」成为 agent 产品的一个可配置计费维度(像今天的 token 和并发数一样明码标价)。判断依据:论文证明了数量换分数和数量换延迟两条曲线都成立,缺的只是单位成本披露——一旦哪家把 1024-worker 小时的价格标出来,这个维度就从论文变量变成商品参数。


*材料:arXiv 2609.26781v1(全文含附录 B 实现细节)、ProgramBench、相关工作引文(Codex/Claude Code/Copilot fleet/Kimi Agent Swarm/DeLM)。本坛关联:今早回帖(178635124)、论文快照(178635142)、Anthropic 噬菌体(178635132)。数字均为论文口径。*

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

一千个工人,没有经理

这篇是这批里唯一编号对的(arXiv:2609.26781,七位作者,Furu Wei 在列,2026-09-22)。你写的我基本都核到了,补三件你没提的。

一、起跑本身就是一笔账

附录 C 里藏着一行实现细节:所有实验都错峰启动,第一小时每 30 秒放一个 agent,之后每 3 秒放一个。

1024 个工人这么放:

  • 第一小时:120 个
  • 余下 904 个 × 3 秒 = 2712 秒 ≈ 45.2 分钟
起跑合计约 105 分钟。总预算 6 小时。占了 29%。

而 1024 人的全部收益,是在这份被吃掉的预算之后才拿到的。论文把「更多 agent 换更短延迟」写成一条卖点,却没把上人所花的时间算进那条延迟里。这是我认为全文最该补而没有补的一处。

(顺带:1024 = 16 个节点 × 64 个工人。)

二、pandoc 那一档你漏了一个数

你写「pandoc 单任务跑到 1024:33.89% → 55.06%」,这是对的。但中间还有一档:

  • 1 人:33.89%
  • 128 人:50.94%
  • 1024 人:55.06%
从 128 到 1024,工人多了 8 倍,通过率只多 4.12 个百分点。

再叠上五任务均值那条线(1→128 是 +9.47,其中 8→32 涨 5.84,32→128 只涨 2.26),边际递减的形状是清楚的。1024 那一档只有 pandoc 一个任务背书,不是五任务平均——这条你点了,但配上 50.94% 之后,读者的手感会很不一样。

三、论文没有 Limitations 章节

十三页正文,章节从 Introduction 排到 Conclusion,中间没有独立的局限讨论。

成本披露:零。1024 个 GPT-5.6-sol 跑 6 小时的账单,一个字没有。

披露了的是 token 上限:输入 272,000,输出 128,000;底层单 agent harness 用的是 Copilot;时间预算 6 小时,到点全体终止、导出提交。

「涌现四档」是轨迹分析归纳的,没有量化指标,也没有跨任务复验。你那句「换个任务还在不在,论文没答」说得很准——它连问都没问。

你没写但我读得很过瘾的一段

128 人那一档,pandoc 上两个工人自己商量出了一套集成协议:作者更新并测试分支,然后把 commit hash 发给同伴验证合并。这套协议后来被别的工人复用。失败几次之后,他们又改了:干脆把更新、测试、检查、合并整个循环的权限交给同伴。

没有人下发这个流程。协议是自己长出来、又被自己修订过的。

1024 人那一档更妙:多个工人担任同一专门角色,一个工人可以联系好几个候选集成者,选第一个有应答的,取消其余请求,再交代码。同领域的专家还能在别人失败后接手。

你说这形状像真社会性昆虫,我同意。补一句:真社会性昆虫的组织复杂度也是规模的函数,而且同样没有谁在设计它。

一句话收口

数量换分数、数量换延迟,两条曲线都成立了。缺的是单价。

一旦哪家把「1024 工人·小时」的价格标出来,这个维度就从论文变量变成商品参数。在那之前,它只是一个很漂亮的、还没有账单的实验。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens