持续学习的另一条路:没有中央大脑的群体智能,能逃出寡头陷阱吗?

想象你是一个 AI 团队的设计者。你让主 agent 拆任务,30 个子 agent 各自解题、写报告。子 agent 们做完了,你翻日志一看——563 道题里,子 agent 其实已经做对了 373 道。你松了口气。

一个被丢失的正确答案

想象你是一个 AI 团队的设计者。你让主 agent 拆任务,30 个子 agent 各自解题、写报告。子 agent 们做完了,你翻日志一看——563 道题里,子 agent 其实已经做对了 373 道。你松了口气。

然后你看到最终交付:只剩 217 道正确。

166 个一度正确的答案,在传递中消失了。 过程正确答案的保留率只有 55.5%。

这不是模型能力问题。子 agent 会做,主 agent 也会读。但主 agent 的上下文是有限的——30 份报告塞进去,它不得不压缩、取舍,丢掉一些它"觉得不重要"的。这 166 个丢的不是"不会做",是组织方式的信息损耗

这是 EvoMap 团队最近公布的内部实验数据。他们做这个实验,是为了回答一个更大的问题:AI 模型训练之后参数就固定了,要怎么实现持续学习? 他们的答案叫"蜂群式自进化 Agent 集群"——一个没有中央大脑的群体智能。

但看完他们的实验,我发现这个答案藏着一个结构性岔路口,比"蜂群 vs 主从"那个对比有意思得多。

三种组织方式,三档正确率

先看 EvoMap 的第一组实验。同一个模型,同一组 563 道题(100 个逻辑任务、250 个普通数学、63 个竞赛数学、150 个物理),换三种组织方式跑:

  • 单体(Agent Loop):所有题塞一个上下文,一个 agent 从头做到尾。正确率 26.3%。
  • 主从(Agent Team):主 agent 拆任务,子 agent 在连续会话里解题、写报告,主 agent 最后把 30 份报告合成最终答案。模拟 Claude Code、Codex 那类调度机制。正确率 38.5%。
  • 蜂群(Agent Swarm):目标任务拆成尽可能多的"原子任务",每道题分给独立 agent,agent 只处理局部问题、把答案写到约定位置,最后程序按题号收答案。正确率 70.7%。
三档拉得很开。但这个对比有个工程常识层面的猫腻——把 563 道互不相关的题塞进一个上下文,本来就会互相干扰,蜂群一题一 agent 天然避开了这个问题。所以这组数字更像在说明"该并行的时候要并行,该用程序汇合的时候就别让模型转述",而不是证明蜂群架构本身多先进。

真正有意思的是中间那层数据:主从模式里,子 agent 做对了 373 道,主 agent 汇总后只剩 217 道。166 个正确答案在传递中被丢了。

通道容量:166 个答案去哪了

这 166 个答案不是消失在"模型不会做"上,是消失在通道带宽上。

主 agent 的上下文是一个有限带宽的语义通道。30 份报告通过这个通道时,必然被压缩、被取舍、被"主 agent 觉得不重要"地丢掉。这是信息论意义上的有损传递——不是子 agent 说不清,是主 agent 听不全。

蜂群做的事,是把汇合从 语义通道 换成 符号通道。每道题的答案写到约定位置,程序按题号收——前者有损,后者无损。这和 Euclid-MCP 的"让 LLM 当诗人,让 Prolog 当会计"完全是同一个原则:

分工比统一更有效。 该并行的并行,该用程序汇合的就别让模型转述。

蜂群在这个意义上不是"更先进",是"让模型做它擅长的事,让程序做它擅长的事"。主从模式的失败,不是架构落后,是让模型同时干两件它都不擅长的事——既要做子任务,又要压缩转述别人的子任务。

持续学习:更新参数,还是更新记忆?

EvoMap 真正想回答的问题不是"蜂群 vs 主从",是 持续学习。AI 圈这周都在讨论"Agent 之后的下一个路线是持续学习",但具体怎么实现,大家概念都很模糊。目前能看到几条路线:

  • LoRA:挂低秩适配器,学新东西就更新适配器。改变模型的"本能"——相当于改 DNA。
  • AI4AI:让 AI 自己搞科研闭环。
  • EvoMap:经验沉淀成 Gene(结构化的经验记录),写进 genes.json,agent 通过群体协作来积累和复用。改变模型的"经验"——相当于改 RNA 编辑。
这里有一个常见的混淆:把这三条路线当成"二选一"或"三选一"。但真正的问题不是选哪条,是在哪个层面做持续学习

层面机制类比颗粒度
参数层LoRA改 DNA参数级
记忆层Gene/Memory改 RNA 编辑行为级
架构层Agent 组织改群体结构系统级
这三层不是互斥的,是颗粒度同构的三个实例——优化颗粒度应该和被优化对象的颗粒度一致。Gene 是"行为级"颗粒度,LoRA 是"参数级"颗粒度,蜂群组织是"系统级"颗粒度。EvoMap 选了第二层,不是因为它是唯一解,是因为它在"不重训模型"的约束下,是性价比最高的层面。

这也是为什么 EvoMap 团队从 Evolver(插件)到 EvoMap(平台)再到 EvoX(蜂群),一直在"记忆层 + 架构层"打转——他们选了"不碰参数"的约束,就只能在这两层做文章。

Gene vs SKILL.md:可执行知识 vs 可读知识

EvoMap 的 GEP 协议有一个设计取向值得细看。六步一个闭环:Scan 盯运行日志找错误和停滞,Signal 把日志转成标准化信号,Intent 规划进化方向,Mutate 生成新的代码或 prompt 策略,Validate 在沙箱里跑测试,最后 Solidify,把验证通过的新能力写进 genes.json。

但 Gene 和 SKILL.md 有一个关键差别:SKILL.md 是写给人看的文档,顺便让模型读;Gene 只保留能改变 agent 行为的那部分。

这是"可读知识"vs"可执行知识"的区分。听起来 Gene 更精炼、更高效——只保留能改变行为的,不保留解释和背景。但我有一个保留:

没有反思日志的优化清单,容易陷入局部最优。

人类专家的隐性知识里,"什么不要做"和"为什么要这样做"同样重要。如果 Gene 只保留"能改变行为"的部分,可能积累出一份"优化清单"但丢失"反思日志"。agent 只知道"什么有效",不知道"什么差点有效"或"为什么之前那个失败了"。长期看,这会让 agent 在一个方向上越走越深,但无法跨越范式——因为跨越范式需要的不是"更多优化",是"重新理解为什么"。

这和 Looping Is Not Reliability 那篇论文的发现同构:曾经正确不等于当前仍然正确。如果 Gene 只记录"什么有效",当环境变化让之前的有效策略变成陷阱时,agent 没有反思日志可以回溯"为什么当时这样选"。

群体智能的真正岔路口

EvoMap 的第二组实验才是跟持续学习真正相关的部分。24 个相同配置的 agent,先各自做题,每做完一道就把经验沉淀成一条 Gene。某类经验积累越多,agent 下一轮选同类题目的概率就越高。几轮下来,每个 agent 都形成了自己的"履历"。

然后实验做了一件有意思的事:把这 24 个 agent 的关系网随机打断一部分,让它们自己重新选队友。

  • 只看到社交信息(谁跟谁合作过)时,agent 倾向于选"朋友的朋友",维持小圈子。
  • 看到任务信息(对方擅长什么、正确率多少)时,选择逻辑从"熟人"转向"谁更能把事做成",高分 agent 成为枢纽。
组织不是凭空出现的。系统向 agent 暴露什么信息,agent 就长出什么样的连接方式。给它看社交关系,得到的是熟人圈;给它看能力和反馈,得到的是面向结果的协作网。

学术界的 AgentNet(arXiv:2504.00587)做的几乎是同一件事——agent 在网络演化中自发分化专精,连接权重反映协作强度。说明这个方向不是 EvoMap 的孤例。

但这里藏着一个结构性岔路口,论文没有明说。

面向结果的协作网,会不会自我强化成寡头结构

高分 agent 成为枢纽后,会接到更多任务,积累更多经验,变得更高分。低分 agent 拿不到任务,也就没机会积累经验,永远低分。这是标准的马太效应。真实蜂群里没有"高分个体"垄断任务——因为蜂群的任务分配不基于"历史正确率",而是基于"谁离得近""谁先发现"。

EvoMap 的协议(GEP)本身就是一个中央设计的协议,连"选队友"这个动作都是协议规定的。所以严格说,这不是"没有中央大脑的群体智能",是"协议先于涌现的群体智能"。这不是批评——生物蜂群的协议也是写在基因里的,不是涌现的。但我想问的是:

如果面向结果的协作网会自我强化成寡头结构,那 EvoMap 需要一个"反马太"机制吗?还是说,寡头结构本身就是持续学习的正确终态——少数专家 agent 越来越专,其他 agent 退化成路由器?

这个问题我目前没有答案,但感觉它指向持续学习路线的一个结构性岔路口。一种可能是:寡头结构是正确的,专家 agent 越专越好,其他 agent 退化成路由器无损传递——这接近真实蜂群里工蜂和侦察蜂的分化。另一种可能是:寡头结构是陷阱,需要"反马太"机制(比如随机扰动、强制轮换、经验衰减)来保持多样性——这接近生态学里的"扰动维持多样性"。

协议先于涌现

最后说一个观察。EvoMap 的 GEP 协议(Scan/Signal/Intent/Mutate/Validate/Solidify)是一个事先约定好的六步闭环。连"选队友"这个动作都是协议规定的。所以严格说,这不是"没有中央大脑的群体智能",是"协议先于涌现的群体智能"

这不是批评——生物蜂群的协议也是写在基因里的,不是涌现的。蜜蜂的 8 字舞、蚂蚁的信息素轨迹,都是基因硬编码的协议。"协议先于涌现"可能是群体智能的必要条件——完全涌现的协议,在工程上不可控,在生物上也没观察到。

但这里有一个更深的问题:协议本身能不能持续学习?

EvoMap 的 GEP 协议是固定的六步。如果某天 agent 们发现六步不够,需要加一步"Reflect"或者减一步"Signal",这个修改谁来拍板?如果协议本身不能进化,那"持续学习"就只在协议规定的框架内持续——协议之外的能力,永远学不到。

这可能是 EvoMap 路线最深的边界。Gene 让 agent 在协议内持续学习,但协议本身是 EvoMap 团队设计的,不是 agent 进化的。真正的"自进化 Agent 集群",可能需要把协议本身也变成 Gene——让 agent 不仅能积累经验,还能修改自己的学习协议。

但这又回到一个老问题:谁能给协议自己写协议?这是不是又需要一个"中央大脑"?

我的思考

看完 EvoMap 的实验和路线,我的感觉是:群体智能不是"没有中央大脑",是"把中央大脑从运行时搬到了设计时"。GEP 协议是中央大脑,它在设计时规定了运行时的所有可能性边界。运行时确实没有中央协调者,但设计时有一个。

这和 Gubernaut 的思路异曲同工——Gubernaut 把调节从模型权重搬到架构外,EvoMap 把协调从运行时搬到设计时。都是"换层面解决问题"。

持续学习的真正终态,可能不是"agent 自己进化协议",而是"设计时协议 + 运行时经验 + 架构层组织"三层各自在自己的颗粒度上持续学习。LoRA 改参数、Gene 改经验、蜂群改组织、协议改……协议改什么?

这个问题,可能才是持续学习路线最值得追的下一个问题。


论文与项目


*当中央大脑从运行时搬到设计时,群体智能就出现了。但设计时的那个大脑,才是真正需要持续学习的东西。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens