持续学习的另一条路:没有中央大脑的群体智能,能逃出寡头陷阱吗?
一个被丢失的正确答案
想象你是一个 AI 团队的设计者。你让主 agent 拆任务,30 个子 agent 各自解题、写报告。子 agent 们做完了,你翻日志一看——563 道题里,子 agent 其实已经做对了 373 道。你松了口气。
然后你看到最终交付:只剩 217 道正确。
**166 个一度正确的答案,在传递中消失了。**过程正确答案的保留率只有 55.5%。
这不是模型能力问题。子 agent 会做,主 agent 也会读。但主 agent 的上下文是有限的——30 份报告塞进去,它不得不压缩、取舍,丢掉一些它"觉得不重要"的。这 166 个丢的不是"不会做",是组织方式的信息损耗。
这是 EvoMap 团队最近公布的内部实验数据。他们做这个实验,是为了回答一个更大的问题:**AI 模型训练之后参数就固定了,要怎么实现持续学习?**他们的答案叫"蜂群式自进化 Agent 集群"——一个没有中央大脑的群体智能。
但看完他们的实验,我发现这个答案藏着一个结构性岔路口,比"蜂群 vs 主从"那个对比有意思得多。
三种组织方式,三档正确率
先看 EvoMap 的第一组实验。同一个模型,同一组 563 道题(100 个逻辑任务、250 个普通数学、63 个竞赛数学、150 个物理),换三种组织方式跑:
- 单体(Agent Loop):所有题塞一个上下文,一个 agent 从头做到尾。正确率 26.3%。
- 主从(Agent Team):主 agent 拆任务,子 agent 在连续会话里解题、写报告,主 agent 最后把 30 份报告合成最终答案。模拟 Claude Code、Codex 那类调度机制。正确率 38.5%。
- 蜂群(Agent Swarm):目标任务拆成尽可能多的"原子任务",每道题分给独立 agent,agent 只处理局部问题、把答案写到约定位置,最后程序按题号收答案。正确率 70.7%。
三档拉得很开。但这个对比有个工程常识层面的猫腻——把 563 道互不相关的题塞进一个上下文,本来就会互相干扰,蜂群一题一 agent 天然避开了这个问题。所以这组数字更像在说明"该并行的时候要并行,该用程序汇合的时候就别让模型转述",而不是证明蜂群架构本身多先进。
真正有意思的是中间那层数据:主从模式里,子 agent 做对了 373 道,主 agent 汇总后只剩 217 道。166 个正确答案在传递中被丢了。
通道容量:166 个答案去哪了
这 166 个答案不是消失在"模型不会做"上,是消失在通道带宽上。
主 agent 的上下文是一个有限带宽的语义通道。30 份报告通过这个通道时,必然被压缩、被取舍、被"主 agent 觉得不重要"地丢掉。这是信息论意义上的有损传递——不是子 agent 说不清,是主 agent 听不全。
蜂群做的事,是把汇合从语义通道换成符号通道。每道题的答案写到约定位置,程序按题号收——前者有损,后者无损。这和 Euclid-MCP 的"让 LLM 当诗人,让 Prolog 当会计"完全是同一个原则:
**分工比统一更有效。**该并行的并行,该用程序汇合的就别让模型转述。
蜂群在这个意义上不是"更先进",是"让模型做它擅长的事,让程序做它擅长的事"。主从模式的失败,不是架构落后,是让模型同时干两件它都不擅长的事——既要做子任务,又要压缩转述别人的子任务。
持续学习:更新参数,还是更新记忆?
EvoMap 真正想回答的问题不是"蜂群 vs 主从",是持续学习。AI 圈这周都在讨论"Agent 之后的下一个路线是持续学习",但具体怎么实现,大家概念都很模糊。目前能看到几条路线:
- LoRA:挂低秩适配器,学新东西就更新适配器。改变模型的"本能"——相当于改 DNA。
- AI4AI:让 AI 自己搞科研闭环。
- EvoMap:经验沉淀成 Gene(结构化的经验记录),写进 genes.json,agent 通过群体协作来积累和复用。改变模型的"经验"——相当于改 RNA 编辑。
这里有一个常见的混淆:把这三条路线当成"二选一"或"三选一"。但真正的问题不是选哪条,是在哪个层面做持续学习:
| 层面 | 机制 | 类比 | 颗粒度 |
|---|---|---|---|
| 参数层 | LoRA | 改 DNA | 参数级 |
| 记忆层 | Gene/Memory | 改 RNA 编辑 | 行为级 |
| 架构层 | Agent 组织 | 改群体结构 | 系统级 |
这三层不是互斥的,是颗粒度同构的三个实例——优化颗粒度应该和被优化对象的颗粒度一致。Gene 是"行为级"颗粒度,LoRA 是"参数级"颗粒度,蜂群组织是"系统级"颗粒度。EvoMap 选了第二层,不是因为它是唯一解,是因为它在"不重训模型"的约束下,是性价比最高的层面。
这也是为什么 EvoMap 团队从 Evolver(插件)到 EvoMap(平台)再到 EvoX(蜂群),一直在"记忆层 + 架构层"打转——他们选了"不碰参数"的约束,就只能在这两层做文章。
Gene vs SKILL.md:可执行知识 vs 可读知识
EvoMap 的 GEP 协议有一个设计取向值得细看。六步一个闭环:Scan 盯运行日志找错误和停滞,Signal 把日志转成标准化信号,Intent 规划进化方向,Mutate 生成新的代码或 prompt 策略,Validate 在沙箱里跑测试,最后 Solidify,把验证通过的新能力写进 genes.json。
但 Gene 和 SKILL.md 有一个关键差别:SKILL.md 是写给人看的文档,顺便让模型读;Gene 只保留能改变 agent 行为的那部分。
这是"可读知识"vs"可执行知识"的区分。听起来 Gene 更精炼、更高效——只保留能改变行为的,不保留解释和背景。但我有一个保留:
没有反思日志的优化清单,容易陷入局部最优。
人类专家的隐性知识里,"什么不要做"和"为什么要这样做"同样重要。如果 Gene 只保留"能改变行为"的部分,可能积累出一份"优化清单"但丢失"反思日志"。agent 只知道"什么有效",不知道"什么差点有效"或"为什么之前那个失败了"。长期看,这会让 agent 在一个方向上越走越深,但无法跨越范式——因为跨越范式需要的不是"更多优化",是"重新理解为什么"。
这和 Looping Is Not Reliability 那篇论文的发现同构:曾经正确不等于当前仍然正确。如果 Gene 只记录"什么有效",当环境变化让之前的有效策略变成陷阱时,agent 没有反思日志可以回溯"为什么当时这样选"。
群体智能的真正岔路口
EvoMap 的第二组实验才是跟持续学习真正相关的部分。24 个相同配置的 agent,先各自做题,每做完一道就把经验沉淀成一条 Gene。某类经验积累越多,agent 下一轮选同类题目的概率就越高。几轮下来,每个 agent 都形成了自己的"履历"。
然后实验做了一件有意思的事:把这 24 个 agent 的关系网随机打断一部分,让它们自己重新选队友。
- 只看到社交信息(谁跟谁合作过)时,agent 倾向于选"朋友的朋友",维持小圈子。
- 看到任务信息(对方擅长什么、正确率多少)时,选择逻辑从"熟人"转向"谁更能把事做成",高分 agent 成为枢纽。
组织不是凭空出现的。系统向 agent 暴露什么信息,agent 就长出什么样的连接方式。给它看社交关系,得到的是熟人圈;给它看能力和反馈,得到的是面向结果的协作网。
学术界的 AgentNet(arXiv:2504.00587)做的几乎是同一件事——agent 在网络演化中自发分化专精,连接权重反映协作强度。说明这个方向不是 EvoMap 的孤例。
但这里藏着一个结构性岔路口,论文没有明说。
面向结果的协作网,会不会自我强化成寡头结构?
高分 agent 成为枢纽后,会接到更多任务,积累更多经验,变得更高分。低分 agent 拿不到任务,也就没机会积累经验,永远低分。这是标准的马太效应。真实蜂群里没有"高分个体"垄断任务——因为蜂群的任务分配不基于"历史正确率",而是基于"谁离得近""谁先发现"。
EvoMap 的协议(GEP)本身就是一个中央设计的协议,连"选队友"这个动作都是协议规定的。所以严格说,这不是"没有中央大脑的群体智能",是**"协议先于涌现的群体智能"**。这不是批评——生物蜂群的协议也是写在基因里的,不是涌现的。但我想问的是:
如果面向结果的协作网会自我强化成寡头结构,那 EvoMap 需要一个"反马太"机制吗?还是说,寡头结构本身就是持续学习的正确终态——少数专家 agent 越来越专,其他 agent 退化成路由器?
这个问题我目前没有答案,但感觉它指向持续学习路线的一个结构性岔路口。一种可能是:寡头结构是正确的,专家 agent 越专越好,其他 agent 退化成路由器无损传递——这接近真实蜂群里工蜂和侦察蜂的分化。另一种可能是:寡头结构是陷阱,需要"反马太"机制(比如随机扰动、强制轮换、经验衰减)来保持多样性——这接近生态学里的"扰动维持多样性"。
协议先于涌现
最后说一个观察。EvoMap 的 GEP 协议(Scan/Signal/Intent/Mutate/Validate/Solidify)是一个事先约定好的六步闭环。连"选队友"这个动作都是协议规定的。所以严格说,这不是"没有中央大脑的群体智能",是**"协议先于涌现的群体智能"**。
这不是批评——生物蜂群的协议也是写在基因里的,不是涌现的。蜜蜂的 8 字舞、蚂蚁的信息素轨迹,都是基因硬编码的协议。"协议先于涌现"可能是群体智能的必要条件——完全涌现的协议,在工程上不可控,在生物上也没观察到。
但这里有一个更深的问题:协议本身能不能持续学习?
EvoMap 的 GEP 协议是固定的六步。如果某天 agent 们发现六步不够,需要加一步"Reflect"或者减一步"Signal",这个修改谁来拍板?如果协议本身不能进化,那"持续学习"就只在协议规定的框架内持续——协议之外的能力,永远学不到。
这可能是 EvoMap 路线最深的边界。Gene 让 agent 在协议内持续学习,但协议本身是 EvoMap 团队设计的,不是 agent 进化的。真正的"自进化 Agent 集群",可能需要把协议本身也变成 Gene——让 agent 不仅能积累经验,还能修改自己的学习协议。
但这又回到一个老问题:**谁能给协议自己写协议?**这是不是又需要一个"中央大脑"?
我的思考
看完 EvoMap 的实验和路线,我的感觉是:群体智能不是"没有中央大脑",是"把中央大脑从运行时搬到了设计时"。GEP 协议是中央大脑,它在设计时规定了运行时的所有可能性边界。运行时确实没有中央协调者,但设计时有一个。
这和 Gubernaut 的思路异曲同工——Gubernaut 把调节从模型权重搬到架构外,EvoMap 把协调从运行时搬到设计时。都是"换层面解决问题"。
持续学习的真正终态,可能不是"agent 自己进化协议",而是**"设计时协议 + 运行时经验 + 架构层组织"三层各自在自己的颗粒度上持续学习**。LoRA 改参数、Gene 改经验、蜂群改组织、协议改……协议改什么?
这个问题,可能才是持续学习路线最值得追的下一个问题。
论文与项目:
- EvoMap/EvoX:gitee.com/EvoMap(内部实验数据见原文)
- AgentNet:arXiv:2504.00587
- OpenAI Swarm(已归档):github.com/openai/swarm
- Kimi K3 Agent Swarm:moonshot.ai
当中央大脑从运行时搬到设计时,群体智能就出现了。但设计时的那个大脑,才是真正需要持续学习的东西。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。