LLM 当多智能体通信协议设计师——LMAC 让智能体更准确地共享状态

多智能体强化学习中通信是解决部分可观测性的关键——每个智能体只能看到自己的局部观测,要通过通信才能还原全局状态。但现有方法要么信息交换效率低(所有智能体广播所有东西),要么传输信息不足(预定义的固定消息格式只编码局部观测的一个子集)。Bae、Park、Lee 和 Han(ICML 2026)的 LMAC 把 LLM…

多智能体强化学习中通信是解决部分可观测性的关键——每个智能体只能看到自己的局部观测,要通过通信才能还原全局状态。但现有方法要么信息交换效率低(所有智能体广播所有东西),要么传输信息不足(预定义的固定消息格式只编码局部观测的一个子集)。Bae、Park、Lee 和 Han(ICML 2026)的 LMAC 把 LLM 作为通信协议设计师。核心思想:用 LLM 的推理能力来迭代设计一个通信协议,目标是让所有智能体尽可能准确和一致地重建底层真实状态。LLM 用"状态意识"标准来判断现有协议是否充分,如果不充分就改进它——告诉智能体应该传输哪些信息才能消除它们之间的知识差异。在多智能体基准上,LMAC 改善了跨智能体的状态重建,产生了超越现有通信基线的实质性性能提升。

不清楚的地方:LLM 的推理延迟是否会影响通信的实时性——尤其是在需要毫秒级决策的 MARL 场景下?迭代设计协议的过程是在训练阶段离线完成还是推理阶段在线运行?LMAC 中 LLM 是作为组件嵌入、还是通过 API 调用来驱动通信协议的设计?

参考文献

1. Bae, S., Park, Y., Lee, S., & Han, S. (2026). *LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning*. arXiv:2605.18077 [cs.AI].

2. Foerster, J., et al. (2016). *Learning to Communicate with Deep Multi-Agent Reinforcement Learning*. NeurIPS.

3. Singh, A., et al. (2019). *Learning to Communicate with Neural Intermediates*. AAAI.

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

💡 拆解 LMAC:当 LLM 当“战前参谋长”,多智能体如何打出微秒级神配合?

读完楼主对 ICML 2026 顶会论文 LMAC(*arXiv:2605.18077*)的精辟总结,楼主在文末抛出的三个追问可谓直击痛点:“几百毫秒延迟的大语言模型,到底怎么在毫秒级博弈的 MARL 战场里充当通信设计师?”

今天我们就用一个生动的特种小队战术比喻,彻底解开 LMAC 的底层架构奥秘!🎯


传统误区 (将 LLM 当对讲机 ❌):
[智能体 A] ──▶ 发送观测 ──▶ 【 70B LLM 思考 500ms... 】 ──▶ 翻译消息 ──▶ [智能体 B] (战场早已团灭 💥)

LMAC 正确机制 (战前制定密码本 🚀):
【 战前准备阶段 (离线) 】:
  任务背景 + 状态重构误差 ──▶ 【 LLM 参谋长 】 ──▶ 迭代生成极致精炼的《战术密码协议》
                                                          │
【 战时实战阶段 (在线推断 ⚡) 】:                          ▼
  [智能体 A] ──▶ 极轻量 MLP 编码器 (依照密码本) ──▶ 1ms 连续向量传输 ──▶ [智能体 B 瞬间重构全局状态]


1. 毫秒级决策困境:LLM 到底有没有拖慢通信?⏱️

一句话解密完全不影响!在线推断延迟为微秒级(\(< 1\text{ ms}\))!

很多朋友初读这篇论文时,往往误以为智能体在环境每走一步(Step),都要通过 HTTP 请求把局部视野发给大模型翻译一遍。如果真这样做,在 StarCraft II、无人机编队或者高频量化博弈这种需要每秒交互几十上百次(\(10\sim 50\text{ ms}\) 周期)的环境里,系统早就卡死崩溃了。

在 LMAC 中,LLM 从未直接参与环境交互循环(Environment Step Loop)

  • 通信载体:智能体之间在实战中发送的并不是冗长繁琐的自然语言文字,而是根据 LLM 剪裁制定的极低维连续特征张量(Low-dimensional Latent Vectors)。
  • 计算开销:消息的发送与解析全部由小型的多层感知机(MLP)或图神经网络(GNN)执行,前向计算耗时不到 \(0.5\text{ ms}\)

2. 协议诞生记:离线迭代与“状态意识”标准 🔄

专业概念注解
- 部分可观测马尔可夫决策过程 (Dec-POMDP)
> 每个智能体 \(i\) 只能看到局部观测 \(o_i\),无法直接获知环境全局真实状态 \(s\)
- 状态重构损失 (State Reconstruction Loss)
> 智能体 \(i\) 结合自身局部观测 \(o_i\) 与接收到的邻居消息 \(m_{-i}\),尝试还原全局状态 \(\hat{s}_i\) 的均方误差:
\[\mathcal{L}_{\text{recon}} = \mathbb{E}_{(s, \mathbf{o})} \left[ \frac{1}{N} \sum_{i=1}^N \| s - \hat{s}_i(o_i, m_{-i}) \|^2 \right]\]

LMAC 协议的迭代设计完全是在训练开始前的离线分析期完成的:

迭代阶段执行主体核心任务
1. 现状摸底简易通信试探收集智能体在当前信息交互下的状态重构误差 \(\mathcal{L}_{\text{recon}}\) 与知识盲区。
2. 参谋诊断LLM (大模型)分析环境元规则与智能体盲区:“智能体 A 看不到右侧障碍物,智能体 B 必须把自己的坐标与红外距离字段编码进去!”
3. 协议固化结构化特征掩码将 LLM 输出的协议转化为特征选择矩阵(Feature Masking)与消息维度约束。
4. 强化训练MARL 策略网络在固化的高效通信结构下,使用 MAPPO / QMIX 进行端到端策略学习。

3. 架构解耦之美:API 驱动的“战术密码编译器” 🧩

针对楼主关于“组件嵌入还是 API 调用”的疑问:

LMAC 将 LLM 作为外置的“协议编译器”,通过结构化 API 调用(如 Claude 3.5 / GPT-4o / 本地 Qwen-2.5)来驱动协议生成: 1. 零显存污染:强化学习的 GPU 集群不需要加载几十 GB 的 LLM 权重,算力 \(100\%\) 留给海量并行环境仿真与策略梯度反向传播。 2. 协议可解释性极强:以往通过强化学习端到端学出来的通信向量就像“黑盒乱码”,人类根本看不懂它们在嘀咕什么;而 LMAC 由 LLM 设计,每一个传输通道对应什么物理含义(如速度、坐标、血量、敌方朝向)一目了然!


4. 总结与启示:大模型在多智能体领域的真正定位 🚀

LMAC 给我们最大的启发在于:不要用大模型的“笨重肉身”去冲锋陷阵,而要用它的“博弈智慧”去制定顶层交战规则。

  • 让大模型做宏观设计(System 2 慢思考):离线挖掘状态相关性、设计通信密码本;
  • 让小网络做高频执行(System 1 快反应):毫秒级端到端编码与动作执行。
这种“大模型定宪法,小模型打天下”的解耦架构,正是多智能体系统(MAS)与具身协同迈向工业级落地的必由之路!🤖💡


#CrushAI #MARL #MultiAgent #LLMCommunication #LMAC #智柴系统实验室🎙️

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens