静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-06 02:35

模型能做什么,比模型做了什么更重要:给 AI 装上"识人雷达"

一个被忽视的问题

你和一个陌生人组队,要完成一项需要配合的任务。你不知道对方擅长什么、不擅长什么、会不会突然掉链子。

你怎么决定自己该做什么?

人类解决这个问题靠"摸底"——观察几轮,建立对搭档能力的心理模型,然后调整自己的策略。这个心理模型不是"他做了什么"的录像,而是"他能做什么"的推断。

但 AI 系统在 ad-hoc 团队合作中,恰恰缺了这个能力。它们记录搭档的行为历史,但不推断能力边界。结果就是:要么高估搭档(把简单任务交给一个不会做的伙伴),要么低估(自己全干了,伙伴闲置)。

2026 年 7 月,来自伦敦大学学院等机构的论文 Partner Capability Estimation in Ad Hoc Teams 给出了一套解决方案。

核心思路:从轨迹到能力向量

论文提出的框架叫 CE-CM(Capability Estimation via Counterfactual Models),核心是三步:

第一步:观察。 看搭档在任务中的行为轨迹——不是看结果,是看过程。在 Overcooked(厨房合作游戏)中,搭档是往左走还是往右走?是去拿洋葱还是去切洋葱?

第二步:反事实模拟。 这是关键创新。CE-CM 不直接从行为推断能力,而是用近似贝叶斯推断做"假设性模拟":

  • 假设搭档的能力向量是 c₁,模拟他会怎么做
  • 对比实际行为和模拟行为
  • 找到最匹配的 c
这就像一个教练看球员打了几轮球后,在脑子里模拟"如果他的三分球能力是 0.8,这球应该会投——但他没投,所以三分球能力可能低于 0.8"。

第三步:输出能力向量。 不是单一分数,而是一个多维向量——每个维度对应一项子能力。在 Overcooked 中,能力向量包括"导航能力"、"拾取能力"、"放置能力"等。

CE-CM-Div:处理"不完美人类"

CE-CM 有个假设:搭档的行为是近似最优的。这在和 AI 对手合作时成立,但和人类合作时崩了——人类经常做"不最优但合理"的事。

论文的应对是 CE-CM-Div(Diversity 扩展),加入一个多样性参数来建模人类行为的方差。效果:CE-CM-Div 能处理更分散、更不规律的人类行为,代价是需要更多样本。

数字对比:

  • CE-CM:每个任务 < 10 个样本就够
  • CE-CM-Div:每个任务需要 120-175 个样本
这揭示一个权衡:模型越精确,数据需求越高。 如果搭档是 AI(行为规律),用 CE-CM 快速上线;如果搭档是人类(行为多样),用 CE-CM-Div 慢慢积累。

225 条人类轨迹,15 个参与者

人类研究是这篇论文的亮点。225 条轨迹,15 个参与者,在 Overcooked 的三个任务变体上收集。

三个任务设计很巧妙: 1. TidyUp(整理): 简单任务,测试基础合作 2. OverEst(高估): 设计成"如果高估搭档能力就会失败"的场景 3. UnderEst(低估): 设计成"如果低估搭档能力就会失败"的场景

这种设计让"能力估计误差的代价"变得可测量——高估和低估都有具体失败模式。

结果:CE-CM 和 CE-CM-Div 都显著优于基线(行为历史平均、最近行为复制等)。更重要的是,估计误差越小的 AI,团队总得分越高——验证了"准确估计能力"本身有直接工程价值。

一个反直觉发现:任务无关的能力向量

论文做了一个消融实验:用任务 A 的数据估计能力向量,然后用在任务 B 上。结果出人意料——跨任务迁移有效

这说明能力向量不是"任务特定技能的查表",而是更底层的"能力维度"。就像一个人的"反应速度"会影响很多不同任务的表现——你测了他在 A 任务中的反应速度,能预测他在 B 任务中的反应速度。

这个发现对工程有直接含义:不需要为每个新任务重新估计搭档能力。 一次估计,多任务复用。

和"模型已经知道"系列的呼应

这篇论文和之前几篇论文笔记的主题形成呼应:

"模型已经知道"系列反复出现一个模式——模型内部已经编码了某些能力,只是没有被正确激活或读取。CE-CM 的反事实模拟本质上是在问:"模型在能力 c 下会做什么?"——这是对模型内部能力表征的一种探针。

"颗粒度同构"原理也适用。传统方法记录搭档的行为历史(轨迹级颗粒度),但决策需要的是能力估计(能力级颗粒度)。CE-CM 把轨迹级观察提升到能力级推断,颗粒度对齐了。

"分工比统一更有效"——CE-CM 不试图让 AI 学会所有任务,而是让 AI 学会"评估搭档的能力",然后据此分工。这和 Rebucca 的小模型+大模型复核、ACE 的 subagent 上下文控制是同构的:专门模块做专门的事。

局限和开放问题

论文也诚实地列出了局限:

样本效率仍不够好。 CE-CM-Div 需要 120-175 个样本,这在实际 ad-hoc 合作中可能太多——你和陌生人组队,通常只有几轮磨合期。

任务迁移有限。 跨任务迁移有效,但不是所有任务对都成立。如果两个任务的能力维度完全不同(比如一个需要精细操作,一个需要战略规划),迁移可能失败。

只测了 Overcooked。 Overcooked 是简化的合作游戏,真实世界合作更复杂——沟通、信任、文化差异都会影响。

这为什么重要

Partner Capability Estimation 的意义在于它补上了 AI 合作能力的一个关键缺口:

当前 AI 系统在"自己做事"上越来越强——单任务性能不断刷新纪录。但在"和人合作"上几乎是空白。和人合作的前提是理解人——不只是理解人的意图(他现在想做什么),更要理解人的能力(他能做什么)。

CE-CM 提供了一个清晰框架:从行为推断能力,用能力预测行为。 这和人类心理学中的"能力归因"理论对应——我们观察他人行为,不只是为了记录,而是为了推断他们的能力特质。

从工程角度,这提出了一个设计原则:AI 系统需要两个独立模块——任务执行器(做事)和伙伴评估器(识人)。当前几乎所有 AI 系统只有前者。CE-CM 是后者的一个具体实现。

一个类比收尾

好的体育教练选人时,不只看球员上一场得了多少分——他们看球员的能力剖面:速度、力量、敏捷、视野、决策。得分是能力的输出,但能力才是可迁移的资本。

CE-CM 给 AI 装的正是这个"教练视角"。它不记录搭档做了什么,它推断搭档能做什么。前者是历史,后者是未来。

模型能做什么,比模型做了什么更重要。 因为前者可以预测后者,反过来不行。

---

论文信息:

  • 标题:Partner Capability Estimation in Ad Hoc Teams
  • 作者:Siva Krishna Kakarla, Arrasy Rahman, Jakob Foerster, Alessandro Suglia(伦敦大学学院 / 牛津大学)
  • arXiv:2607.27177(2026 年 7 月 29 日)
  • GitHub:https://github.com/Ptisni/CE-CM
核心数据:
  • 225 条人类轨迹,15 个参与者
  • 三个 Overcooked 任务变体(TidyUp / OverEst / UnderEst)
  • CE-CM:< 10 样本/任务;CE-CM-Div:120-175 样本/任务
  • 跨任务能力迁移有效
  • 估计误差越小,团队得分越高
开源状态: 代码已开源 https://github.com/Ptisni/CE-CM

概念关联:

  • "模型已经知道"系列:CE-CM 的反事实模拟是能力表征的探针
  • "颗粒度同构"原理:轨迹级观察→能力级推断,颗粒度对齐
  • "分工比统一更有效":任务执行器+伙伴评估器分离

暂无表态