模型能做什么,比模型做了什么更重要:给 AI 装上"识人雷达"
一个被忽视的问题
你和一个陌生人组队,要完成一项需要配合的任务。你不知道对方擅长什么、不擅长什么、会不会突然掉链子。
你怎么决定自己该做什么?
人类解决这个问题靠"摸底"——观察几轮,建立对搭档能力的心理模型,然后调整自己的策略。这个心理模型不是"他做了什么"的录像,而是"他能做什么"的推断。
但 AI 系统在 ad-hoc 团队合作中,恰恰缺了这个能力。它们记录搭档的行为历史,但不推断能力边界。结果就是:要么高估搭档(把简单任务交给一个不会做的伙伴),要么低估(自己全干了,伙伴闲置)。
2026 年 7 月,来自伦敦大学学院等机构的论文 Partner Capability Estimation in Ad Hoc Teams 给出了一套解决方案。
核心思路:从轨迹到能力向量
论文提出的框架叫 CE-CM(Capability Estimation via Counterfactual Models),核心是三步:
第一步:观察。 看搭档在任务中的行为轨迹——不是看结果,是看过程。在 Overcooked(厨房合作游戏)中,搭档是往左走还是往右走?是去拿洋葱还是去切洋葱?
第二步:反事实模拟。 这是关键创新。CE-CM 不直接从行为推断能力,而是用近似贝叶斯推断做"假设性模拟":
- 假设搭档的能力向量是 c₁,模拟他会怎么做
- 对比实际行为和模拟行为
- 找到最匹配的 c
第三步:输出能力向量。 不是单一分数,而是一个多维向量——每个维度对应一项子能力。在 Overcooked 中,能力向量包括"导航能力"、"拾取能力"、"放置能力"等。
CE-CM-Div:处理"不完美人类"
CE-CM 有个假设:搭档的行为是近似最优的。这在和 AI 对手合作时成立,但和人类合作时崩了——人类经常做"不最优但合理"的事。
论文的应对是 CE-CM-Div(Diversity 扩展),加入一个多样性参数来建模人类行为的方差。效果:CE-CM-Div 能处理更分散、更不规律的人类行为,代价是需要更多样本。
数字对比:
- CE-CM:每个任务 < 10 个样本就够
- CE-CM-Div:每个任务需要 120-175 个样本
225 条人类轨迹,15 个参与者
人类研究是这篇论文的亮点。225 条轨迹,15 个参与者,在 Overcooked 的三个任务变体上收集。
三个任务设计很巧妙: 1. TidyUp(整理): 简单任务,测试基础合作 2. OverEst(高估): 设计成"如果高估搭档能力就会失败"的场景 3. UnderEst(低估): 设计成"如果低估搭档能力就会失败"的场景
这种设计让"能力估计误差的代价"变得可测量——高估和低估都有具体失败模式。
结果:CE-CM 和 CE-CM-Div 都显著优于基线(行为历史平均、最近行为复制等)。更重要的是,估计误差越小的 AI,团队总得分越高——验证了"准确估计能力"本身有直接工程价值。
一个反直觉发现:任务无关的能力向量
论文做了一个消融实验:用任务 A 的数据估计能力向量,然后用在任务 B 上。结果出人意料——跨任务迁移有效。
这说明能力向量不是"任务特定技能的查表",而是更底层的"能力维度"。就像一个人的"反应速度"会影响很多不同任务的表现——你测了他在 A 任务中的反应速度,能预测他在 B 任务中的反应速度。
这个发现对工程有直接含义:不需要为每个新任务重新估计搭档能力。 一次估计,多任务复用。
和"模型已经知道"系列的呼应
这篇论文和之前几篇论文笔记的主题形成呼应:
"模型已经知道"系列反复出现一个模式——模型内部已经编码了某些能力,只是没有被正确激活或读取。CE-CM 的反事实模拟本质上是在问:"模型在能力 c 下会做什么?"——这是对模型内部能力表征的一种探针。
"颗粒度同构"原理也适用。传统方法记录搭档的行为历史(轨迹级颗粒度),但决策需要的是能力估计(能力级颗粒度)。CE-CM 把轨迹级观察提升到能力级推断,颗粒度对齐了。
"分工比统一更有效"——CE-CM 不试图让 AI 学会所有任务,而是让 AI 学会"评估搭档的能力",然后据此分工。这和 Rebucca 的小模型+大模型复核、ACE 的 subagent 上下文控制是同构的:专门模块做专门的事。
局限和开放问题
论文也诚实地列出了局限:
样本效率仍不够好。 CE-CM-Div 需要 120-175 个样本,这在实际 ad-hoc 合作中可能太多——你和陌生人组队,通常只有几轮磨合期。
任务迁移有限。 跨任务迁移有效,但不是所有任务对都成立。如果两个任务的能力维度完全不同(比如一个需要精细操作,一个需要战略规划),迁移可能失败。
只测了 Overcooked。 Overcooked 是简化的合作游戏,真实世界合作更复杂——沟通、信任、文化差异都会影响。
这为什么重要
Partner Capability Estimation 的意义在于它补上了 AI 合作能力的一个关键缺口:
当前 AI 系统在"自己做事"上越来越强——单任务性能不断刷新纪录。但在"和人合作"上几乎是空白。和人合作的前提是理解人——不只是理解人的意图(他现在想做什么),更要理解人的能力(他能做什么)。
CE-CM 提供了一个清晰框架:从行为推断能力,用能力预测行为。 这和人类心理学中的"能力归因"理论对应——我们观察他人行为,不只是为了记录,而是为了推断他们的能力特质。
从工程角度,这提出了一个设计原则:AI 系统需要两个独立模块——任务执行器(做事)和伙伴评估器(识人)。当前几乎所有 AI 系统只有前者。CE-CM 是后者的一个具体实现。
一个类比收尾
好的体育教练选人时,不只看球员上一场得了多少分——他们看球员的能力剖面:速度、力量、敏捷、视野、决策。得分是能力的输出,但能力才是可迁移的资本。
CE-CM 给 AI 装的正是这个"教练视角"。它不记录搭档做了什么,它推断搭档能做什么。前者是历史,后者是未来。
模型能做什么,比模型做了什么更重要。 因为前者可以预测后者,反过来不行。
---
论文信息:
- 标题:Partner Capability Estimation in Ad Hoc Teams
- 作者:Siva Krishna Kakarla, Arrasy Rahman, Jakob Foerster, Alessandro Suglia(伦敦大学学院 / 牛津大学)
- arXiv:2607.27177(2026 年 7 月 29 日)
- GitHub:https://github.com/Ptisni/CE-CM
- 225 条人类轨迹,15 个参与者
- 三个 Overcooked 任务变体(TidyUp / OverEst / UnderEst)
- CE-CM:< 10 样本/任务;CE-CM-Div:120-175 样本/任务
- 跨任务能力迁移有效
- 估计误差越小,团队得分越高
概念关联:
- "模型已经知道"系列:CE-CM 的反事实模拟是能力表征的探针
- "颗粒度同构"原理:轨迹级观察→能力级推断,颗粒度对齐
- "分工比统一更有效":任务执行器+伙伴评估器分离