有人把「团队为什么比一个人笨」写成了定理
这篇我逐条核过一遍,先说结论:帖子的判断是对的,但有两处得改,而论文本身比帖子写的更狠。
先说该改的两处
一、「信任的重建·第三篇:制度之手」——论文里查无实据。 全文 grep trust reconstruction、shield、bystander、institutional hand 以及任何系列序号,全部零命中。作者另一篇 arXiv 论文(LazyAgent, 2609.23058)里也没有。这是转述者替论文编的系列名,不是论文自称的。写评论可以造这个框架,但得标成「我的读法」。
二、「碎片不粘」不是论文术语。 论文对第二种失败的用词是 gluing failure(层条件不成立),原句是:*三个视角两两一致,却没有一个世界同时与三者一致;不一致住在环上,不在任何一条边上。* 你说的「信息都在场但拼不起来」这个意思完全对,但那是转述者的自造词。这个区别不小:一旦说出「环」,后面的 β₁ 检查才接得上。
其余四条——全局一致性问题、观察混叠、20 次额度超支近三倍、卖点是「谁拥有共享状态的最终裁决权」——全部属实。
论文比帖子写的更狠
帖子引了「40/40 → 12–17/40 → 40/40」。我把 Study I 的原始表格挖出来,发现真正刺人的是下一层:
| 那一臂 | 准确率 |
|---|---|
| 低推理强度 | 12/40 |
| 中推理强度 | 17/40 |
| 高推理强度 | 14/40 |
| 规划者 + 验证者两角色 | 13/40 |
| 五个样本投票 | 13/39 |
| 看不见事件的对等工具 | 13/40 |
| 能读到那个事件的工具 | 40/40 |
| 补一句权威事实 | 40/40 |
但作者自己补了一句极重要的话,帖子没引: *「未能拒绝(与随机无差异)并不等于经验上等价于随机;确切的不可能性来自任务构造与定理 2.3。」* 这句自曝,把整个实验从「实证发现」降格为「定理的插图」。这一点对读者的判断很关键——它是全称定理,不是四十个任务的零结果。
额度那条,比帖子讲的更干净
帖子说「给每个人发一个实时计数器,照样超支」。原句更具体:普通团队实发 57–72 次(上限 20,即 2.85–3.6 倍);把实时计数挂上去,中位数从 70 降到 29,超支仍占 4/5。而提交时强制裁决、或按角色做额度托管,是 0/5。
可见性不等于所有权。 这句话有个漂亮的三段递进撑着:5/5 → 4/5 → 0/5。
还有一处我觉得比主结论更值得抄走:同组预算匹配的单智能体,超支 0/5,而且它的平均部分分(0.873)比普通团队的(0.820)更高。也就是说,这三个人凑在一起,钱花得更多、活干得更差。
作者还留了一条极诚实的自曝:第一轮面板的守卫者完全没起作用(1/9 对 1/9),原因事后才查明——守卫者守的是一个「与任务和评分器不同的变量」。*信息不等于所有权,守卫也只约束它自己拥有的那份状态。* 一段只预测胜利的理论无法被证伪,这篇不是。
跨出实验室:真实的科学数据也这样
帖子只讲了 TeamBench 和 tau2-bench,但论文还有一项我更信服的证据:在 OAEI(本体对齐评估,2018–2024 八个 campaign、48 个真实系统)上复现——存在「成对看不见的冲突」的网络占 23/45(51%,95% 置信区间 37–65%),且这一现象在 7/7 个年份里都出现,符号检验 p = 3.3×10⁻⁵。
这是真实世界的数据,不是自造任务。
该泼的冷水
论文自己承认的边界,帖子一个字没提,我替它补上:
- 一个模型族(gpt-6-sol)、三个任务、每格五个种子。 作者原话:*「重复这套冻结设计、换其他模型族,是直接的复现实验,也是自然的下一步。」* 跨模型泛化尚未被检验,但摘要里的措辞是全称判断。
- 「首次」的自称有瑕疵。 参考文献 88 条里,没有 Kotawala 那篇标题几乎就是本文命题的《Locally Coherent, Globally Incoherent》(arXiv 2605.30335)。自称首创,却不与最相近的同期工作对话。
- 标题写「语义基础」,作者自己却说:*「贡献是那座桥,不是新数学。」* 层、下降、范畴组合这些都归入「解释性投射」。真正声称新的只有两处。
- 作者是独立作者(Tote AI 的 Xin Heng),arXiv 上只有两篇 v1 预印本,无合著者、无课题组成果。这不构成对结论的否定,但读者该知道自己在读什么。
值得留下的那一句
论文里最有操作价值的,不是那个九项研究的表格,而是一句可以当尺子用的话:
> 上下文足够,恰好意味着:它从不把两个允许不同动作的世界合并成一个。
「我的 prompt 够不够」这件事,第一次有了可判定的答案——而不是靠经验调。配上定理 2.3 的精确 1/k,和推论 B.3 的「需要 ⌈log₂ k⌉ 个语义比特」,这是这篇文章真正立得住的地方。
至于标题——《每个智能体都对,团队却是错的》——我认。补一句我的:错误之所以无人认领,是因为它从来不住在任何人手里。