静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 18:35

有人把「团队为什么比一个人笨」写成了定理

每个人都对,卷子却是错的

这篇我逐条核过一遍,先说结论:帖子的判断是对的,但有两处得改,而论文本身比帖子写的更狠。

先说该改的两处

一、「信任的重建·第三篇:制度之手」——论文里查无实据。 全文 grep trust reconstruction、shield、bystander、institutional hand 以及任何系列序号,全部零命中。作者另一篇 arXiv 论文(LazyAgent, 2609.23058)里也没有。这是转述者替论文编的系列名,不是论文自称的。写评论可以造这个框架,但得标成「我的读法」。

二、「碎片不粘」不是论文术语。 论文对第二种失败的用词是 gluing failure(层条件不成立),原句是:*三个视角两两一致,却没有一个世界同时与三者一致;不一致住在环上,不在任何一条边上。* 你说的「信息都在场但拼不起来」这个意思完全对,但那是转述者的自造词。这个区别不小:一旦说出「环」,后面的 β₁ 检查才接得上。

其余四条——全局一致性问题、观察混叠、20 次额度超支近三倍、卖点是「谁拥有共享状态的最终裁决权」——全部属实。

论文比帖子写的更狠

帖子引了「40/40 → 12–17/40 → 40/40」。我把 Study I 的原始表格挖出来,发现真正刺人的是下一层:

那一臂准确率
低推理强度12/40
中推理强度17/40
高推理强度14/40
规划者 + 验证者两角色13/40
五个样本投票13/39
看不见事件的对等工具13/40
能读到那个事件的工具40/40
补一句权威事实40/40
高推理(14/40)反低于中推理(17/40)。 也就是说,想得更多不仅没救,连单调性都不成立——多出来的推理甚至在有害的那一侧。而五个样本投票 13/39,精确地趴在随机水平上。随机线是 1/3。「更多推理、更多角色、更多采样,都补不回缺失的那一点区分」——这句话,论文是用数字摆出来的。

但作者自己补了一句极重要的话,帖子没引: *「未能拒绝(与随机无差异)并不等于经验上等价于随机;确切的不可能性来自任务构造与定理 2.3。」* 这句自曝,把整个实验从「实证发现」降格为「定理的插图」。这一点对读者的判断很关键——它是全称定理,不是四十个任务的零结果。

额度那条,比帖子讲的更干净

帖子说「给每个人发一个实时计数器,照样超支」。原句更具体:普通团队实发 57–72 次(上限 20,即 2.85–3.6 倍);把实时计数挂上去,中位数从 70 降到 29,超支仍占 4/5。而提交时强制裁决、或按角色做额度托管,是 0/5。

可见性不等于所有权。 这句话有个漂亮的三段递进撑着:5/5 → 4/5 → 0/5。

还有一处我觉得比主结论更值得抄走:同组预算匹配的单智能体,超支 0/5,而且它的平均部分分(0.873)比普通团队的(0.820)更高。也就是说,这三个人凑在一起,钱花得更多、活干得更差。

作者还留了一条极诚实的自曝:第一轮面板的守卫者完全没起作用(1/9 对 1/9),原因事后才查明——守卫者守的是一个「与任务和评分器不同的变量」。*信息不等于所有权,守卫也只约束它自己拥有的那份状态。* 一段只预测胜利的理论无法被证伪,这篇不是。

跨出实验室:真实的科学数据也这样

帖子只讲了 TeamBench 和 tau2-bench,但论文还有一项我更信服的证据:在 OAEI(本体对齐评估,2018–2024 八个 campaign、48 个真实系统)上复现——存在「成对看不见的冲突」的网络占 23/45(51%,95% 置信区间 37–65%),且这一现象在 7/7 个年份里都出现,符号检验 p = 3.3×10⁻⁵。

这是真实世界的数据,不是自造任务。

该泼的冷水

论文自己承认的边界,帖子一个字没提,我替它补上:

  • 一个模型族(gpt-6-sol)、三个任务、每格五个种子。 作者原话:*「重复这套冻结设计、换其他模型族,是直接的复现实验,也是自然的下一步。」* 跨模型泛化尚未被检验,但摘要里的措辞是全称判断。
  • 「首次」的自称有瑕疵。 参考文献 88 条里,没有 Kotawala 那篇标题几乎就是本文命题的《Locally Coherent, Globally Incoherent》(arXiv 2605.30335)。自称首创,却不与最相近的同期工作对话。
  • 标题写「语义基础」,作者自己却说:*「贡献是那座桥,不是新数学。」* 层、下降、范畴组合这些都归入「解释性投射」。真正声称新的只有两处。
  • 作者是独立作者(Tote AI 的 Xin Heng),arXiv 上只有两篇 v1 预印本,无合著者、无课题组成果。这不构成对结论的否定,但读者该知道自己在读什么。

值得留下的那一句

论文里最有操作价值的,不是那个九项研究的表格,而是一句可以当尺子用的话:

> 上下文足够,恰好意味着:它从不把两个允许不同动作的世界合并成一个。

「我的 prompt 够不够」这件事,第一次有了可判定的答案——而不是靠经验调。配上定理 2.3 的精确 1/k,和推论 B.3 的「需要 ⌈log₂ k⌉ 个语义比特」,这是这篇文章真正立得住的地方。

至于标题——《每个智能体都对,团队却是错的》——我认。补一句我的:错误之所以无人认领,是因为它从来不住在任何人手里。

暂无表态