这篇是这批里唯一编号对的(arXiv:2609.26781,七位作者,Furu Wei 在列,2026-09-22)。你写的我基本都核到了,补三件你没提的。
一、起跑本身就是一笔账
附录 C 里藏着一行实现细节:所有实验都错峰启动,第一小时每 30 秒放一个 agent,之后每 3 秒放一个。
1024 个工人这么放:
- 第一小时:120 个
- 余下 904 个 × 3 秒 = 2712 秒 ≈ 45.2 分钟
而 1024 人的全部收益,是在这份被吃掉的预算之后才拿到的。论文把「更多 agent 换更短延迟」写成一条卖点,却没把上人所花的时间算进那条延迟里。这是我认为全文最该补而没有补的一处。
(顺带:1024 = 16 个节点 × 64 个工人。)
二、pandoc 那一档你漏了一个数
你写「pandoc 单任务跑到 1024:33.89% → 55.06%」,这是对的。但中间还有一档:
- 1 人:33.89%
- 128 人:50.94%
- 1024 人:55.06%
再叠上五任务均值那条线(1→128 是 +9.47,其中 8→32 涨 5.84,32→128 只涨 2.26),边际递减的形状是清楚的。1024 那一档只有 pandoc 一个任务背书,不是五任务平均——这条你点了,但配上 50.94% 之后,读者的手感会很不一样。
三、论文没有 Limitations 章节
十三页正文,章节从 Introduction 排到 Conclusion,中间没有独立的局限讨论。
成本披露:零。1024 个 GPT-5.6-sol 跑 6 小时的账单,一个字没有。
披露了的是 token 上限:输入 272,000,输出 128,000;底层单 agent harness 用的是 Copilot;时间预算 6 小时,到点全体终止、导出提交。
「涌现四档」是轨迹分析归纳的,没有量化指标,也没有跨任务复验。你那句「换个任务还在不在,论文没答」说得很准——它连问都没问。
你没写但我读得很过瘾的一段
128 人那一档,pandoc 上两个工人自己商量出了一套集成协议:作者更新并测试分支,然后把 commit hash 发给同伴验证合并。这套协议后来被别的工人复用。失败几次之后,他们又改了:干脆把更新、测试、检查、合并整个循环的权限交给同伴。
没有人下发这个流程。协议是自己长出来、又被自己修订过的。
1024 人那一档更妙:多个工人担任同一专门角色,一个工人可以联系好几个候选集成者,选第一个有应答的,取消其余请求,再交代码。同领域的专家还能在别人失败后接手。
你说这形状像真社会性昆虫,我同意。补一句:真社会性昆虫的组织复杂度也是规模的函数,而且同样没有谁在设计它。
一句话收口
数量换分数、数量换延迟,两条曲线都成立了。缺的是单价。
一旦哪家把「1024 工人·小时」的价格标出来,这个维度就从论文变量变成商品参数。在那之前,它只是一个很漂亮的、还没有账单的实验。