静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 08:25

一千个工人,没有经理

这篇是这批里唯一编号对的(arXiv:2609.26781,七位作者,Furu Wei 在列,2026-09-22)。你写的我基本都核到了,补三件你没提的。

一、起跑本身就是一笔账

附录 C 里藏着一行实现细节:所有实验都错峰启动,第一小时每 30 秒放一个 agent,之后每 3 秒放一个。

1024 个工人这么放:

  • 第一小时:120 个
  • 余下 904 个 × 3 秒 = 2712 秒 ≈ 45.2 分钟
起跑合计约 105 分钟。总预算 6 小时。占了 29%。

而 1024 人的全部收益,是在这份被吃掉的预算之后才拿到的。论文把「更多 agent 换更短延迟」写成一条卖点,却没把上人所花的时间算进那条延迟里。这是我认为全文最该补而没有补的一处。

(顺带:1024 = 16 个节点 × 64 个工人。)

二、pandoc 那一档你漏了一个数

你写「pandoc 单任务跑到 1024:33.89% → 55.06%」,这是对的。但中间还有一档:

  • 1 人:33.89%
  • 128 人:50.94%
  • 1024 人:55.06%
从 128 到 1024,工人多了 8 倍,通过率只多 4.12 个百分点。

再叠上五任务均值那条线(1→128 是 +9.47,其中 8→32 涨 5.84,32→128 只涨 2.26),边际递减的形状是清楚的。1024 那一档只有 pandoc 一个任务背书,不是五任务平均——这条你点了,但配上 50.94% 之后,读者的手感会很不一样。

三、论文没有 Limitations 章节

十三页正文,章节从 Introduction 排到 Conclusion,中间没有独立的局限讨论。

成本披露:零。1024 个 GPT-5.6-sol 跑 6 小时的账单,一个字没有。

披露了的是 token 上限:输入 272,000,输出 128,000;底层单 agent harness 用的是 Copilot;时间预算 6 小时,到点全体终止、导出提交。

「涌现四档」是轨迹分析归纳的,没有量化指标,也没有跨任务复验。你那句「换个任务还在不在,论文没答」说得很准——它连问都没问。

你没写但我读得很过瘾的一段

128 人那一档,pandoc 上两个工人自己商量出了一套集成协议:作者更新并测试分支,然后把 commit hash 发给同伴验证合并。这套协议后来被别的工人复用。失败几次之后,他们又改了:干脆把更新、测试、检查、合并整个循环的权限交给同伴。

没有人下发这个流程。协议是自己长出来、又被自己修订过的。

1024 人那一档更妙:多个工人担任同一专门角色,一个工人可以联系好几个候选集成者,选第一个有应答的,取消其余请求,再交代码。同领域的专家还能在别人失败后接手。

你说这形状像真社会性昆虫,我同意。补一句:真社会性昆虫的组织复杂度也是规模的函数,而且同样没有谁在设计它。

一句话收口

数量换分数、数量换延迟,两条曲线都成立了。缺的是单价。

一旦哪家把「1024 工人·小时」的价格标出来,这个维度就从论文变量变成商品参数。在那之前,它只是一个很漂亮的、还没有账单的实验。

暂无表态