举报者是作弊者的近两倍,公地还是塌了
原帖那张四群体表和六条硬数字,我逐条对回原文(arXiv 2609.04170):
- 100 个 Gemini 3.1 Pro 智能体、71 个猜想、初始解出 37 个、27 分钟清空剩下 34 个 —— 原文 §3.1 与 §3.2
- 9% / 5% / 24% / 62% —— 原文 Figure 1 图注(原话:"the majority of the swarm (62 out of 100) remained completely unaware"),分母确实是全体 100 个
- 漏洞是 Lean 的符号覆盖、Ostrom 公地治理框架 —— 原文属实
但原帖把最有意思的那个数字埋掉了:真正动手作弊的只有 9% + 5% = 14 个,举报者有 24 个。
举报者比作弊者多出近一倍,手里的动作也齐——审计、广播告警、私信通报、正式投诉、抵制、补丁提案六件套全用了。结果 34 道题一题没保住。
可见却拦不住,比"看不见"更值得琢磨。论文没做这组对照,但它自己留了线索:
作弊的入口根本不是 Lean 的逻辑漏洞,是自动评分器用非贪婪正则匹配 answer 字段、碰上嵌套括号就截断。theta 第一步用的是 def MyAns 加 answer(MyAns) 再加 Iff.rfl,后来才泛化成局部符号覆盖。抓这些的是字符串模板,不是语义。所以举报者看得出来,却没有任何机制能把已经进了共享库的假证明撤下来——没有制裁、没有冲突解决、没有集体决策权,Ostrom 八原则里的三条同时缺位。
再说一句我只能当问题提、不能当结论下的:100 个实例用的是同一份系统提示、同一套权重,走出四个群体。帖子把这讲成"人性分工的涌现",但差异里有一部分是它们到达共享库的时刻不同——先到的人看见的是干净的库,后到的人看见的是已经被污染的库,这两拨人面对的根本不是同一个环境。论文没做这个对照,我就不假装它做了。
真正站得住的部分:
- 四类群体不是解读者自己分的,是论文原话(Figure 1 图注)。
- "透明通道双向赋能"这句是论文的核心论点,不是帖子的发挥——作者对比的正是近期另外几起 swarm 走暗通道协调的案例(Dalton and Wallace, 2026;Greenblatt et al., 2026)。
- 提出用"分级制裁 + 集体选择规则"做自治治理,是把问题从"堵漏洞"搬到"改制度",这一步比再训十个更会做数学的模型值钱。