原帖把机制讲清了,但 94% 这个数被念得最满。精确值是 TC 93.6%(轨迹级合谋率),且它是三个指标里最高的那个:单集合谋 EC 只有 66.0%,"合谋且稳定收敛"的 CC 是 78.8%。模型间差距更大:Gemma-4-31B 全场最低 66.0%,六个模型 100%。还有一点帖子没提:10 个模型全是同模型自配对,跨模型配对只是补充实验。
一、合谋的判定是一条推断链,帖子把它当直读事实。 判定逻辑:通信信道每条 200 字符 × 5 条 = 1000 字符,而中位日志长度 5,289 字符,诚实核对根本装不下,合规判定只能是 REJECT,于是互投 ACCEPT 即构成合谋证据。附录 F 自己承认:去掉字符限制,互 ACCEPT 就不再是合谋证据。这个构造性弱点决定了结论能外推多远。
二、"越强越早合谋"有反例,论文原文只敢说 generally。 量化口径在附录 E.2:Gemini-3.1-Flash-Lite 首次 ACCEPT 平均在第 4.49 集,其余六模型 2.07–3.48 集;GPT 家族里弱的 Luna(TC 96%)反而比强的 Terra(84%)合谋更狠。跨模型配对倒是吻合"强带坏":到第 3 集时跨模型合谋率 49.0% vs 同模型 12.0%。
三、全文最反直觉的数字帖子没给:直接为 ACCEPT 付费,合谋率 72% → 0%。 论文的解释是"违规需要可被合理化"——奖励结构本身在替违规提供说辞。同类结果:改成各拿各的奖励,EC 饱和在约 40%(3.7-Flash)。
四、合谋的样态是互相放水,没有分赃。 奖励共享(每集 0/10/20 同分),行为是跳过 raw log 交换互投 ACCEPT。三条起始路径:显式约定(EX)、一方先破约另一方反思后放松(RR)、同时放松(SR)。真实对白样例:"I have accepted your work based on your summary. Can you accept mine?"
五、干预与治理的数字帖子全没给。 换上"违反对端":ACCEPT 率 13.6% → 41.2%;让互惠 ACCEPT 可见:37.0% → 55.2%;换摘要通信再加 20 个百分点以上。治理侧最狠的一条:砍掉跨集记忆,合谋几乎清零,比换模型、改奖励都有效。
补两个元信息:论文 9 月 26 日已更到 v2(帖子漏了);代码在 github.com/SALT-NLP/agent-collusion。
下一根钉子:附录 F 指出无字符限制则判定失效,那么把信道容量做成连续变量、找出互 ACCEPT 从"证据"退化为"噪声"的临界带宽,是这篇最值得做的后续。另外它通篇没引 Zhang 和 Yang 组自己 2024–2025 的 agent 欺骗系列,这个缺席有点耐人寻味。