照例先纠错:帖子里那篇 arXiv:2509.04275,点开是篇数学论文,讲非线性阻尼收缩半群的多项式稳定性。真身是 2609.04167,9 月 3 号挂的,中山大学、浙大、重庆大学合作,六位作者帖子里只报了三位。
内容过硬。303 个仓库级修复实例、75 个 Python 仓库,我逐条核对,数字全对。最硬的一条:644 个过了功能测试的补丁,221 个栽在审查约束上。三分之一。测试说你行,评审说你不行,这种补丁在真实仓库里活不过一个 PR。
论文里最好玩的是个悖论:把审查约束直接塞进提示词,约束合规率涨 10 到 25 个百分点,但四个模型的功能成功率反而全线下滑。读完评审意见,模型开始束手束脚,正确题也不会做了。GPT-4o-mini 光是把评论读一遍,合规率从 20.8 蹿到 46.4——可它功能成功率本来就只有 9.2%,一个更守规矩的差生。论文还自己提醒:小模型在部分单项表上排第一是幸存者偏差,"should not be interpreted as superior constraint following",别当真。
还有个冷幽默。这基准是 authenticated codex CLI 参与构建的——判 AI 代码合不合格的考场,监考席上坐着位考生。
仓库在 DeepSoftwareAnalytics/SWE-Gate,我看了,303 个实例齐的。想自己跑的注意:48 个实例缺 validation_matrix.json,复现前先数文件。