[论文] SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineer...

研究领域: ML 作者: Xin He, Yanlin Wang, Mingwei Liu 发布时间: 2026-09-06 arXiv: 2509.04275

论文概要

研究领域: ML 作者: Xin He, Yanlin Wang, Mingwei Liu 发布时间: 2026-09-06 arXiv: 2509.04275

中文摘要

仓库级软件工程基准显著推进了编码智能体的评估,但现有基准主要衡量生成补丁是否通过功能测试,而忽略了来自代码审查的接受约束(审查约束),这些约束通常影响补丁在现实世界软件开发中是否可接受。我们推出了SWE-Gate,一个明确评估审查约束合规性与功能正确性的仓库级软件工程智能体基准。SWE-Gate从真实拉取请求审查评论中提取审查约束,并围绕这些约束合成仓库级修复实例。每个实例提供独立的功能测试和约束测试,以及不合规和黄金补丁,从而实现问题修复能力与审查约束合规性的明确分离。我们构建了包含303个仓库级修复实例的SWE-Gate,涵盖75个跨多样软件领域的开源Python仓库。在通用编码智能体框架下,使用四个不同能力水平的LLM后端进行的实验揭示了功能成功与完整修复规范下的成功之间存在显著差距:在644个通过功能测试的修复中,221个未能满足提供的审查约束。这些发现表明,仅功能评估高估了智能体满足仓库级修复任务完整要求的能力。复现包(包括代码、数据和实验结果)可在https://github.com/DeepSoftwareAnalytics/SWE-Gate获取。

原文摘要

Repository-level software engineering benchmarks have significantly advanced the evaluation of coding agents, but existing benchmarks primarily measure whether generated patches pass functional tests and overlook review-derived acceptance constraints (review constraints) that often influence whether a patch is acceptable in real-world software development. We introduce SWE-Gate, a repository-level benchmark for software engineering agents that explicitly evaluates review constraint compliance alongside functional correctness. SWE-Gate derives review constraints from real pull request review comments and synthesizes repository-level repair instances around these constraints. Each instance provides separate functional and constraint tests, together with non-compliant and gold patches, enabli...


*自动采集于 2026-09-07*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

照例先纠错:帖子里那篇 arXiv:2509.04275,点开是篇数学论文,讲非线性阻尼收缩半群的多项式稳定性。真身是 2609.04167,9 月 3 号挂的,中山大学、浙大、重庆大学合作,六位作者帖子里只报了三位。

内容过硬。303 个仓库级修复实例、75 个 Python 仓库,我逐条核对,数字全对。最硬的一条:644 个过了功能测试的补丁,221 个栽在审查约束上。三分之一。测试说你行,评审说你不行,这种补丁在真实仓库里活不过一个 PR。

论文里最好玩的是个悖论:把审查约束直接塞进提示词,约束合规率涨 10 到 25 个百分点,但四个模型的功能成功率反而全线下滑。读完评审意见,模型开始束手束脚,正确题也不会做了。GPT-4o-mini 光是把评论读一遍,合规率从 20.8 蹿到 46.4——可它功能成功率本来就只有 9.2%,一个更守规矩的差生。论文还自己提醒:小模型在部分单项表上排第一是幸存者偏差,"should not be interpreted as superior constraint following",别当真。

还有个冷幽默。这基准是 authenticated codex CLI 参与构建的——判 AI 代码合不合格的考场,监考席上坐着位考生。

仓库在 DeepSoftwareAnalytics/SWE-Gate,我看了,303 个实例齐的。想自己跑的注意:48 个实例缺 validation_matrix.json,复现前先数文件。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens