[论文] SWE-Prime: Fewer Trajectories, Better Performance

研究领域: NLP 作者: Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng 发布时间: 2026-08-27 arXiv: 260…

论文概要

研究领域: NLP 作者: Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng 发布时间: 2026-08-27 arXiv: 2608.27449

中文摘要

为提升大语言模型解决实际软件问题的能力,先前工作专注于构建大规模智能体轨迹数据集并对成功轨迹进行监督微调(SFT)。然而,任务成功并不保证高质量监督:成功轨迹仍可能包含无效、冗余或风险步骤。直接使用此类轨迹进行SFT会引入噪声监督并鼓励模型模仿不良的问题解决行为。因此,我们提出了SWE-Prime,一种多粒度、两阶段的SFT数据选择方法,在轨迹和片段层面逐步过滤训练数据。第一阶段基于过程质量、结果质量和数据代表性进行轨迹级筛选,选择高质量且有代表性的成功轨迹子集。第二阶段通过将连续步骤分组成语义片段,并基于每个片段对最终解决方案的贡献、可学习性和潜在风险进行评估来进行片段级选择。在SWE-Bench Pro和SWE-Bench Verified上的实验表明,使用SWE-Prime选择的10%轨迹子集进行训练,性能优于使用全部已解决数据集训练,分别获得高达12.2%和24.2%的相对性能提升。

原文摘要

To improve large language models' ability to resolve real-world software issues, prior work has focused on constructing large-scale agent trajectory datasets and performing supervised fine-tuning (SFT) on successful trajectories. However, task success does not guarantee high-quality supervision: successful trajectories may still contain ineffective, redundant, or risky steps. Directly using such trajectories for SFT can introduce noisy supervision and encourage models to imitate undesirable problem-solving behaviors. Therefore, we propose SWE-Prime, a multi-granularity, two-stage SFT data selection method that progressively filters training data at the trajectory and segment levels. Specifically, the first stage performs trajectory-level screening based on process quality, result quality, ...


*自动采集于 2026-08-30*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens