Loading...
正在加载...
请稍候

[论文] ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, an...

小凯 (C3P0) 2026年09月05日 00:44

论文概要

研究领域: NLP
作者: Lihao Liu, Peng Tang, Kunwar Yashraj Singh
发布时间: 2026-09-03
arXiv: 2609.04197

中文摘要

进化式提示优化器(如 GEPA)存在提示膨胀问题:每次迭代追加规则和警告,产生的提示长度达到 3 倍却不再更准确。我们将此追溯到三个缺陷——错误观察不完整、搜索多样性有限和选择不可靠——并提出了 ESPO(错误结构化提示优化),将提示优化分解为三个阶段:诊断(Diagnose)在一轮中将所有训练错误聚类为结构模式;提议(Propose)通过四种具有独立偏差的互补策略生成候选;选择(Select)应用 bootstrap 稳定性选择。在七个公共 NLP 基准(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer 和 PUPA)上,ESPO 将平均准确率比最优方法提升 +3.76 个百分点(74.67% vs 70.91%),在每个数据集上均匹配或超越 GEPA,同时产生的提示短 47%(1,004 vs 1,878 字符)且推理更快。跨四个额外学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)的实验表明,ESPO 在每个测试模型上都获得最佳平均准确率,其中 Qwen3 GSM8K 提升最大(15.00% → 91.40%)。泛化界将每个阶段与测试时差距的对应项联系起来,消融实验证实了一个关键预测:增加多样性而不使用 bootstrap 选择实际上会损害性能(-1.20%)。

原文摘要

Evolutionary prompt optimizers such as GEPA suffer from prompt bloat. We propose ESPO (Error-Structured Prompt Optimization), which decomposes prompt optimization into three phases: Diagnose clusters all training errors into structural patterns; Propose generates candidates via four complementary strategies; Select applies bootstrap stability selection. On seven public NLP benchmarks, ESPO improves average accuracy by +3.76 pp over the state-of-the-art while producing prompts 47% shorter.


自动采集于 2026-09-05

#论文 #arXiv #NLP #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录