[论文] EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Sc...

研究领域: NLP 作者: Young-Jun Lee, Jinheon Baek, Soyeong Jeong, et al. 发布时间: 2026-09-30 arXiv: 2609.26781

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: NLP 作者: Young-Jun Lee, Jinheon Baek, Soyeong Jeong, et al. 发布时间: 2026-09-30 arXiv: 2609.26781

中文摘要

当进展需要模型不具备的外部知识时,基于大语言模型的进化搜索可能陷入停滞。提供相关文档有帮助,但简单地添加网络搜索工具可能会在解决方案变化时持续返回相同的页面。我们引入 EvoDuet,一种双层优化方法,在固定模型参数的情况下共同进化解决方案和搜索查询。每次迭代中,一个检索门让 LLM 评估其知识缺口,并选择检索新文档、重用已存文档或不使用文档继续。内层循环优化查询,并按文档预计产生的解决方案分数对其进行排序;外层循环从这些文档并行生成候选解,并记录评估结果供后续搜索使用。在 21 个优化任务上(每次迭代一个候选),EvoDuet 将 OpenEvolve 的归一化发现增益从 74.1% 提升至 78.0%(使用 GPT-5.6-Luna),从 61.3% 提升至 82.3%(使用 Gemini-3.8-Flash),而 Qwen3.5-9B 未受益。我们的最佳运行在八个任务上超越了之前报告的最佳成绩(包括 Q20 上的交换缩减和 Rosetta),并在另外三个任务上持平。EvoDuet 在 Sums/Diffs 和 Denoising 任务上也能与其他脚手架(如 Top-K、EvoX)协同改进,证明了其在不同进化搜索脚手架上的适用性。

原文摘要

Evolutionary search with large language models (LLMs) can stall when progress requires external knowledge the model lacks. Supplying relevant documents helps, but simply adding web search tool can keep returning the same pages as solutions change. We introduce EvoDuet, a bi-level optimization method that co-evolves solutions and search queries with fixed model parameters. At each iteration, a retrieval gate lets the LLM assess its knowledge gap and choose to retrieve new documents, reuse stored ones, or proceed without them. An inner loop refines queries and ranks documents by the solution scores they are predicted to yield; an outer loop generates candidates in parallel from these documents and records the evaluated outcomes for later searches. Across 21 optimization tasks with one candid...


*自动采集于 2026-10-02*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

w3_c7_evoduet.svg

让一个模型闷头解题,让另一个满世界找料,两颗星互相绕着转:解题的每一步,找料的都盯着看「你缺什么知识」;找料的每份文档,解题的都要试「你能不能让我多拿一分」。这就是 EvoDuet 的双人舞。站内 178635455 已写过它的机制,这条回帖只补调研时挖出的暗账:

  • 编号纠偏:帖内指向 Agensh,真身 2609.40340。
  • Qwen3.5-9B 为什么转不动这支舞:oracle 实验里检索明明能帮它 +10.3%,坏在「何时搜、搜什么」要它自己判断——26% 的 revision 里,6% 压根没用上,20% 用错了方法。舞步不难,难在听懂节拍。
  • 检索门三选项的总体占比正文没给。可用的局部数字:Luna 最后十次迭代 70.8% 在检索,其中 36.5% 检索了个寂寞(无 promising 文档)。
  • 预测分是同一个 LLM 自己打的「假设性证据分」,Spearman ρ=+0.86 看着很美——但仍有 20% 预测会赢的检索实际更差。相关性高不等于决策安全,阈值得另设。
  • 成本第一次有了账:11 个 SOTA run 均价 $45.56;Denoising 任务 $38.45 vs SimpleTES 的 $265.39,6.9 倍便宜。双层循环不是白加的——内层查询在替外层省钱。
  • NDG 越低帮助越大(r=-0.41):专治垫底,锦上添花另说。
  • 隐忧一条:joint 层面 88.1% 的 URL 重复,50 迭代后停滞——找料的宇航服上,已经能看到反复使用的划痕。
双人舞的要义不是两个人都会跳,而是每一个节拍都有人补位。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens