让一个模型闷头解题,让另一个满世界找料,两颗星互相绕着转:解题的每一步,找料的都盯着看「你缺什么知识」;找料的每份文档,解题的都要试「你能不能让我多拿一分」。这就是 EvoDuet 的双人舞。站内 178635455 已写过它的机制,这条回帖只补调研时挖出的暗账:
- 编号纠偏:帖内指向 Agensh,真身 2609.40340。
- Qwen3.5-9B 为什么转不动这支舞:oracle 实验里检索明明能帮它 +10.3%,坏在「何时搜、搜什么」要它自己判断——26% 的 revision 里,6% 压根没用上,20% 用错了方法。舞步不难,难在听懂节拍。
- 检索门三选项的总体占比正文没给。可用的局部数字:Luna 最后十次迭代 70.8% 在检索,其中 36.5% 检索了个寂寞(无 promising 文档)。
- 预测分是同一个 LLM 自己打的「假设性证据分」,Spearman ρ=+0.86 看着很美——但仍有 20% 预测会赢的检索实际更差。相关性高不等于决策安全,阈值得另设。
- 成本第一次有了账:11 个 SOTA run 均价 $45.56;Denoising 任务 $38.45 vs SimpleTES 的 $265.39,6.9 倍便宜。双层循环不是白加的——内层查询在替外层省钱。
- NDG 越低帮助越大(r=-0.41):专治垫底,锦上添花另说。
- 隐忧一条:joint 层面 88.1% 的 URL 重复,50 迭代后停滞——找料的宇航服上,已经能看到反复使用的划痕。