是什么让伟大的科学家伟大? AI 已经在一些开放问题上开始出成绩了,但科学家还有一项本事稳稳压着它:看一眼新问题,就知道仓库里哪一篇旧文章能派上用场。
这篇论文想量的,正是这项本事。
拿作者自己当标尺
做法很聪明:谁最清楚「哪篇早期工作推进了这个项目」?就是这个项目的作者本人。于是他们搭了一条自动化标注流水线,请 184 位作者为自己参与的 207 篇近期计算机论文打标——哪些候选论文确实推进了项目、哪些本来可以推进,每条都要附上理由。最终形成 894 条查询(207 条核心问题 + 687 条方向性问题),检索语料 190,896 篇。
最狠的一道约束是时间:检索只允许用「该项目启动时已经存在」的文献。也就是说,不许作弊去看未来的答案——这正是真人研究员在开局时面对的局面。
结果有点扎心。智能体检索打不过老老实实的嵌入检索:工具调用型 agent 加权后 Recall@20 是 0.42,而嵌入检索是 0.48。更扎心的是,即使换上训练时可能已经见过这些论文的 Claude Fable 5.1,智能体也只到 0.51。
还有一个数字值得单独拎出来:最强的通用嵌入模型,核心问题的 Recall@20 只能覆盖 39%;那些专门为科学文献打造的检索器(SPECTER2、OpenScholar),反而落后通用模型至少 16 个点。
作者自己的收尾是:这说明需要新的训练配方,让模型长出在大规模语料里检索的「专家直觉」。
四处要抠的数字
第一处是硬错。帖子的中文摘要写「184 篇论文的 184 位主要作者」。论文英文摘要与正文两处都写的是「184 lead authors of 207 recent computer science papers」「207 projects from 184 researchers」。正确口径是 184 位作者、207 篇论文,帖子把 207 压成了 184。
第二处,「0.42 对 0.48」在正文里查不到单个格子。论文的表 3 是分栏报的:GPT-4.1 工具调用 agent 是核心 0.37、方向 0.43;Qwen3-Emb-8B 是核心 0.37、方向 0.51。0.42 与 0.48 是按 207 与 687 的查询数加权合并后的数——标题式的聚合口径,读者从表里对不上号。
第三处,「将同一检索器作为工具调用」这句不准。agent 实际调用的搜索工具是 Gemini Embedding 2,加权 0.44;而标题里那个 0.48 用的是 Qwen3-Emb-8B——不是同一个检索器。结论方向不受影响(0.42 也低于 0.44),但句子本身混了口径。
第四处,「Fable 5.1 也只有 0.51」是选择性取数。同一张表里,Fable 5.1 配深度研究型 agent 是 0.53,配 grep 型 agent 是 0.52,0.51 是三种设计里最低的那个。而且这一行的作者切分日期写着 2026 年 6 月,论文标注它「可能训练时见过已完成的论文」,因此排除在主结论之外。
还有三层天花板
工具预算根本不齐平。工具调用 agent 限 5 轮、候选池最多 60;深度研究型最多 20 次搜索 + 10 次阅读、池子 150;grep 型 20 轮、4000 字符截断。三者的成本最多差到约 8 倍。所以「agent 不优于嵌入」这个结论成立,但把它外推成「智能体范式在检索上没用」,就越界了——这不是一场等预算的公平赛。
评测纯度也不齐。附录里写着,agent 返回的候选不足 k 篇时,会用「见过但未排名的论文 + 原始检索器」回填补到 100。grep 型 agent 在 894 条查询里有 440 条触发了回填。不同 agent 的分数含金量不一致,不宜直接横比。
标注的一致性证据非常薄。唯一的一致性证据是局限一节里提到的「一篇文章、三位标注者」小样本,恢复一作标签的比例在 43% 到 60% 之间。流水线自动提名关键灵感论文的精确率是 58.2%、召回 26.0%。另外,标注是作者事后回看做出来的,天然带后见偏差;论文也承认,这条任务当前的「性能天花板」是多少,仍是未知数。
语料只有 19 万篇,真实 arXiv 是三百万量级。作者自己说得很清楚:他们搭的这个检索环境,是研究者真实处境的简化版。
满仓论文,摸不到那根针——这篇论文的价值不在它找到了针,而在它把「摸不到」量化成了一个可以复现的数字。