Agent 连上了数据库,还在一遍遍找表——EvoOntology 对账:会长大的地图,和被弄丢的门槛

先看一个场景。你给 Agent 接上数据库、Excel、PDF,还有一堆 API。理论上它什么都能查。真跑起来呢。找表,猜字段,写一条 SQL,看结果不对,再猜。下一个任务来了,从头再来。

Agent 连上了数据库,还在一遍遍找表——EvoOntology 对账:会长大的地图,和被弄丢的门槛

先看一个场景。你给 Agent 接上数据库、Excel、PDF,还有一堆 API。理论上它什么都能查。真跑起来呢。找表,猜字段,写一条 SQL,看结果不对,再猜。下一个任务来了,从头再来。

Token 账单就长这样。大部分花费不在解决问题,在重新认识数据。今天认识一遍,明天再认识一遍。

人民大学团队给这个病起了名字:agent–data gap。数据住在模型外面,模型只能隔着几个通用工具去摸。结构什么样,内容什么样,事先都不知道。他们还点了一个别人少提的死穴:semantic layer 这东西早就有了,但靠人手工维护,而且和下游脱节。没人说得清,哪条语义记录影响了哪个决策。

他们的药方不是更多提示词,也不是更厚的记忆。是在 Agent 和数据之间放一张地图。一张会自己长大的地图。

两条旧路的下场

一条路是把 semantic layer 塞进 prompt。说明书直接怼在脸上。结果大面积掉分,Claude-Sonnet-5 上掉了 15 分。论文自己的解释很直白:说明书跟现场任务抢注意力,还不能按页撕。你要第三页,它给你整本。

另一条是记忆。把历史轨迹存起来,检索最像的几段,注入 prompt。+6.3 分。有效,但天花板摆在那。回放给你的是「上次怎么走的」,不是「这地方长什么样」。问题换个问法,旧经验就接不上。

然后是 EvoOntology:+20 分。DDR-Bench 上从 69.5 到 89.5,四个 backbone 平均。

地图长什么样

这个本体不是文档,是个 MCP 服务。Agent 需要的时候自己来查。三层。Schema 层管「什么能画上图」,Content 层是图本身,Tool 层管「怎么翻图」。图上是四类节点:概念、映射、约束、证据。

一条纪律贯穿始终:没证据不上图。每条记录都要对着真实数据验过才落笔,不编。

地图怎么长大?四步。跑完任务,先诊断失败在哪。归因到具体的地图缺陷,是哪一格画错了、画漏了。改一格。然后新旧地图比武,赢了才转正。

消融实验里最值钱的梁是门控本身。拆掉它,掉 11.2 分。归因是第二根,拆掉掉 6.3。论文的总结只有一句:这套循环,selective 胜过 iterative。挑着改,好过勤快地改。

最漂亮的一张账

裸 Agent带初始图带进化后的图
每轮输入 token3.2K4.1K4.6K
平均轮数14.611.28.4
每任务总 token52.6K50.4K42.0K
轨迹准确率69.581.889.5
每轮输入涨了四成多,轮数少了四成多,总账省 20%,准确率涨 20 分。

每轮多看一点,总共少看。因为一上路就认得路,不用绕。不过说实话,这是半张账单。建图的成本、进化的成本,表里没有。

到海关了

以上都是论文说的话。下面是我核对的。

论文全文逐表回读,arXiv HTML 版五万七千字符。仓库 264 个文件通读一遍。结论十二个字:方向对,工程实,证据虚,溯源缺。四句并列,互不抵消。逐条说。

先说最硬的一条。论文公式 (2) 白纸黑字:新图比旧图好,且好过门槛 τ,才转正。代码呢。evaluation.py 第 34 行:

"accept": candidate_avg > parent_avg

高 0.01 分也算赢。τ 不在。全仓检索 margin,零命中。

这不是小事。README 特性表写着「a reproducible improvement」,可复现的改进。单次比较给不出可复现。聪明模型赌一次赢半分,和抛硬币多出一次正面,没有本质区别。作者自己知道。评估协议文档直说,第一版不叠加多采样。skill 提示词里嘱咐了一句「验证集小就再跑一遍」。注意,嘱咐是软的,门控代码里没有。

论文里「进化再涨 7.7」这类数字,就是在这种裸比较下攒出来的。

再说统计。论文没有 p 值,没有样本量,没有置信区间。+20 的主增益大概率是真的,差这么大,怎么算都显著。但把 +0.2 的增益说成 essential,在没报任务数的情况下,谁也没法复核。我把任务数假设成一百做了反算,+7.7 悬在显著边缘,BIRD 上进化那 +3.7 更悬。这是敏感度测试,不是判死刑。论文不报数,谁也没法算真账。

然后是四还是六。摘要说四个 backbone,实验节说六个。Table 1 六个都跑了,平均 +17.8。到消融和分析,只剩四个。恰好是最强的四个。恰好去掉了最弱的两个,DeepSeek-V4-Flash 基线 30.3,Qwen3.5-Flash 基线 14.3。弱模型拉低平均,去掉之后四强平均从 +17.8 变 +20.0。这个更换论文一个字没解释。白送 2.18 分。

最后是师承。仓库文档六处写着「借鉴了 SkillOpt 的方法论」。SkillOpt 是微软五月开源的项目,一万七千星。思路一句话:把 skill 文档当成可训练状态,轮次预算当学习率,验证集当考试,改完必须赢过旧版才转正,不碰权重。EvoOntology 把这套搬到了本体层。组件映射很工整:EnvAdapter 对 EvolutionAdapter,rollout 对 run_agent,initial.md 对 evo-build。

论文正文对 SkillOpt 的引用:零。

这不是抄袭。把「训练 skill 文档」迁移成「进化本体图」是真工作。但引用欠着。

两个被低估的结论

骂完了,说两个比标题更值钱的发现。

第一,杠杆不在图画多细,在怎么翻图。只进化 Tool 层,+13.2。只进化 Content 层,+8.7。只进化 Schema 层,+3.6。附录的归因统计里,Tool 层编辑贡献了累积增益的 57%,Schema 层只占 9%。翻译一下:图上画什么,次要。值钱的是翻图的动作,只翻你当前要的那一格。这和塞 prompt 掉 15 分是同一枚硬币的两面。同一本说明书,怼脸塞是负担,自己翻是杠杆。结构不免费,但可以选在哪个环节付。老读者认得这个形状:索引侧付一次,查询侧反复收。LightRAG 是这个账,ripwire 也是这个账。

第二,一个模型一张图。六张进化后的地图两两算重叠度,最高 0.62。GPT-5.5 长出来的图给 Sonnet-5 用,平均掉 6.6 到 10.9 分。没有通用本体,只有「某个模型用着顺手的本体」。图随模型走,成本随模型数线性涨。连长出来的东西都不一样:GPT-5.5 的图里多出的是短 SQL 片段库,Opus-4.8 的图里没有。每个司机不仅认不同的路,还按自己的习惯画不同的标记。

好评和处方

该给的好评要给。零第三方依赖。SQL 只发只读查询。没有伪造观察。不偷看 benchmark 题目。写入原子化。被拒的候选和已知局限写进了构建元数据。

想把这套搬回家的,四条。门控加 margin,哪怕 τ 就设 1 分。上成对检验,McNemar 或 bootstrap,几行代码。把「再跑一遍」从 skill 提示词写进门控代码。成本账补全,把建图和进化的开销摊进去。

τ 在论文里是个希腊字母,在代码里是个不存在的名字。补上它,是一行代码的事。什么时候补上了,这张地图长出来的每一寸,才不需要别人替它重新验证一遍。


原物:arXiv:2609.15779(2026-09-14 提交)· github.com/ruc-datalab/EvoOntology(MIT,407 星,末次提交 09-23) 对照:github.com/microsoft/SkillOpt(arXiv:2605.23904,2026-05 立项) 核查边界:未实跑;代码结论出自读码,文件与行号可复核;统计反算建立在假设任务数上,不作证伪之用。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens