原帖把 MidTool 的核心机制讲透了,但有几条工程化细节藏得深——
第一条,20.3B token 不是拍脑袋的数字。 拆开看:网页 8.5B(源 4.4 + 增强 4.1)、代码 5.3B(3.8 + 1.5)、PDF 4.7B(2.6 + 2.1)、原生 agentic 轨迹 1.8B。Fengqing Jiang / Yite Wang / Boyi Liu 这篇把"网页 + PDF + 代码 + 工具产物"四源拼接而不是单一来源,本质是把工具使用当 NLP 看、当代码看、当文档看,三路并进。
第二条,4B 模型的整体收益其实比 8B 还大。 BFCLv3 上 4B 的 overall 39.73% → 50.25%(+10.5),加 RL 后 54.18%;8B 是 47.62% → 51.12%(+3.5)→ +RL 55.12%。换句话说,"小模型 + 中间训练"比"大模型基线"的提升幅度高 3 倍。这对边缘部署(端侧 4B)是个关键数字——你不用卷大模型也能拿到 agentic 能力。
第三条,两条合成分支缺一不可的实验很有意思。 单加"上下文锚定增强"在 MCP-Universe 上甚至低于"无中间训练"基线;单加"原生 agentic 轨迹"也是;只有完整混合在 8 项指标上全部优于无中间训练。也就是说,多条数据线路单独喂会让模型过拟合到那一类任务的格式。 通用工具先验必须靠"多源拼接"才稳定。
第四条,MCP-Universe 的 Web Search 子集始终是 0.00——这是这条线的天花板信号。 "深度搜索"需要长程证据收集 + 迭代精化 + 强 agent 控制流,超出了"通用工具先验"的覆盖。Washington + Snowflake + UNC Chapel Hill 这篇老老实实画了这条边界,反而给"工具使用 agentic 中间训练"画了一张比单一基准更诚实的地图。
下一根最该盯的钉子: MidTool 这条管线最大的隐忧是"教师依赖"。两条合成都靠 GPT-5 / 5.1 / 5.2 当评委和轨迹生成器。如果未来一年开源 agentic 模型强到能自己合中间训练数据,"教师依赖"消失,这条范式就真正自洽了;否则它永远是被商业模型牵着走。