[论文] MidTool: Mid-training Data Synthesis for Agentic Tool Use

研究领域: ML 作者: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang 发布时间: 2026-08-22 arXiv: 2608.20314

论文概要

研究领域: ML 作者: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang 发布时间: 2026-08-22 arXiv: 2608.20314

中文摘要

中间训练(mid-training)increasingly被认为是塑造大语言模型能力的关键阶段。近期工作表明针对性的中间训练可以增强推理密集型能力,也可以改善软件工程环境中的智能体能力。本文研究并行但较少被探索的智能体能力:通用工具使用。提出MidTool,一个用于智能体工具使用中间训练的开放语料构建流程,结合大规模网络、PDF和代码数据与来自真实世界工具API、MCP技能和文档锚定工作流的合成监督。MidTool旨在教授模型识别工具功能、从上下文锚定参数、组合工具调用工作流和从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中间训练,然后应用SFT和RL后续训练。与基线相比,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上持续改善下游性能。结果表明通用工具使用与其他重要LLM能力一样,受益于专门的中间训练而非完全留给后训练。


*自动采集于 2026-08-22*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

原帖把 MidTool 的核心机制讲透了,但有几条工程化细节藏得深——

第一条,20.3B token 不是拍脑袋的数字。 拆开看:网页 8.5B(源 4.4 + 增强 4.1)、代码 5.3B(3.8 + 1.5)、PDF 4.7B(2.6 + 2.1)、原生 agentic 轨迹 1.8B。Fengqing Jiang / Yite Wang / Boyi Liu 这篇把"网页 + PDF + 代码 + 工具产物"四源拼接而不是单一来源,本质是把工具使用当 NLP 看、当代码看、当文档看,三路并进。

第二条,4B 模型的整体收益其实比 8B 还大。 BFCLv3 上 4B 的 overall 39.73% → 50.25%(+10.5),加 RL 后 54.18%;8B 是 47.62% → 51.12%(+3.5)→ +RL 55.12%。换句话说,"小模型 + 中间训练"比"大模型基线"的提升幅度高 3 倍。这对边缘部署(端侧 4B)是个关键数字——你不用卷大模型也能拿到 agentic 能力。

第三条,两条合成分支缺一不可的实验很有意思。 单加"上下文锚定增强"在 MCP-Universe 上甚至低于"无中间训练"基线;单加"原生 agentic 轨迹"也是;只有完整混合在 8 项指标上全部优于无中间训练。也就是说,多条数据线路单独喂会让模型过拟合到那一类任务的格式。 通用工具先验必须靠"多源拼接"才稳定。

第四条,MCP-Universe 的 Web Search 子集始终是 0.00——这是这条线的天花板信号。 "深度搜索"需要长程证据收集 + 迭代精化 + 强 agent 控制流,超出了"通用工具先验"的覆盖。Washington + Snowflake + UNC Chapel Hill 这篇老老实实画了这条边界,反而给"工具使用 agentic 中间训练"画了一张比单一基准更诚实的地图。

下一根最该盯的钉子: MidTool 这条管线最大的隐忧是"教师依赖"。两条合成都靠 GPT-5 / 5.1 / 5.2 当评委和轨迹生成器。如果未来一年开源 agentic 模型强到能自己合中间训练数据,"教师依赖"消失,这条范式就真正自洽了;否则它永远是被商业模型牵着走。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens