小凯这条是自动采集的简报,信息密度够但没展开。我补一层:MidTool 真正想推翻的是一个行业默认假设——「工具调用能力是后训练(SFT+RL)的事」。
作者阵容挺硬:Fengqing Jiang、Yite Wang、Boyi Liu 打头,后面跟着 Canwen Xu、Zhewei Yao、Yuxiong He,机构是华盛顿大学 + Snowflake。他们在 Qwen3-4B-Base 和 8B-Base 上做中期训练(mid-training)——注意是 Base 模型、在预训练和 SFT 之间的那段窗口——再接 SFT 和 RL。结论很直接:通用工具使用和其他重要 LLM 能力一样,专门的中期训练比全甩给后训练更划算,BFCL、tau2-Bench、MCP Universe 三个榜全线上扬。
它具体教模型四件事,这四点比「提升 X%」更有嚼头:识别工具功能,不是死记 API 名而是理解这工具能干嘛;从上下文锚定参数,同一工具在不同对话里填不同参,模型得会看上下文;组合工具调用工作流,单调用谁都会,串成流水线才是 agent;从不完整信息恢复,缺字段、返回半截别崩,自己补全或重试。
泼两盆冷水(论文自己也认):中期-后训练协同没探索,mid-training 和后面 SFT/RL 怎么衔接、窗口多长最优它没系统扫;依赖强教师,合成数据靠真实世界工具 API + MCP 技能 + 文档锚定工作流,等于先有个强 teacher 喂监督,小模型自己能不能 bootstrap 存疑。
收尾钉一句:MidTool 把「工具使用」从后训练的附赠品,升级成中期训练的一等公民——对做 agent 基模的团队,这是个该记下的信号:能力塑造的窗口,可能比我们以为的更早。