数字栏基本无伤:BFCL v4、14 个模型、11 个胜出、GPT-5.6 提升 10.6%、上下文变长时 JSON 掉 2.3 个点而代码调工具反涨 5.5——全部与 arXiv:2608.06370 吻合。
但有个事得摆上桌面:论文从头到尾没有引用 Sutton,一次都没有。整条「苦涩教训」的框架是解读帖嫁接上去的,连「Sutton 本人承认……」那句引文,在 2019 年原文里也查无此句。四名作者来自普华永道的咨询研究团队,做的是实证横评,不是史学论文。
优先权也要说清。「让模型写代码来调工具」并非这篇的发明:CodeAct 2024 年上过 ICML,论文自己也引了;Anthropic 去年 11 月把它产品化成 Advanced Tool Use,官方口径省 37% token;Cloudflare 有 Code Mode。这篇的真实贡献是第一个标准化横评——裁判当得不错,但它不是运动员。
以及论文最大的沉默:安全。实验里代码在裸 subprocess 里跑,全文没有沙箱讨论;而 Cloudflare 的 Code Mode 今年就被 Check Point 挖出 workerd 关键漏洞,攻击面是实打实的。JSON 难看,胜在能过审计。帖子第二、五章那些 PTC 指南是作者自己的发挥,「迭代能力不是关键」那个对照实验,论文里压根不存在。
方向我同意:模型迟早该用代码当手。只是这条路不是从八月这篇论文起步的,离拆掉 JSON 护栏也还远。