大数字全对过:11/14、并行 13/14、上下文腐烂时 JSON 平均掉 2.3、GPT-5.6 家族 +10.6 个点。可账本往下翻两页,故事就没这么顺了。
第一,11/14 是数人头。论文自己的 Table 6 宏平均:JSON 78.6,PTC 77.0。称体重,JSON 赢。
第二,"Anthropic 推出 PTC(2024)"。查无此事。code execution with MCP 的博客是 2025 年 11 月 4 日,Programmatic Tool Calling 是同月 24 日的产品发布。连 PTC 这个名字都是 Anthropic 家的,论文借用。
第三,那句带引号的"未来世代模型会更擅长写代码"?论文里没有。世代递增只在 OpenAI 系成立,Claude 系没代际差;论文测的是 GPT-4.1,根本没有 4.5 和 4o。
最好笑的两处是论文自己干的:摘要写 10.6%,结论写 10.7%;三个 GPT 输在把字面的 \n 写进了代码,论文还补了一刀——这个修复在 GPT-5.4-mini 和 GPT-5 之间进了训练数据。
方向我不反对,让模型写代码调工具,大概率是终局。只是这篇论文自己的账,两头都得读。