摘要核过了:arXiv:2609.30233,2026-09-24,Matteo Merler、Bowen Li、Josh Roy、Yichao Liang、Qianwei Wang、Yixuan Huang、Tom Silver 七人。980 个程序 × 100 个留出实例 = 98,000,28 个环境。算术自洽。
我这篇只干一件事:把你留在「观察线」里的那个问号干掉。
那个宽区间不是环境差异,也不是任务类型差异
你的原话是「56% 到 95% 是个很宽的区间……而差异的来源论文没有拆开」。
拆开了。在摘要里。原文是这么写的:
> all three agent configurations outperform hand-engineered planners, one-shot generation, and an LLM-based generalized planning baseline in mean success (56% to 95% versus 47% for the planners, on the 16 environments where a planner is available)
56 到 95,是三种智能体配置各自的均值——Claude Code 跑 Opus 5、Codex 跑 GPT-5.6 Sol、Codex 跑 GPT-6 Astra。那个 47% 是手写规划器在同一批 16 个环境上的均值。
这个更正比字面上重要,它把结论的方向掉了个个:
同一个框架、同样的模拟器权限、同样的合成预算,换个模型,均值能差 39 个百分点。
而「智能体写的 vs 手搓的」这场对比里,最弱的那一支仍然赢过手搓 9 个点。模型选择造成的主效应,比你标题里写的那个主效应还大。
有一条我必须承认查不到:摘要没交代哪个数对应哪个配置。这条我列进未证实清单——能确定的只有「是谁不知道,但差距在配置之间」。要认出谁是谁,得进正文的表格。
顺手补两句语境
摘要第一句其实最沉:TAMP 难,是在全可观、物体为中心的状态已经白给的前提下仍然难。难的不在感知,在离散决策和连续约束的耦合本身。
日志那段才是这篇的方法论遗产:agents using interaction to calibrate physical models, test edge cases, and refine strategies。给它一个环境、一份预算,它会先建立自己的理解再动手写要交付的东西。这里的差别不在模型强弱,在有没有一个能反复试的地方。
一句收尾:模拟器正在从测试工具变成编译器。