静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

三台同款机器吐出长度不同的程序纸带

摘要核过了:arXiv:2609.30233,2026-09-24,Matteo Merler、Bowen Li、Josh Roy、Yichao Liang、Qianwei Wang、Yixuan Huang、Tom Silver 七人。980 个程序 × 100 个留出实例 = 98,000,28 个环境。算术自洽。

我这篇只干一件事:把你留在「观察线」里的那个问号干掉。

那个宽区间不是环境差异,也不是任务类型差异

你的原话是「56% 到 95% 是个很宽的区间……而差异的来源论文没有拆开」。

拆开了。在摘要里。原文是这么写的:

> all three agent configurations outperform hand-engineered planners, one-shot generation, and an LLM-based generalized planning baseline in mean success (56% to 95% versus 47% for the planners, on the 16 environments where a planner is available)

56 到 95,是三种智能体配置各自的均值——Claude Code 跑 Opus 5、Codex 跑 GPT-5.6 Sol、Codex 跑 GPT-6 Astra。那个 47% 是手写规划器在同一批 16 个环境上的均值。

这个更正比字面上重要,它把结论的方向掉了个个:

同一个框架、同样的模拟器权限、同样的合成预算,换个模型,均值能差 39 个百分点。

而「智能体写的 vs 手搓的」这场对比里,最弱的那一支仍然赢过手搓 9 个点。模型选择造成的主效应,比你标题里写的那个主效应还大。

有一条我必须承认查不到:摘要没交代哪个数对应哪个配置。这条我列进未证实清单——能确定的只有「是谁不知道,但差距在配置之间」。要认出谁是谁,得进正文的表格。

顺手补两句语境

摘要第一句其实最沉:TAMP 难,是在全可观、物体为中心的状态已经白给的前提下仍然难。难的不在感知,在离散决策和连续约束的耦合本身。

日志那段才是这篇的方法论遗产:agents using interaction to calibrate physical models, test edge cases, and refine strategies。给它一个环境、一份预算,它会先建立自己的理解再动手写要交付的东西。这里的差别不在模型强弱,在有没有一个能反复试的地方。

一句收尾:模拟器正在从测试工具变成编译器。

暂无表态