九万八千次试跑:写代码的智能体,把手搓的机器人规划器比了下去

一个熟练的机器人工程师,为一类任务手写一个能用的任务与运动规划器,工期以月计。2026 年 9 月 24 日挂上 arXiv 的一篇论文(arXiv:2609.30233)把这件事换了个做法:给编码智能体一段任务描述、一个模拟器、一份固定的合成预算,让它自己写程序;写完冻结,丢到 100 个从没见过的实例上去跑。

九万八千次试跑:写代码的智能体,把手搓的机器人规划器比了下去

先看这个数量级

一个熟练的机器人工程师,为一类任务手写一个能用的任务与运动规划器,工期以月计。2026 年 9 月 24 日挂上 arXiv 的一篇论文(arXiv:2609.30233)把这件事换了个做法:给编码智能体一段任务描述、一个模拟器、一份固定的合成预算,让它自己写程序;写完冻结,丢到 100 个从没见过的实例上去跑。

28 个环境、980 个生成的程序、每个程序 100 个留出实例,合计 98000 次评估。【直引,论文摘要与正文设置】

这个数字是全篇最硬的部分。它不是一次演示,是一次普查。

TAMP 难在哪

TAMP 是 task and motion planning 的缩写,要同时解决两件事:离散层面的任务决策(先拿 A 还是先拿 B),和连续层面的几何、运动学、动力学约束(手怎么进去、会不会撞)。这两层是咬在一起的,拖开任何一层单独算都不成立。

通用化 TAMP(generalized TAMP)想走一条巧路:同一类问题的不同实例之间有规律性,把规律性抓出来,新实例就不用从头规划。这条路走得通,代价是需要大量 TAMP 专属的工程投入,每个环境都要有人去设计抽象、写领域知识、调接口。

论文问的就是这一句:这部分工程,能不能交给写代码的智能体。

实验怎么搭的

三种配置都上:Claude Code 跑 Opus 5,Codex 跑 GPT-5.6 Sol 和 GPT-6 Astra。环境来自 KinDER 与 PDDLStream 两套仿真体系,物体数量推到原基准没测过的规模。

关键设计在「冻结」这一步。智能体在合成阶段可以随便跟模拟器交互,程序一旦定稿就不再改动,之后面对的是全新的实例。这挡住了边跑边调的作弊空间。

结果:56% 到 95%,对面是 47%

在有现成手写规划器可比的 16 个环境里,智能体写的程序平均成功率落在 56% 到 95% 之间,手写规划器是 47%。

两个基线也被压在下面:一次性生成(不给交互机会)和一条基于 LLM 的通用规划基线。

还有一处比成功率高低更值得看的:物体数量往上推的时候,智能体写的程序成功率掉得比规划器慢,每个实例的平均计算量还低一个数量级。这说明智能体抓到的不是某个具体实例的答案,是那类问题的结构。【推论】

日志里,它在干什么

论文把智能体的交互日志放了出来,行为模式跟一个靠谱工程师很像:先用模拟器戳几下校准物理模型,再拿边界情况试自己的假设,发现不对就改策略,最后才定稿。

这一段是整篇论文的枢纽。一次性生成和智能体的差别不在模型强弱,在有没有一个能反复试的环境。给它一个环境、一份预算,它会先建立自己的理解再动手写要交付的东西。【判断】

同一周,另外两个方向相近的动作

RAPID(arXiv:2609.30249)从一段人类视觉演示里反推出三样东西:可测试的任务规格、动作原语、可交互的执行环境,然后让编码智能体反复生成、验证、修订。作者名单里有 Leslie Pack Kaelbling 和 Tomás Lozano-Pérez。程序用物体中心的关系表示,物体位姿、形状、材质变了还能用。真实 Franka 机械臂上测了 8 个非抓取的富接触任务。【直引,论文摘要】

World Action Agent(arXiv:2609.29964)在 LIBERO-Pro 上拿到 75.6% 平均成功率,超过端到端 VLA、代码即策略的智能体,以及同骨干搭的视觉 harness 基线。它的做法是让通用 VLM 的每个动作先变成一份可编辑的提案,执行前先演练、先纠错。交互轨迹还能拿去训小模型:Qwen3.5-9B 微调后,分布外成功率从 1.7% 涨到 43.3%。【直引,论文摘要与资讯聚合】

三条摆在一起,形状是清楚的:模拟器或可交互环境正在变成机器人程序的编译器。

值不值得当真

三条边界得说在前面。

第一,56% 到 95% 是个很宽的区间,论文给的是均值层面的比较,不是每个环境都碾压。这种宽区间通常意味着环境之间有系统性差异,而差异的来源论文没有拆开。

第二,全部在仿真里。KinDER 和 PDDLStream 的物体动力学是理想化的,真实机器人上的接触、摩擦、感知噪声没进这套评估。

第三,代码和完整 prompt 都放出来了,这是加分项,也是这篇论文能被复核的前提。【判断】作者是 Matteo Merler、Bowen Li、Josh Roy、Yichao Liang、Qianwei Wang、Yixuan Huang、Tom Silver。

为什么这条比数字本身重要

机器人领域贵的东西,从来不是那台机器。是一个具体任务和一份能跑的规划之间,那几个月的定制工程。这篇论文把这段工程压缩成了一次有预算的程序合成。

如果这条路走得通,规划器就从要造的东西变成能生成的东西。这个转变一旦成立,机器人落地的成本结构会跟着变。【判断】

观察线

  • 真实机器人上的复现:RAPID 已经在 Franka 上做了,TAMP 这篇还没。
  • 区间宽度的来源:56% 到 95% 之间,是环境差异还是任务类型差异。
  • 预算的敏感度:合成预算砍半,成功率掉多少,论文给的是固定预算下的结果。
  • 跨体系迁移:KinDER 与 PDDLStream 之外的环境,智能体还能不能自己摸出结构。

参考来源

1. Matteo Merler, Bowen Li, Josh Roy, Yichao Liang, Qianwei Wang, Yixuan Huang, Tom Silver, Coding Agents for Generalized Task and Motion Planning Problems, arXiv:2609.30233, 2026-09-24 2. Yuyao Liu, Jiayuan Mao, David Hsu, Leslie Pack Kaelbling, Tomás Lozano-Pérez, RAPID: Robot Agentic Programming from Demonstrations, arXiv:2609.30249 3. Yehang Zhang et al., World Action Agent, arXiv:2609.29964 4. FutureX Physical AI Daily Issue 131, 2026-09-26

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens