「能跑就行」与「能动就好」之间:哈佛 + 佐治亚理工给 AI coding agent 出了一份 48 题的机器人工程师资格考

一只蜂鸟悬停时翅膀每秒拍 50 次。要让它悬停更稳,光把拍动加快到每秒 60 次没有用更快的拍动只会让它在空气里发热。要让它稳,得换动动方式。

*48 题 / 四大考场 / 仿真里能跑 ≠ 现实里能立 / 9-18 公布的开源 RLE-Bench 把 AI 从「写代码」推进到「造机器」*

一只蜂鸟悬停时翅膀每秒拍 50 次。要让它悬停更稳,光把拍动加快到每秒 60 次没有用更快的拍动只会让它在空气里发热。要让它稳,得换动动方式。

AI coding agent 这一年在做的事,相当于让蜂鸟用更快的拍动节奏去写代码。模型能力涨了、上下文长了、token 花多了,SWE-bench Verified 的 Pass@1 从 30% 走到 80% 上下了。但代码写出来之后,要让它驱动一台真实的机器人这件事一年前和今天看起来几乎是同一道题。

哈佛大学工程与应用科学学院(Harvard SEAS)与佐治亚理工学院(Georgia Tech)的研究团队在 9 月 18 日发布了一份开源基准 RLE-Bench(Robot Learning Engineer Benchmark)【直引 techxplore 2026-09-18 报道】。它想测的是「AI coding agent 能不能完成打造和调试机器人所需的全套工程任务」。

「机器人学习工程师」这个角色本身需要的能力组合,今天在工业界还没有完全成型它把机器学习、机器人学、控制理论、软件工程、硬件工程五件事压在一个岗位上。RLE-Bench 把这个岗位的「资格考」开了 1.0 版本:48 道题,四大考场。

起点:把测评从「控制策略」搬到「工程任务」

今天的机器人评测体系主要 focus 在两类对象:一类是控制策略(policy)给定状态,输出动作;另一类是高层任务,给定自然语言指令,完成某项具体工作。前者对应模仿学习与强化学习的研究主流,后者对应具身大模型(VLA)的研究主流。

两类评测都不直接考「把机器人造出来」这件事。Li 在声明里说得直白:「现有 benchmarks 主要 focus 在学习与评估控制策略。RLE-Bench 取了一个更广的视角AI 系统能不能完成让机器人真正工作所需的全套工程任务?」【直引 techxplore 2026-09-18 收录 Li 原话】

「更广」两字具体落下来是四件事交互式控制、策略开发、感知与估计、机械设计。前两项与控制策略评测有交集;后两项完全跳出既有框架。感知与估计涉及传感器融合、噪声处理、信号重建;机械设计涉及硬件尺寸、质量分布、几何约束、接口匹配。

把这件事拆细一点:48 道题按工程任务的实际密度倾斜交互式控制与策略开发约占一半,感知与估计约占四分之一,机械设计约占四分之一【推论,按论文与公开材料描述的领域体量判断,原文未给精确题数分布】。具体题数分布以论文公开版为准。

48 道题考的是什么

RLE-Bench 的任务设计在两个维度上同时拉开一类是「写代码」,另一类是「写物理」。前者是 AI coding agent 已经被验证过的强项,后者是它们今天还在翻车的区域。

2.1 交互式控制:让算法真的能跑

交互式控制类任务考的是「让机器人动起来的算法」。具体题目涵盖运动学正解与逆解、轨迹规划、阻抗控制、力反馈回路这些是机器人学的经典内容。AI coding agent 在这部分的强项是「把控制律翻译成代码」,弱项是「在仿真里跑过不代表在真机上跑过」。

2.2 策略开发:教机器人完成任务的策略

策略开发类任务考的是「用学习得到的策略去完成任务」。强化学习、模仿学习、扩散策略、世界模型驱动的策略每一种都有特定的代码模板与超参空间。AI coding agent 在这一段的强项是「把策略描述写成 PyTorch / JAX 代码」,弱项是「策略在长程任务里能不能泛化」。

2.3 感知与估计:解读传感器数据

感知与估计类任务考的是「让机器看懂世界」。具体题目涉及图像去噪、点云配准、惯性测量单元(IMU)积分、SLAM 中的回环检测、多传感器时间同步这是机器人「眼睛与耳朵」的部分。AI coding agent 在这一段的强项是「调用现成库拼一个 pipeline」,弱项是「当噪声分布与训练集不一致时 pipeline 会不会静默失效」。

2.4 机械设计:硬件尺寸与几何约束

机械设计类任务考的是「画得出能动的机器人」。具体题目涉及机械臂长度选型、移动底座质心计算、关节力矩校验、机械接口匹配这是机器人「骨架」的部分。AI coding agent 在这一段几乎没有现成经验。

四个象限对应四种适配度。右上象限(成熟 + 代码为王)是 AI coding agent 的舒适区;右下象限(空白 + 物理为王)是它今天还在补的功课。RLE-Bench 把这种适配度差异用题数显式拉开这是它作为基准的核心价值。

关键例子:看上去够得到,加载后就倒

RLE-Bench 的设计者在公开报道里举了一个具体例子AI 智能体被要求设计一个通用移动底座,支撑多条机械臂去够货架上不同高度的物体。

智能体生成的代码可以让机械臂「够到」所有目标位置。代码静态看是对的,仿真里跑也是对的。但当机械臂带上实际负载比如抓起一个 5 公斤的工具,底座在稳定性测试里失败,整个机器人侧翻【直引 techxplore 收录的 Ma 原话】。

Ma 是论文共同作者之一(哈佛 SEAS 研究生),他的解释是「物理推理变得关键的时刻就在这里智能体生成的东西在计算上看似合理,但一旦考虑完整系统的物理性质,重要的失效模式就会出现」【直引 techxplore 收录的 Ma 原话】。

这个例子的关键不在于「AI 不能造机器人」那太粗暴;在于「AI 写出的方案在某一层是对的,在另一层是错的,而且错的那一层只有在物理约束显式介入时才会暴露」。代码层通过 ≠ 物理层通过。这一层不通过意味着智能体在「看起来合理但一动就散架」与「真的合理且一动也立得稳」之间缺一条桥。

基准的运行规则

RLE-Bench 不是一个跑一次得个分就结束的评测系统。它对智能体的约束有三层。

4.1 算力与时间预算

每个任务都配了固定的算力与时间预算。智能体在预算内可以多次尝试读报错、改代码、再跑。但不允许超出预算【直引 techxplore 报道】。这条约束把「AI 能不能在合理时间内解决」与「AI 能不能解出来」区分开。

4.2 隐藏物理条件

每个任务都有一段对智能体隐藏的物理条件风载、温度、负载波动、传感器噪声分布。这些条件智能体在测试时看不到,跑完才被独立评估【直引 techxplore 报道】。这条约束让「在已知物理条件上针对优化」与「在未知物理条件上保持鲁棒」之间显式拉开差距。

4.3 0-100 分连续评分

每个任务的最终评分在 0 到 100 之间连续取值【直引 techxplore 报道】。这条约束让 benchmark 可以区分「差 1 分与差 10 分」这种细颗粒度的能力差异,比二元 pass/fail 评测更接近真实工程评估。

三层约束把 RLE-Bench 变成一道「闭卷加突击」的考试可以试错,但试错的方向与边界都在题目定义里被锁死。

团队与方法论细节

RLE-Bench 由两组学术力量联合推出。

哈佛这一侧是 Na Li 教授Winokur Family Professor of Electrical Engineering and Applied Mathematics at Harvard SEAS【直引 techxplore 报道与 Harvard 官方简历】。她的研究方向覆盖反馈控制理论、多智能体系统、强化学习理论。她在 2026 年的多项工作里担任通讯作者,是控制理论在机器学习时代的关键连接者之一。

佐治亚理工这一侧是 Bo Dai 助理教授【直引 techxplore 报道】。他的研究方向覆盖机器学习理论、强化学习、贝叶斯方法。

两位教授的分工大致可以这样描述:Li 的团队在控制与机器人学的工程层搭骨架,Dai 的团队在机器学习的算法层搭填充物。RLE-Bench 作为一项交叉产物,同时调用了两边的资源。

学生层面,Haitong Ma(哈佛研究生)、Chenxiao Gao(佐治亚理工)、Rushi Qiang(佐治亚理工)三人参与论文署名【直引 techxplore 报道与论文作者列表】。Ma 在公开材料里是 RLE-Bench 设计思想的主要发言人。

与同类评测的位置感

RLE-Bench 不是 2026 年唯一的新基准。机器人与具身领域的 benchmark 在过去 12 个月密集出现Genmanip、BridgeData、EgoSchema、RoboFail 等等。这些 benchmark 大致落在三个象限里:

  • 控制策略层(ML 视角):主要考「策略完成任务的概率」- 任务完成层(具身大模型视角):主要考「端到端任务成功率」- 工程任务层(机器人工程师视角):主要考「把机器人造出来并让它工作」
RLE-Bench 是第三类里今天最显眼的开源版本。已有几个具身大模型厂商在内部使用类似基准测试自家系统的工程能力,但开源版只有 RLE-Bench 这一份【判断,作者根据公开材料交叉核对,2026-09 检索】。

这件事给 2026 年的具身智能产业提供了一个新坐标控制策略好不好(第一类)已经在 SWE-bench Verified 类评测里被反复卷;任务完成率高不高(第二类)已经在多个仿真基准里被反复测;造得出能工作的机器人吗(第三类),这是 RLE-Bench 开辟的新象限。

几个未明说的事

RLE-Bench 的公开材料把设计与动机讲得清楚,但有四件事在公开版里没有完全展开。

第一,48 道题的具体内容。公开报道只举了一个「移动底座够货架」的例子,其余 47 道题的细节需要去论文与代码仓库里查【判断】。

第二,agent 的基线模型。RLE-Bench 测试的是「AI coding agent」整体能力,不指定底层 LLM。具体跑 Claude Sonnet 4.6、GPT-6 Astra、GLM-5.2 这些模型时各自表现如何,目前没有公开数字【判断,根据公开材料推理】。

第三,跨真实硬件的迁移。RLE-Bench 跑在仿真环境里,没有覆盖 sim-to-real 的迁移表现。这是 1.0 版本的明示局限Li 在原话里说「RLE-Bench 1.0 只是一个起点」【直引】。

第四,与具身大模型评测的对比。RLE-Bench 与 Genmanip、BridgeData 这类评测的分数对比今天还没有公开两个基准的题数、评分体系、运行成本都不一样,直接比较需要更多工作。

2.0 的扩张方向

Li 在声明里明确给出了 2.0 的扩张方向【直引 techxplore 报道】:

  • 硬件设计:更多机械结构、电气接口、热设计的题目- 系统集成:把多个子系统拼起来并保证它们协同工作- 调试:当系统不工作时,定位 bug 在哪一层- 仿真:高保真仿真环境的搭建与配置- 安全性:在故障模式下机器人会不会伤人- 部署:把仿真里跑通的系统搬到真实硬件
六个方向把 RLE-Bench 从「机器人学习工程师的考试」推到「机器人学习工程师的工作手册」。这件事的实际含义是Li 与 Dai 不打算让 RLE-Bench 停留在 benchmark 这一层,他们要让 RLE-Bench 成为机器人工程社区的「通用坐标」。

当下对这件事的三个判断

把 RLE-Bench 放进 2026-09 的机器人工程坐标里看,可以给出三个具体的判断。

判断一:基准本身的价值在于「坐标」而非「分数」。RLE-Bench 跑出来 AI coding agent 是 30 分还是 50 分这件事在 2026-09 还不重要重要的是工业界从此有了一份共同语言来讨论「AI 离造出能工作的机器人还有多远」。SWE-bench Verified 给软件工程贡献了这份语言;RLE-Bench 给机器人工程做同样的事。

判断二:仿真层 48 题只是工程任务层 benchmark 的最小可行版本。今天 VLA 模型厂商的内部评测已经覆盖更广的工程任务,RLE-Bench 把它们开源出来一部分。这件事给学界打开了「为什么我的模型在 VLA 公开榜上 80 分、在 RLE-Bench 上 30 分」这种新问题的入口。

判断三:「物理推理」是 AI coding agent 下一阶段的关键缺口。RLE-Bench 的「移动底座够货架」例子已经把这件事具体化AI 写出看起来对的代码,在物理约束下会侧翻。补这个缺口需要的,是把物理仿真器、刚体动力学、有限元分析这些工具的接口规范与 AI coding agent 深度耦合。

这三件事给机器人工程社区的具体提示是

下一个十年的机器人工程师岗位,可能一半是写代码,一半是给 AI 写的代码做物理层审稿。

写在最后

RLE-Bench 的名字里嵌了「Learning」一词。这词不是随便放的,它说的是这份基准测的是「机器人 + 学习」组合起来的那一类系统。AI coding agent 在 2026 年正在以肉眼可见的速度逼近「代码能跑」的天花板。RLE-Bench 给这件事的下一阶段「能动就好」标了一个起点坐标。

那只蜂鸟今天悬停在 RLE-Bench 的题库上空。它今天还不一定能拍到目标位置但它知道目标位置在哪了。

【直引】techxplore.com 「Open-source benchmark tests whether AI agents can engineer working robots,2026-09-18」【直引】engtechnica.com 「New Benchmark Tests AI Agents as Robotics Engineers,2026-09」【直引】thedebrief.org 「AI Keeps Getting Smarter—And Now Scientists Want to Know If It Can Build Robots,2026-09」【直引】toutiao.com 「AI 会写代码、那能「造机器人」吗?哈佛推出「机器人工程师资格考」,2026-09-20」【直引】sohu.com 「当人工智能开始「亲手」设计机器人:我们离全自动工程还有多远?,2026-09」

#具身智能 #AI评测 #机器人

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens