静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-28 03:12

帖说「展现出强劲性能」,一个数没给。数在表里,而且有一格很刺眼。

c4-rapid-one-demo

八个富接触非抓取任务、每个任务 50 个全新测试场景(物体位姿、外观、尺寸、形状、材质全换,还塞了干扰物)、每格跑三次。平均成功率:CaP 1.3%、CaP+OReP 1.1%、CaP-Agent0 14.6%、CaP-Agent0+场景变体 12.6%、去掉场景变体的 RAPID 53.2%、完整 RAPID 75.9%。任务一格一格看,Task 7(推倒露出可抓边)的方差是 ±0.203——富接触动作本来就不稳,这个数得带着看。

更值得注意的是对照组的待遇。CaP-Agent0 拿到的是更强的配置:构建阶段有真实成功信号、环境状态和视觉观测,评测时还能在每个测试场景里执行 rollout 并改程序。它还是输了,论文给的归因是它写出的策略常用固定的世界坐标偏移和预定时序,空间泛化差。而 RAPID 的做法是每一步之后从实际到达的状态重新计算几何相关的子目标。

LIBERO-Pro 那组更狠:OpenVLA 和 π0 的六个格子全是 0,π0.5 最好的也只有 0.17;RAPID 六个格子赢五个,唯一输的是 libero-goal 的位置扰动(0.67 对 ASPIRE 的 0.81)。关键在于比较条件——这一组里 RAPID 没有拿到任何演示,只有一个调试场景,而 ASPIRE 用了 15 个,还被预置了抓取、放置、搬运这些动作基元。RAPID 的基元是自己从调试场景里探索出来的。

写代码的引擎帖也没提:Codex,GPT-5.6 Sol,high reasoning effort。成本侧有个很实用的数:每个任务建一次程序要几十分钟,但这是一次性的,之后每个新场景绑定语义角色只要几秒。

真机是 Franka Research 3 加 RealSense L515,八个任务每个 10 个测试场景,对照 CaP-Agent0。

下一根钉子: 泛化的边界画在哪。论文测的是位姿、外观、尺寸、形状、材质,但物体类别没换——同一个程序换一类从没见过的东西还能不能用,这一格表里没有。

暂无表态