静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-13 20:03

先把结论摆前面:这篇的骨架我核过了,站得住。下面按轻重排几条偏差。

一、日期有三个版本,原帖那个我核不到

论文 arXiv:2609.05588,9 月 4 日提交,署名 AgiBot Research Team 加 44 位作者。智元官网的英文稿写 9 月 10 日、上海。中文媒体那版写 9 月 9 日发布。原帖写的「2026 年 9 月 11 日开源」,我在哪个一手出处里都没找到。论文 9 月 4 日就挂出来了,差着整整一周。

二、「CoAE 理解力不降反升」只对了一半

升的那半是指令—画面匹配:97.95%,五种对照表征里最高,错误率 2.05%,比次优的 DC-AE 低 24%。降的那半原帖没说:CoAE 的动作反推 MAE 比 DINOv3、V-JEPA 2.1 差 13%–31%。

这不算挑刺。这就是这笔交易的标价:用十六分之一的 token 数,换 13%–31% 的动作精度折价。对要进实时控制回路的模块划算;对吃精细接触力的任务,这个折价得重新估一遍。

三、别把「单次前推」读成全链路单步

「单步」在论文里只指视觉未来的生成。动作侧仍是 5 步 Euler 积分,执行稠密动作块的前 30 个动作后重新预测。动作窗口 52 帧,30 Hz 下覆盖约 1.73 秒。整条链路不是一次前推跑完的。

四、22.5% → 37.5% 那张表,论文自己贴了限制

KASO 消融的样本量:四物体抓取每目标 10 次,单物体 25 次。论文原话是这张表不该被当作最终性能解读。消融里还有一列更有意思——指令跟随率 KASO 和 E2E+PT 打平,都是 95%。增益全部落在「已经选对目标之后能不能抓到」这一段:单物体抓取 12% → 40%。所以 KASO 治的不是理解,是手。

五、三层数据不能相加

3.9 万小时「指令—视频」、3.2 万小时机器人轨迹、3 万小时联合训练。论文明确写了三个阶段存在数据重用,不能相加理解为互不重复的总量。原帖把三个数并排罗列,读起来像 10 万小时。真实去重之后是多少,论文没给。

六、同批评测里还有一张表是落后的

原帖说 RoboTwin 陌生环境 60.52%、GenieSim 0.770,超过 π0.5 和 GR00T N1.7,这句对。同一批里的 LIBERO-Plus,GE-Act 2.0 是 80.4%,低于 π0.5 的 84.4%。

补几个原帖漏掉的数

模型规模:SVP 的 DiT 2.51B(36 块,宽 2048),IDM 0.56B(28 块,宽 1152),理解模块是冻结的 Qwen3.5-2B。原帖写「未公开参数」,论文里有。

技能覆盖的相关性:Pearson r = 0.80,Spearman ρ = 0.85,大约每十倍数据提升 1.94 个 logit。原帖说的「对数线性相关」,把系数补上更硬。Wipe 拿到 824.1 小时、76.7%;Sweep 只有 64.6 小时、3.3%。有些技能难,难在数据长尾没盖到它,跟动作本身没关系。

还有一句得说明白:44.1% 是 100 项任务、每项 10 次试验的经验成功率。G2-90D 的 100 条轨迹里,有 22 条是下降的。

顺带一句宇树

9 月 10 日那版 UnifoLM-WLA-1.0,项目页上线了,Code / Models / Datasets 三栏当时挂的还是 Coming soon。真机数据约 2500 小时。跟智元这边 3 万小时的联合训练规模摆在一起,两家的公开口径根本不在一个量级——一家先把权重给出去,一家先把曲线画出来。

下一根钉子

论文自己指了方向:第一视角人类视频目前只用了 3000 小时,不到 SVP 语料的 8%。下一个十倍的原料几乎还没动。

我更想盯的是 G2-90D 上那 6 个数据不足 2 小时的技能组,现在有 5 个从 0% 变成了非零。这种「蹭别人数据学会自己那手活」的迁移,能不能复制到第三种、第四种本体上。能,具身数据就不再是各家自攒的家底;不能,这仍然只是一条单本体的曲线。

3 万小时,换算过来是 3.4 年,一个人不吃不喝不睡连轴转。换来的,是 100 项陌生任务里 44 项能做成。

暂无表态