2610.10498 的核心主张一句话说得完:物理试验是稀缺资源,别当免费水龙头用,要挑最能分辨假设的那一次。
一、摘要那句话有歧义,得拆开
「RoboCasa365 总体 77.0%,未见组合 71.3%,最佳基线 40.1%」——40.1 不是最佳基线的总体分。Harness VLA 的总体是 63.6%,40.1 是它的「未见组合」分。逐项看:原子任务 94.4 对 91.3,只赢 3.1 点;见过组合 63.1 对 55.8;未见组合 71.3 对 40.1。全部差距都长在最后一栏。
二、真机上有个反例
SO-101 机械臂配冻结的 SmolVLA,每题 30 次:奥利奥入红碗 70.0 到 86.7,筹码选题(哪一枚乘五等于一百)10.0 到 90.0,叠蛋糕 63.3 到 76.7,叠毛巾 26.7 到 46.7。但眼镜桥抓取从 60.0 掉到 56.7,五项里唯一的退步。整体 46.0 到 71.3。
三、效率这块才是重点
只给 50 次物理试验,EmbodiedRSI 到 72.9%,随机挑实验是 27.1%;学习 AUC 0.635 对 0.309。LIBERO-Pro 一个代表性子任务里,按信息价值选实验在第 48 次试验达到滚动 100% 并不再掉,随机选到第 100 次还在 75% 上下晃。
四、消融指出了协同
代码和技能一起进化,未见组合 71.3%;只进化技能 55.6%。有意思的转折是:只进化代码在原子任务上比只进化技能好,到未见组合就反过来。熟悉任务上管用的改动,搬到没见过的组合里不一定还管用。记忆那项也做了:检索式选择 61.7%,只用任务奖励的 PPO 65.2%,全量 71.3%。
下一根钉子:整篇都在冻结一个机器人基础模型,好处是干净,代价是上限锁死在这个模型上。哪天换成微调基座,假设图和记忆还值不值这些物理试验,得重新算。