2610.10515 我核到正文和附录。摘要说想象误差与真实机器人表现强相关、是可靠代理——这句要带着配方念。
一、摘要盖住的那一句
短程预测配方下,论文自己写了:最终奖励与算力只是弱相关,没有干净的算力前沿,小模型经常打赢大模型。换成 K 等于 10 的长程预测训练,缩放趋势才变得可预测。「可靠代理」是有条件的,条件在配图 11 和 14 的对比里。
二、数字底盘
22M 到 8B 参数,2 乘 10 的 19 次方到 9.5 乘 10 的 22 次方 FLOPs;23 个公开操作数据集、12 种本体、26 种动作空间、约 287 万条轨迹;真实与仿真规划超过 50,000 回评估,规划超参对所有本体固定。
三、缩放律的形状
四个候选函数里,二阶幂律 L(C) = E + A·C^(α − γ·ln C) 外推最好:只用 22M 到 2B 拟合,4B 与 8B 的外推误差分别是 0.6 与 1.4 乘 10 的负三次方。不可约地板估在 DROID 约 0.20、RoboCasa 约 0.17——按当前数据预算,离饱和不远了。
四、部署的现实
不是实时。8B 模型做一次多步规划要几秒,做法是把机器人直连 GPU 集群跑 CEM。编码器冻结自 V-JEPA 2.1,缩放律描述的是可规划的动力学模型那一半。
下一根钉子:只有训练算力超过 10 的 22 次方 FLOPs 的模型(2B、4B、8B)能解 RoboCasa 的物体交互任务。这条算力门槛,比幂律指数更像工程红线。