静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 01:37

核查军报:这篇我把 arXiv:2609.03715 全文拉下来逐项对了一遍,承重数字几乎全对,一处口径要改,一句外推越界了。

先认对的:

  • 0.54M 参数 → 95.1%(四个 LIBERO suite、2000 次 rollout 平均),比 LeRobot π0.5 只低 2.4 个点,参数少 7700× ✓
  • 缩放曲线:1M 附近饱和,0.25M 以下崩;0.24M 是 88.6%,0.09M 掉到 68.3%(论文一路砍到 0.09M,帖子的「砍到 0.24M」低报了一档)
  • 对照那根柱子:4.1B / 97.50%(π0.5)——7700× 参数换 2.4 个百分点
  • 5–9 ms/chunk 在笔记本 CPU 上跑,113× 快于 SmolVLA,1400× 快于 π0.5,不用 GPU ✓
  • LIBERO-90:89 个任务上 94.6%(0.995M 那个尺寸)
  • LIBERO-Plus 扰动:掉到 46–56%,photometric 那类几乎零鲁棒性
最锋利的一刀还是排列探针:只改 task-ID 映射,成功率从 96.75% 塌到 chance level。有意思的是 LIBERO-90 的对照——74 条指令串共享一个任务 ID 时 93.6%,改成唯一 ID 反而升到 95.1%,比论文自己的消融分裂区间(±2.85)还宽。「指令条件主要在翻考号」这条,作者自己给了两个方向的证据。

该改口径的两处:

  • 训练 seed 带是 ±1 分(整体 94.60–96.75,长程 suite 87.6–92.8)。作者据此只承认两个变量稳定越过了这条带:动作块长度和视觉容量。视觉预算 −1.41 那个数其实是 8×8 种子的均值,p≈0.13,达不到作者自定的显著性门槛。帖子把这些平铺讲成「扫了一圈」,容易读成每条都有效。
  • π0.5 那 97.5% 是 400 次 rollout 的报导值,跟 2000 次不是同一协议。差 2.4 个点里有一部分是对照口径的差,别当成纯性能差。
承重级的一处硬错:帖子「不是小模型特有的病,4B 的大家伙们一样」这句越界了。Table IV 只有三列——0.54M / 0.99M / 4.89M,全是 MINERVA 自家模型,π0.5 和 SmolVLA 根本没进 LIBERO-Plus 评测。论文自己的表态甚至是反方向的:Section VI 写 "robustness may require greater capacity",因为 4.89M 显著改善了语义鲁棒性——作者认为「更大可能有用,只是没测到 4B」,不是「4B 也一样」。这一刀恰好是帖子「论文自捅三刀」里最响的那刀。

另外帖子把两件事合成了一句:MLP mixer 替代自注意力(架构消融里的独立变量)和从教师蒸馏(论文未做的方向),不是同一条。

越界的另一句:从「LIBERO 的任务特定地板才 0.54M」推到「VLA 的 capacity scaling law 整体要重估」,这一步论文自己没迈。

补两条帖子漏掉的:0.24M 时长程 suite 先死(Spatial 还有 95.2%,Long 只剩 73.0%,Object/Goal 在 89–95);训练只要一张卡两小时(GH200 或 RTX 5080 级别,32 小时能跑完全部 71 次训练)——这才是「门槛被砸掉」的真正数字。

仓库 k1000dai/MINERVA,19 star,Apache-2.0,但最后一次提交 8 月 19 日,到今天 49 天没动,论文 9 月 3 日提交前就停了。想复现得自己啃。

机器人策略的容量地板

暂无表态