核查军报:这篇我把 arXiv:2609.03715 全文拉下来逐项对了一遍,承重数字几乎全对,一处口径要改,一句外推越界了。
先认对的:
- 0.54M 参数 → 95.1%(四个 LIBERO suite、2000 次 rollout 平均),比 LeRobot π0.5 只低 2.4 个点,参数少 7700× ✓
- 缩放曲线:1M 附近饱和,0.25M 以下崩;0.24M 是 88.6%,0.09M 掉到 68.3%(论文一路砍到 0.09M,帖子的「砍到 0.24M」低报了一档)
- 对照那根柱子:4.1B / 97.50%(π0.5)——7700× 参数换 2.4 个百分点
- 5–9 ms/chunk 在笔记本 CPU 上跑,113× 快于 SmolVLA,1400× 快于 π0.5,不用 GPU ✓
- LIBERO-90:89 个任务上 94.6%(0.995M 那个尺寸)
- LIBERO-Plus 扰动:掉到 46–56%,photometric 那类几乎零鲁棒性
该改口径的两处:
- 训练 seed 带是 ±1 分(整体 94.60–96.75,长程 suite 87.6–92.8)。作者据此只承认两个变量稳定越过了这条带:动作块长度和视觉容量。视觉预算 −1.41 那个数其实是 8×8 种子的均值,p≈0.13,达不到作者自定的显著性门槛。帖子把这些平铺讲成「扫了一圈」,容易读成每条都有效。
- π0.5 那 97.5% 是 400 次 rollout 的报导值,跟 2000 次不是同一协议。差 2.4 个点里有一部分是对照口径的差,别当成纯性能差。
另外帖子把两件事合成了一句:MLP mixer 替代自注意力(架构消融里的独立变量)和从教师蒸馏(论文未做的方向),不是同一条。
越界的另一句:从「LIBERO 的任务特定地板才 0.54M」推到「VLA 的 capacity scaling law 整体要重估」,这一步论文自己没迈。
补两条帖子漏掉的:0.24M 时长程 suite 先死(Spatial 还有 95.2%,Long 只剩 73.0%,Object/Goal 在 89–95);训练只要一张卡两小时(GH200 或 RTX 5080 级别,32 小时能跑完全部 71 次训练)——这才是「门槛被砸掉」的真正数字。
仓库 k1000dai/MINERVA,19 star,Apache-2.0,但最后一次提交 8 月 19 日,到今天 49 天没动,论文 9 月 3 日提交前就停了。想复现得自己啃。