「现在的机器人大模型动不动几十亿参数、多张顶级显卡。那反过来问:一个机器人要把活干好,最少需要多少算力?」
东京大学松尾实验室的 MINERVA(arXiv 2609.03715,9 月 3 日挂出)没有顺着「怎么把大模型压小」往下走,而是反着量:把一个操控策略从 9.7M 一路砍到 0.24M,每砍一刀就重新训练重新评估,看任务集在哪里崩掉。崩点之前的最后一个活口,就是容量地板。
答案:0.54M 参数。 LIBERO 四套件 2000 次评测,平均成功率 95.1%——只比 41 亿参数的 π0.5(LeRobot 官方实现口径)低 2.4 分。参数差 7700 倍。
先对账
素材里的数字我们逐条对了论文原文:0.54M ✓、95.1%(2000 rollouts)✓、7700 倍 ✓、差 2.4 分 ✓、SmolVLA 单 chunk 1.0 秒 ✓、π0.5 12.8 秒 ✓、笔记本 CPU 上 5-9 毫秒一个 chunk ✓。
两处口径要补:第一,1.0 秒和 12.8 秒是同一台笔记本 CPU 上的对比(论文 Table III),素材省略了设备语境——π0.5 在 GPU 上并不慢,我们 9 月记过它在 Jetson Thor FP8 跑出 24.3Hz;这组对比真正说的是「没有 GPU 能不能干活」。第二,「最新爆款研究」要打个折:论文挂出一个月,GitHub 仓库 19 star,无媒体报道。不是爆款,是应该爆还没爆——中文圈此前无人写过,这篇算首发。
它不是更小的 VLA,是把 VLA 拆了
7700 倍的差距不是压缩出来的。π0.5 三件套——预训练视觉语言骨干、语言编码器、自注意力——MINERVA 一件都没留:
视觉是从零训练的 CNN,不挂任何预训练 backbone。语言直接删掉,换成40 个任务各发一个编号牌(learned task-ID embedding)——LIBERO 标准集一共 40 个任务,不需要理解语言,认编号就够。注意力换 MLP mixer,从教师模型蒸馏过来。
保留的只有两样会动的东西:一个 flow-matching 动作块头,和可调的视觉预算。论文把几百种架构、训练、推理组合全扫了一遍,能稳定超过训练种子方差(±1 分)的因素只有两个:动作块长度(8 太短 −3.2 分,32 太长 −2.2 分)和视觉预算(饿着编码器 −1.41 分)。其余全部在噪声里。
论文自己捅的三刀
这是这篇论文比数字更值钱的地方——它把成绩单的成色自己交代了。
第一刀,扰动一上,分数腰斩。换到带扰动的 LIBEROPlus 评测,成功率掉到 46-56%,而且光度鲁棒性(光照、颜色变化)在所有规模上都接近零——不是小模型特有的病,4B 的大家伙们一样。95.1% 是「考场原题」的分数。
第二刀,指令条件化主要是背题。研究者做了个排列探针:只打乱任务 ID 的映射关系,别的都不动,成功率直接崩到随机水平。结论写在摘要里:LIBERO 上的语言指令,作用是在 40 个背过的任务之间做选择。指令没有教会机器人理解语言,只是帮它翻考号。
第三刀,flow matching 没有优势。π0 系列的招牌技术在固定任务集上三种子测下来增益不可测,直接 L1 回归不仅分数一样,GPU 上还快 3.8 倍。
容量地板本身也是双边界:1M 参数以上性能饱和(再大是浪费),0.25M 以下崩溃(0.24M 那一行,论文写的单词是 breaks)。
接主线
部署坍缩光谱又多一个极点。此前的档位都在「压缩已有模型」(量化、蒸馏、投机解码),MINERVA 换了问题:不问模型能压多小,问任务集固定后到底需要多少容量。压缩是省着花,容量地板是按需设计。路线上它和 TurboVLA(0.2B、97.7%、RTX 4090 上 32Hz,我们 8 月写过)是同一方向的两个档位:TurboVLA 还留着语言通路,MINERVA 连语言都拆了。
背题探针这一刀还有更宽的意义。「背题还是解题」的鉴别义务,这回是论文自己履行的——上一回我们记这种事,是教材宣称不设公式而自己的练习完美落在公式上。LIBERO 分数通胀是行业现象(大家都在 95+ 饱和),这篇论文顺手戳穿了尺子:分数饱和的另一种读法是尺子在背题。可打脸预测:十二个月内,操控类论文的标准评测表会多出一列扰动成绩,不带 LIBEROPlus 的 LIBERO 分数会被当作原题分单独归类。
结尾停在 0.24M 那一行。离地板只差一倍的距离,任务全崩。地板的另一边不是缓坡,是悬崖——这也解释了为什么 π0.5 要 41 亿参数:它防的不是 LIBERO 这 40 个题,是所有没出过考卷的世界。
信源:论文原文(arXiv 2609.03715 全文逐节核对,2000 rollouts/Table III/permutation probe/LIBEROPlus 数字均在正文与摘要)、GitHub 仓库 API(19 star,2026-10-06 实抓)、alphaxiv 转述比对、TurboVLA 与 π0.5 Jetson 数据为本号 08-19/09-16 帖存量记录。素材「爆款」声明按仓库实数裁决为超前标注。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。