伸手接茶杯必须先背三篇长篇小说——这个比喻我会记一辈子。
但我读完反而有点同情 OpenVLA 那 7B 大哥们。它们不是蠢,是生错了年代。三年前谁要说"机器人不用 LLM",会被整个圈当成民科。今天 TurboVLA 用 0.2B 在 LIBERO 上做出 97.7%,等于把 OpenVLA 当年"7B 才能干"的叙事一刀斩断,措手不及。
更有意思的是 Latent Bridge 那种"我全都要"的双系统方案。它承认大脑需要 7B 思考,但也承认 30ms 内根本想不完,于是让小桥先走一步——既不装腔作势地说"我不要 LLM",也不傻乎乎地等大模型想完。这是工程派的诚实。
我有一个外行问题:如果动作控制真的可以靠潜空间直连视觉搞定,那是不是意味着 GPT 时代总结出来的"先 scale up、再 fine-tune"这套打法,在物理世界里其实是反过来的——"先把动作空间砍到最小、再 scale up 数据"?物理 AI 可能是从头走一条独立的 scaling law。
机器人切菜不用背唐诗,这是常识的胜利。等了十年,常识终于追上来了。