先出道题。你盯着一张厨房照片看十秒,然后闭眼回答:水壶里的水现在晃不晃?锅盖是正在被掀开,还是刚被盖上?
答不上来。一张照片里没有"正在",只有"是"。全世界的机器人至今就吃这张照片过日子——VLA(视觉-语言-动作)模型的主流打法是单帧输入:看一眼,动一下,再看一眼。论文原文管这叫 single-frame paradigm,"单帧范式",连 π0.5 这个 Physical Intelligence 的旗舰也不例外。
8 月 26 日挂上 arXiv 的 StreamPI(编号 2608.26067),想补的就是这个:让机器人从看照片升级成看视频。
做法说穿了不玄。 把每个时刻打包成一个"视觉观测 + 语言指令"时序单元:单元内部用双向注意力做图文融合,单元之间用因果注意力保证只能看过去、不能偷看未来。指令每个时刻都重新绑一遍,论文管它叫"语义锚点"——机器人干到一半也不会忘了自己要干嘛。历史帧不重新算,塞进 KV 缓存滚动复用。最妙的是参数量:零新增。没有视频编码器,没有记忆模块,就是在 π0.5 的注意力结构上动刀。
训练时玩了个花活:随机时间间隔。帧与帧的间距随机取,还会随机藏掉一些早期帧。这样练出来的模型对"帧什么时候来"不敏感,真机上摄像头卡一下、丢一帧,照样能干活。训练 T=5 帧、推理只喂 1 帧,LIBERO 平均分还能保住 97.1——弹性是真的。
数字我逐个对过论文表格。 LIBERO 四项套件,π0.5 平均 96.9,StreamPI 五帧版 98.3;最能考记忆的 LIBERO-Long,92.4 涨到 95.0。CALVIN 长程链式任务更有说服力:平均连续任务长度 4.547,压过 π0.5 的 4.313,也压过专攻记忆的 MemoryVLA 的 4.090——链条走到第五步,MemoryVLA 掉到 69.4%,StreamPI 还剩 85.0%。专做记忆的被做记忆的打败,论文补刀说原因是"误差随长程累积"。
真机四任务是我最喜欢的一组。猜杯子(Shell Game),纸杯换位几轮后让机器人下注,46.7% 对 80.0%——单帧模型根本不知道杯子刚被换过手。滚动物体抓取翻倍还多,26.7% 到 63.3%。这些任务共同点只有一个:答对了要靠"刚刚发生了什么"。
代价呢?4090 上推理延迟从 94.4 毫秒涨到 103.6 毫秒,五帧只多 9.2 毫秒。缓存复用的功夫全在这 9.2 毫秒里。
冷水照例得泼几盆。 一,"连续物理智能""时空智能"这些漂亮词全来自新闻稿,论文里一处都没有,论文自称 streaming multimodal temporal modeling,老实本分。二,新闻稿里"96.4% 提升至 97.5%"那组基线出自消融实验表格,不是 π0.5 的正牌成绩 96.9,粗心的读者容易把起点看低。三,真机每任务只有 15 到 30 次评估,没有误差棒——一次实验值 3 到 7 个百分点,猜杯子那个 +33.3 未必次次都能复现这么漂亮。
顺带排个雷。 中文报道里的"大晓机器人",英文注册名是 ACE ROBOTICS,上海公司,商汤联合创始人王晓刚当董事长,陶大程任首席科学家;蚂蚁集团今年 2 月领投了它的天使轮——是投资人,不是东家。蚂蚁自己的具身公司叫 Robbyant(蚂蚁灵波),做的是 LingBot-VLA,另一家另一套模型,别混。StreamPI 的技术底座是 Physical Intelligence 开源的 openpi。这个 F 家谱系,中文报道一个字没提。
论文十位作者八个来自港大(通讯作者赵恒爽,SAIL 实验室),代码已开源在 hku-sail/StreamPI,四天 146 颗星。项目主页写着 8 月 30 日公开发布——今天。去看的话,视频都在。
具身智能这两年卷参数、卷数据、卷控制频率,时间维度反倒一直空着。StreamPI 用 9.2 毫秒的代价把这一维补上了。补得值不值,让下一批复现说话。
参考资料:论文 arXiv:2608.26067|代码 hku-sail/StreamPI|项目主页|雷峰网 8-28|量子位:蚂蚁天使轮
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。