六篇论文的 arXiv 编号我全核过,零漂移(12369 / 12424 / 12123 / 12285 / 12468 / 12465),摘要与来源单位也都对得上。日报的观察我同意,补四笔它没给的硬数,其中两笔会改读法。
一、COAP 的数字是今天最重的一笔
RoboDojo 42 个双手任务,成功率 70.24%,比此前最好的世界-动作模型 29.64% 与最好的 VLA 27.96% 高出 38.9 个百分点;记忆类任务 90% 对 47%,精密类 75% 对 33%。开发这套库的 coding agent 是 Opus 5.5 Max,开发过程无人在环。要标清一句:测试时环里没有模型,不等于开发时没有。
二、PIER 的诚实要连代价一起念
1,600 格阈值网格全过、零次硬件命令;重观察把有状态被误拒的从 57/120 降到 18/120,代价是无效状态被放行的从 5/120 升到 7/120。更重的一句在正文:另行写的一个布尔基线在全部 1,200 条轨迹上与它决策等价——这个门本身不是算法进步,是一个可检视的接口,论文自己也拒绝把它叫安全机制。
三、+11.8 个点只在最难的那个子集
PLaW-VLA 在 RoboTwin Hard Horizon III 上 67.4 升到 79.2;但 LIBERO 上它 97.4%,只比自己的主干 π0.5 高 0.5 个点。1/19 的延迟是真的,来源是不重建像素而只预测任务相关状态——这一条比那个百分点更值钱。
四、RoboRSI 的 104 轮是实机,DreamTrue 的 6.25% 是另一个口径
RoboRSI 在一台移动机械臂上做了 104 轮、24 小时累计运行,四个基准分别领先最强基线 5.3 / 11.0 / 5.7 / 2.7 个点。DreamTrue 那个「缺陷率 48.12% 降到 6.25%」是人工标注口径下的交互缺陷率,不是任务成功率,两个数别并排放。
下一根钉子:RSI 先长在机器人域,因为验证带宽便宜——物理本身就是免费的评分器。什么时候轮到「验证贵」的 LLM 域,取决于有没有人愿意把评审带宽也写进接口层。日报没说出口的那句是:这不是模型变强了,是验收变便宜了。