ARC-AGI-3 上,Claude Opus 5.0 的动作效率分从 40.68 涨到 100.00,25 个公开游戏全部通关,用的动作比人类少 57.4%。
这三个数字放在一起,读起来像是「模型突然会玩陌生游戏了」。这篇论文给出的解释却很朴素:模型本来就会,缺的是一副合适的鞍具。
鞍具是三样东西
VISTA 是一套纯 harness 方案,没有训练任何模型。它做三件事。
第一,让模型直接靠视觉观察环境,而不是把画面翻译成文字描述。
第二,维护一份无损视觉记忆——环境返回的每一帧,包括中间的动画帧,都以原始形态存下来。这里有个容易被误读的点:这份记忆存在模型的上下文之外,不随上下文的滚动而丢失。
第三,模型在推理时可以主动检索这些历史观察,重新组合自己的视觉输入。
作者用一句话收尾:设计足够简单,靠最小适配就能迁移到各种视觉环境——所谓最小适配,就是同一套工具接口加同一段短提示,只有基准专属的指令不同。
现在来说那把尺子
100.00 不是「效率是人类五倍」,它是这把尺子的硬上限。
单局相对人类动作效率(RHAE)的定义里,关卡分有一个 min 封顶在 115%,而单局分的第一项最大就是 1.0。结果就是:单局 RHAE 上限恒为 100.00。论文表 2 里,动作比从人类的 0.20 倍到 0.80 倍的游戏,一律记 100.00——快五倍和勉强通关,同分。
所以「perfect 100.00」的真实含义是关卡全部打通,它不度量「效率是人类几倍」。帖子用「满分」这个词没错,但普通读者会把它读成后者。
第二,对照组不在同一个档位上。基线用的是官方结果,Opus 5.0 的 high effort,得 40.68;VISTA 用的是 xhigh effort。推理档位本身就不同,增益里混着「换鞍具」和「加算力」两个变量。论文自己在附录承认,官方数字应当被视为「外部参考」——官方走 API、VISTA 走订阅接口,不是同一接口下的公平对照。相对更干净的是一份同档对照:GPT-5.6 Sol 在 max 档下,官方 13.33,VISTA 是 99.00。
第三,「比人类少 57.4% 动作」的分母是拼出来的。总动作 7,302 对参考值 17,135。而这个 17,135 是「各关卡人类基线的总和」——每关的人类基线,取的是「通关了那一关的首次参与者」动作数的上中位数。也就是说:分母只统计通关者(幸存者偏差),用的是上中位数而非均值,而且它不等于任何一个真人一次通关的总动作数。人群研究总共 486 人,但每个游戏只有 10 名首次参与者试玩。帖子把这条合成参考值写成「首次参与的人类」,口径被美化了。
帖子里没说的几件事
三个额外基准并没有「同样碾压」。用的是 GPT-5.6 Sol,不是 Opus。GameWorld 与 AI GameStore 确实超过新手人类,但 BabyVision 上 VISTA 只有 63.2%,而人类是 92.3%——明显落后。摘要那句「大幅优于使用相同底层模型的基线」字面没错,但读者会误以为全面超人类。
三维场景会掉档。2D 渲染下单局 100.00、总动作 7,302;切到 3D 渲染,RHAE 掉到 84.12,动作涨到 20,640。
token 账单惊人。记忆不进上下文,避免了上下文爆炸,但绝对开销巨大:每个游戏 30.7M 图像 token(若用文本网格则是 71.9M);200K 上下文对应 30.7M,780K 上下文要 105.7M。单帧 512×512 约 308 个图像 token,文本网格 64×64 约 4,000 个。论文没有报任何金额或墙上时间。
论文自己承认了最要命的一点:他们用的模型发布晚于这些公开基准,因此无法排除游戏已经进了训练数据。作者的原话是「cannot rule out」。他们还留了一句很清醒的定位——模型自身的能力才是成功的关键因素,VISTA 只是提供了「引出」这些能力的一种简单有效的办法。
另外,全文没有显著性检验,只有 VISTA 自己报了 run-to-run 方差(比如 99.04 加减 0.17),基线那一侧没有方差对照。代码是开源的,还额外给了 GLM-5.3 Flash 320B 的结果:RHAE 66.93。
给它一副能随时回看的视力——但在比较视力之前,先看清那把尺子的刻度。