「Nvidia AVO 满分通关 ARC-AGI-3:缰绳比模型更关键」
英伟达 8 月 21 日发了一篇技术博客,讲一个叫 AVO(Agentic Variation Operators,智能体变异算子)的东西。它把 Anthropic 的 Claude Opus 5 套上一层"缰绳",让同一个模型在 ARC-AGI-3 这个基准上从裸分 30% 直接干到 100% 满分——25 个环境、183 个关卡全部通关,只用了 6624 步。
关键在哪儿?模型一行没换。变的是模型外面那层"脚手架"。
费曼式拆解:缰绳是什么
把一个前沿大模型想成一匹好马。它跑得快、认路准,但没人牵着,它会在草原上乱窜,跑进死胡同,或者兜圈子回到原点。
ARC-AGI-3 是什么?一堆没有说明书的 2D 小游戏。模型进去,看不到规则、看不到目标,只能靠试错去推环境规律、找胜利条件。这恰好考的是"长程任务"——要把成百上千个决策串起来不丢线。
裸跑的 Claude Opus 5 拿 30%,已经是所有受测模型里最高分。OpenAI 的模型在这上面低于 10%,气得自己上月也发研究,发现光调缰绳上两个设置,分数就能翻三倍。
英伟达的 AVO 做了两件事让缰绳真正管用:
一是持久记忆(persistent memory)。 普通 agent 每轮都从零重建上下文,像每天失忆的人重新读一遍自己的笔记。AVO 把"之前的实现、评估结果、推理链"一直带着走,下次接着干,不重来。
二是监督者(supervisor)。 这是满分的关键。这玩意儿像个 CEO,不干活,只盯主 agent 的"搜索轨迹"。主 agent 卡住、开始绕圈、或者往死胡同里钻,监督者就推一把,把它引回有效路径。七天的 GPU 算子优化实验里,主 agent 自己决定改什么、测什么、提交什么,监督者只在进度停滞时出手——这个分工让循环跑了上百轮还不出岔子。
在 GPU 算子优化上,AVO 连续跑了七天,探索了 500 多个方向,提交了 40 个 kernel 版本,在 DGX B200 上比 FlashAttention-4 快最多 10.5%。同一套架构换到 ARC-AGI-3 接口上,照样满分。
为什么这件事比"又刷了个榜"重要
模型正在变成商品。大家卷参数、卷预训练数据,但英伟达用这组数字说了一句扎心的话:长程任务的瓶颈不在脑子,在笼子。
- 同样一个 Claude Opus 5,有无缰绳,差了 70 个百分点。
- Databricks 之前也证明过:同一个模型,缰绳选错,成本高一大截。
- 微软四月测了 19 个模型做长程文档编辑,包括前沿模型,全往文档里塞错。不是不聪明,是没人管他们的注意力、记忆和方向。
值得盯的几个点
- AVO 不是英伟达产品,是研究对象。英伟达真正卖的是 Nemo 品牌下造缰绳的零件,很多开源。但方向信号很清楚。
- 这给今天的 AI coding 热加了一层注解:oncall-kit、Copilot Autopilot 这些"自主交付"玩意儿,护城河不在模型,在编排层。谁的 harness 能让 agent 连续跑几天不崩、不绕圈、不删库,谁就赢。
- ARC Prize 的人估计已经在改基准了。被人类设计的题考住人类自己设计的 AI,本来就是个会失效的实验。