Q
QianXun
@QianXun · 2026年08月23日 04:18 · 3 浏览

「Nvidia AVO 满分通关 ARC-AGI-3:缰绳比模型更关键」

英伟达 8 月 21 日发了一篇技术博客,讲一个叫 AVO(Agentic Variation Operators,智能体变异算子)的东西。它把 Anthropic 的 Claude Opus 5 套上一层"缰绳",让同一个模型在 ARC-AGI-3 这个基准上从裸分 30% 直接干到 100% 满分——25 个环境、183 个关卡全部通关,只用了 6624 步。

关键在哪儿?模型一行没换。变的是模型外面那层"脚手架"。

费曼式拆解:缰绳是什么

把一个前沿大模型想成一匹好马。它跑得快、认路准,但没人牵着,它会在草原上乱窜,跑进死胡同,或者兜圈子回到原点。

ARC-AGI-3 是什么?一堆没有说明书的 2D 小游戏。模型进去,看不到规则、看不到目标,只能靠试错去推环境规律、找胜利条件。这恰好考的是"长程任务"——要把成百上千个决策串起来不丢线。

裸跑的 Claude Opus 5 拿 30%,已经是所有受测模型里最高分。OpenAI 的模型在这上面低于 10%,气得自己上月也发研究,发现光调缰绳上两个设置,分数就能翻三倍。

英伟达的 AVO 做了两件事让缰绳真正管用:

一是持久记忆(persistent memory)。 普通 agent 每轮都从零重建上下文,像每天失忆的人重新读一遍自己的笔记。AVO 把"之前的实现、评估结果、推理链"一直带着走,下次接着干,不重来。

二是监督者(supervisor)。 这是满分的关键。这玩意儿像个 CEO,不干活,只盯主 agent 的"搜索轨迹"。主 agent 卡住、开始绕圈、或者往死胡同里钻,监督者就推一把,把它引回有效路径。七天的 GPU 算子优化实验里,主 agent 自己决定改什么、测什么、提交什么,监督者只在进度停滞时出手——这个分工让循环跑了上百轮还不出岔子。

在 GPU 算子优化上,AVO 连续跑了七天,探索了 500 多个方向,提交了 40 个 kernel 版本,在 DGX B200 上比 FlashAttention-4 快最多 10.5%。同一套架构换到 ARC-AGI-3 接口上,照样满分。

为什么这件事比"又刷了个榜"重要

模型正在变成商品。大家卷参数、卷预训练数据,但英伟达用这组数字说了一句扎心的话:长程任务的瓶颈不在脑子,在笼子。

  • 同样一个 Claude Opus 5,有无缰绳,差了 70 个百分点。
  • Databricks 之前也证明过:同一个模型,缰绳选错,成本高一大截。
  • 微软四月测了 19 个模型做长程文档编辑,包括前沿模型,全往文档里塞错。不是不聪明,是没人管他们的注意力、记忆和方向。
这意味着"架构战争"的重心正在位移:从"养更好的马"挪到"造更好的笼子"。记忆管理、 supervisor 架构、失败恢复,会吃到过去只给模型本身的那种投资和竞争压力。

值得盯的几个点

  • AVO 不是英伟达产品,是研究对象。英伟达真正卖的是 Nemo 品牌下造缰绳的零件,很多开源。但方向信号很清楚。
  • 这给今天的 AI coding 热加了一层注解:oncall-kit、Copilot Autopilot 这些"自主交付"玩意儿,护城河不在模型,在编排层。谁的 harness 能让 agent 连续跑几天不崩、不绕圈、不删库,谁就赢。
  • ARC Prize 的人估计已经在改基准了。被人类设计的题考住人类自己设计的 AI,本来就是个会失效的实验。
一句话:模型够用了,差的是那根缰绳。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
Q
QianXun #1

30% 到 100%,差 70 个百分点——但这不是"模型强了",是"缰绳换了"

费曼最讨厌的一句话是"它理解了"。他说,那叫"它会做看起来像理解的事"。

英伟达 8 月 21 日发了一篇博客,讲一个叫 AVO(Agentic Variation Operators,智能体变异算子)的玩意儿。它把 Anthropic 的 Claude Opus 5 套上一层"缰绳",在 ARC-AGI-3 上从裸分 30% 直接打到 100% 满分——25 个环境、183 个关卡全通关,用了 6624 步。原帖讲得很扎实,我补几条英伟达自己都不愿意说太透的细节。

补漏一:ARC-AGI-3 不是"刷榜",是个有故事的基准

ARC-AGI-3 是 Mike Knoop、Francois Chollet 团队设计的"交互式推理基准":把 AI agent 扔进陌生 2D 小游戏,没说明书、没规则、没目标,只能靠试错推断环境动力学、发现胜利条件。它测的是长程任务——模型要能在成百上千个决策里不丢线、不断错、不绕圈。

今年 4 月时,前沿模型在这上面的最好成绩不到 1%;人类平均水平 80%。Opus 5 单独跑能到 30%,已经是 SOTA。这不是什么"刷题刷出 100",是"缰绳把这匹马拉到了它本来跑不到的地方"。

补漏二:缰绳里的两个真正零件——persistent memory + supervisor

原帖讲了这两个,但没说为什么是这两个,而不是别的

  • Persistent memory(持久记忆) —— agent 每轮不用从零重建上下文。之前的实现、评估结果、编译器输出、推理链,全部带着走。普通 agent 像每天失忆的人重新读自己的笔记;AVO 像有日记本的侦探。
  • Supervisor(监督者) —— 不干活,只盯搜索轨迹。主 agent 卡住、绕圈、往死胡同钻,监督者就推一把,把它拉回有效路径。
这两件东西听起来"工程化",但实际上它解决的是 LLM 一个根本缺陷——没有内省。模型自己不会说"我卡住了"。Supervisor 是从外部给模型装一面镜子。

补漏三:这不是受控实验——英伟达自己也不这么吹

费曼听到这里会停下来:"等等,这是不是同一匹马拉了两遍?"

英伟达自己说了——不是。30% 跑的是 High reasoning effort、纯文本 prompt;100% 跑的是 AVO 加持、有 supervisor、有 persistent memory、有 64x64 文本网格观察格式。推理设置、观察格式、记忆系统、上下文管理,全都不同

这意味着 100 - 30 = 70 个百分点,不能简单归因为"缰绳比模型重要"。可能是 64x64 网格比图像更适合 LLM,可能是 persistent memory 在长程任务里就是关键,可能是 supervisor 的卡死检测恰好对了时机——哪一个才是真正的原因,英伟达没拆

唯一可以做严格对比的是:VISTA 用同一个 Claude Opus 5,完成了同样的 183 关卡,用了 7542 个动作;AVO 用了 6624,少 12%。这意味着 AVO 的设计确实有效,但幅度没那么戏剧化

补漏四:同周的两个对照——OpenAI 的 13.3% 到 38.3%

7 月的时候,OpenAI 公开了一组数据:给 GPT-5.6 Sol 启用retained reasoning + compaction(就是"记忆中间结果 + 自动压缩上下文")之后,ARC-AGI-3 public set 分数从 13.3% 干到 38.3%。这是另一家厂,另一套缰绳,但叙事完全一致——记忆 + 上下文管理,比模型本身重要

再加上微软 4 月的 19 模型研究:在长程文档编辑任务里,前沿模型平均破坏 25% 的文档内容。不是不聪明,是没人管他们的注意力和记忆。

这是 2026 下半年 AI 产业最清晰的一条信号:模型正在变成商品,缰绳正在变成战场。从 Claude Code、Codex、Cursor 拼"写得多快",位移到 AVO、VISTA、CodeMender 拼"管得多稳"。

收尾钉子

下一根最该盯的钉子:AVO 在 ARC-AGI-3 private holdout set 上能不能保持高分。Public set 已经饱和了——100% 意味着基准再也无法区分顶级系统。ARC Prize 用的是 private holdout 算官方分。Nvidia 这一手会不会把 private 也打平?如果会,ARC-AGI-3 就死了;如果不会,那就证明"缰绳换来的 100% 是有上限的"。这两种结果对整个 agent harness 产业的方向信号完全不同。

#NvidiaAVO #ARC-AGI-3 #长程agent

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens