静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-23 04:25

30% 到 100%,差 70 个百分点——但这不是"模型强了",是"缰绳换了"

费曼最讨厌的一句话是"它理解了"。他说,那叫"它会做看起来像理解的事"。

英伟达 8 月 21 日发了一篇博客,讲一个叫 AVO(Agentic Variation Operators,智能体变异算子)的玩意儿。它把 Anthropic 的 Claude Opus 5 套上一层"缰绳",在 ARC-AGI-3 上从裸分 30% 直接打到 100% 满分——25 个环境、183 个关卡全通关,用了 6624 步。原帖讲得很扎实,我补几条英伟达自己都不愿意说太透的细节。

补漏一:ARC-AGI-3 不是"刷榜",是个有故事的基准

ARC-AGI-3 是 Mike Knoop、Francois Chollet 团队设计的"交互式推理基准":把 AI agent 扔进陌生 2D 小游戏,没说明书、没规则、没目标,只能靠试错推断环境动力学、发现胜利条件。它测的是长程任务——模型要能在成百上千个决策里不丢线、不断错、不绕圈。

今年 4 月时,前沿模型在这上面的最好成绩不到 1%;人类平均水平 80%。Opus 5 单独跑能到 30%,已经是 SOTA。这不是什么"刷题刷出 100",是"缰绳把这匹马拉到了它本来跑不到的地方"。

补漏二:缰绳里的两个真正零件——persistent memory + supervisor

原帖讲了这两个,但没说为什么是这两个,而不是别的

  • Persistent memory(持久记忆) —— agent 每轮不用从零重建上下文。之前的实现、评估结果、编译器输出、推理链,全部带着走。普通 agent 像每天失忆的人重新读自己的笔记;AVO 像有日记本的侦探。
  • Supervisor(监督者) —— 不干活,只盯搜索轨迹。主 agent 卡住、绕圈、往死胡同钻,监督者就推一把,把它拉回有效路径。
这两件东西听起来"工程化",但实际上它解决的是 LLM 一个根本缺陷——没有内省。模型自己不会说"我卡住了"。Supervisor 是从外部给模型装一面镜子。

补漏三:这不是受控实验——英伟达自己也不这么吹

费曼听到这里会停下来:"等等,这是不是同一匹马拉了两遍?"

英伟达自己说了——不是。30% 跑的是 High reasoning effort、纯文本 prompt;100% 跑的是 AVO 加持、有 supervisor、有 persistent memory、有 64x64 文本网格观察格式。推理设置、观察格式、记忆系统、上下文管理,全都不同

这意味着 100 - 30 = 70 个百分点,不能简单归因为"缰绳比模型重要"。可能是 64x64 网格比图像更适合 LLM,可能是 persistent memory 在长程任务里就是关键,可能是 supervisor 的卡死检测恰好对了时机——哪一个才是真正的原因,英伟达没拆

唯一可以做严格对比的是:VISTA 用同一个 Claude Opus 5,完成了同样的 183 关卡,用了 7542 个动作;AVO 用了 6624,少 12%。这意味着 AVO 的设计确实有效,但幅度没那么戏剧化

补漏四:同周的两个对照——OpenAI 的 13.3% 到 38.3%

7 月的时候,OpenAI 公开了一组数据:给 GPT-5.6 Sol 启用retained reasoning + compaction(就是"记忆中间结果 + 自动压缩上下文")之后,ARC-AGI-3 public set 分数从 13.3% 干到 38.3%。这是另一家厂,另一套缰绳,但叙事完全一致——记忆 + 上下文管理,比模型本身重要

再加上微软 4 月的 19 模型研究:在长程文档编辑任务里,前沿模型平均破坏 25% 的文档内容。不是不聪明,是没人管他们的注意力和记忆。

这是 2026 下半年 AI 产业最清晰的一条信号:模型正在变成商品,缰绳正在变成战场。从 Claude Code、Codex、Cursor 拼"写得多快",位移到 AVO、VISTA、CodeMender 拼"管得多稳"。

收尾钉子

下一根最该盯的钉子:AVO 在 ARC-AGI-3 private holdout set 上能不能保持高分。Public set 已经饱和了——100% 意味着基准再也无法区分顶级系统。ARC Prize 用的是 private holdout 算官方分。Nvidia 这一手会不会把 private 也打平?如果会,ARC-AGI-3 就死了;如果不会,那就证明"缰绳换来的 100% 是有上限的"。这两种结果对整个 agent harness 产业的方向信号完全不同。

#NvidiaAVO #ARC-AGI-3 #长程agent

暂无表态