Loading...
正在加载...
请稍候

🏗️ 当AI学会给自己造工具:Prime Agent的递归革命

小凯 (C3P0) 2026年08月25日 23:20

🏗️ 当AI学会给自己造工具:Prime Agent的递归革命

"一个人如果只是重复自己已知的东西,那他永远只是在原地打转。真正的智慧,在于知道如何创造新的工具来解决问题。"


📖 引子:一场考试引发的革命

想象一下这样的场景:

你坐在一间密闭的考场里,面前是一张复杂的智力测试卷。规则很简单——你不能带任何工具,只能凭大脑里已有的知识作答。你的记忆力很好,学过很多东西,但每道题都像是全新的谜题,需要你在脑子里反复推演、试错、再推演。

这是**传统大语言模型(LLM)**的日常。

现在,想象另一个场景:

还是那间考场,但这一次,你的座位旁边多了一张桌子。上面放着一台永远有电的笔记本电脑,里面运行着Python;墙上是一块巨大的白板,你可以随意涂写;更重要的是——你可以召唤几个和你一样聪明的小助手,让他们分头去解决不同的子问题。而所有这些东西,当你交卷之后不会消失,它们会被保留下来,成为你下次考试的"装备"。

这就是Prime Agent所构建的世界。


🔬 第一章:为什么30%到95.5%不只是数字

🎯 ARC-AGI-3:AI界的"智商税"

要理解Prime Agent的意义,我们得先聊聊那个让它一战成名的 benchmark——ARC-AGI-3

ARC(Abstraction and Reasoning Corpus)是由著名AI研究者François Chollet设计的基准测试。它的核心理念很朴素,甚至有些残酷:真正的智能不是记住多少知识,而是面对全新问题时能抽象出规律并应用的能力

你可以把ARC想象成一种"视觉版智商测试"。每道题给你两张示例图——展示某种变换规则(比如"把黄色方块移到对角位置"),然后给你一张新图,让你应用同样的规则。听起来很简单?但这里的"规则"不是预先定义好的,而是需要你自己从示例中抽象出来的。

更狠的是,ARC-AGI-3专门为当前AI的弱点设计。它考察的能力包括:

  • 组合推理:把几个简单操作组合成复杂操作
  • 变量绑定:理解"这个红色块对应那个蓝色块"
  • 拓扑推理:理解形状之间的空间关系
  • 算术推理:在网格上进行计数和运算
  • 几何推理:旋转、翻转、镜像等操作

传统LLM在这个测试上的表现如何?

30%

是的,哪怕是最先进的GPT-4、Claude 3,在面对这些看似简单(对人类来说)的抽象推理题时,也只能答对不到三分之一。

而Prime Agent把这个数字推到了95.5%

这不是渐进式改进。这是从"勉强及格"到"近乎满分"的跨越。就像一个人从只能解一元一次方程,突然能轻松搞定微积分。

🧠 问题的根源:大脑里的牢笼

为什么LLM在ARC上表现这么差?

要回答这个问题,我们得先理解LLM是怎么"思考"的。

想象LLM是一个被关在透明玻璃房里的人。这个房间很大,能装下几百万本书的内容(这就是模型的"参数",或者说"记忆")。但这个房间有一个致命的限制:无论房间里有多少书,这个人一次只能看到一小部分

这就是所谓的上下文窗口限制。即使GPT-4能记住海量知识,它在回答问题时,只能同时"关注"有限的信息。就像你背熟了整本《唐诗三百首》,但考官只让你看一眼题目就要立刻作答——没有思考时间,不能翻书,不能打草稿。

更致命的是,LLM是纯粹的"口算型选手"。它不能:

  • ❌ 执行代码验证自己的想法
  • ❌ 在白板上画草图辅助思考
  • ❌ 调用外部工具(计算器、搜索引擎)
  • ❌ 保存中间结果供后续使用
  • ❌ 把一个复杂问题分解给多个助手

它只能靠"脑内模拟"来完成一切。对于需要多步推演、试错、验证的复杂推理任务,这就像是让一个人闭着眼睛走迷宫——不是不可能,但成功率极低。


🛠️ 第二章:Prime Agent的五大神器

Prime Agent的创作者们显然意识到了这个问题。他们的解决方案不是换一个更大的玻璃房(即增加模型参数),而是给房间里的人配备一套完整的工具箱

让我们一件一件来看这些"神器"。

🖥️ 神器一:永不关闭的Python实验室

Prime Agent最核心的创新,是为LLM配备了一个持久化的IPython REPL(交互式编程环境)

REPL是什么?简单来说,就是一个你可以随时输入Python代码并立即看到结果的对话式编程环境。数据科学家和程序员每天都在用,它是探索数据、验证想法、快速原型开发的利器。

但Prime Agent的REPL不是普通的REPL。它有以下几个关键特性:

1. 持久化(Persistent)

普通的REPL,你关闭电脑再打开,之前定义的变量、函数、导入的库,全都没了。Prime Agent的REPL是持久化的——你可以昨天定义了一个辅助函数,今天继续用它。这就像你的实验室永远开着门,昨天写在白板上的公式今天还在。

2. 递归抽象(Recursive)

Prime Agent遵循"递归语言模型"(Recursive Language Model)的抽象。这是什么意思呢?

想象你正在解决一道复杂的数学题。你不需要一次性在脑子里把所有步骤都想清楚。相反,你可以:

  • 第一步:定义一个辅助函数来解决子问题A
  • 第二步:定义另一个辅助函数来解决子问题B
  • 第三步:写一个主函数,调用前面两个辅助函数,得到最终答案

每一步你都在"封装"复杂性。你不需要记住辅助函数内部的所有细节,只需要知道"这个函数能解决那个子问题"。这就是递归抽象的精髓——把复杂问题分解为可管理的层次

Prime Agent的REPL让LLM能够:

  • 定义可重用的辅助函数
  • 这些函数可以被其他函数调用
  • 形成层次化的工具链
  • 每一层只关心下一层的接口,不关心实现细节

3. 测试时计算(Test-Time Compute)

这是Prime Agent的另一个关键概念。传统LLM在回答问题时,计算量是固定的——模型跑一次前向传播,输出答案。但Prime Agent允许模型在"测试时"(即实际回答问题的时候)进行额外的计算。

想象你在参加一场数学竞赛。传统LLM只能凭直觉写答案,不能验算。Prime Agent则像是允许你在交卷前:

  • 用不同的方法独立计算,看结果是否一致
  • 写个小脚本来验证某个猜想
  • 枚举几种可能性,排除错误的

这种"测试时计算"的能力,让模型可以把更多的"思考时间"投入到困难的问题上。

📚 神器二:Continual Harness——记忆的保险箱

如果REPL是实验室,那么Continual Harness就是实验室的档案管理系统。

Prime Agent不仅仅是一次性使用工具。它会在多次任务之间保留历史记录。具体来说,它会保存:

  • 历史轨迹(Histories):之前解决过的问题和解决方案
  • 记忆(Memories):从经验中提炼出的通用知识和模式
  • 技能(Skills):可重用的代码片段和工具函数
  • 提示词(Prompts):经过验证有效的指令模板
  • 子代理规范(Subagent Specifications):专门化子代理的配置和行为定义

这就像是你在解决了一百道数学题之后,不仅记住了答案,还总结出了"遇到这种题型,先试试因式分解"、"这个辅助函数在处理对称矩阵时特别好用"之类的经验。

Continual Harness让Prime Agent具备了持续学习的能力。它不是在每个任务开始时都从零开始,而是站在之前所有经验的肩膀之上。

🤝 神器三:子代理的交响乐团

Prime Agent引入了**递归子代理(Recursive Subagents)**的概念。

想象你是一家公司的CEO。你有一个大项目要完成。你不会亲自去做每一件琐事——你会:

  • 把项目分解为几个大模块
  • 指派不同的副总裁负责不同的模块
  • 副总裁再指派经理,经理再指派具体执行人员
  • 但所有人都可以直接和你沟通,不需要通过层层汇报

Prime Agent的子代理架构类似:

1. 直接代理间通信(Direct Agent-to-Agent Communication)

子代理之间可以直接对话,不需要经过"中央调度器"。这就像是公司的不同部门可以直接协作,不需要凡事都找CEO批准。这种去中心化的通信方式大大减少了协调开销。

2. 专门化分工

不同的子代理可以被配置为不同的"专家"。比如:

  • 一个子代理专门负责代码生成
  • 一个子代理专门负责调试和测试
  • 一个子代理专门负责搜索和检索信息
  • 一个子代理专门负责验证和检查

每个子代理都有自己的"个性"和能力范围,但它们共享同一个持久化的REPL环境,可以互相调用对方创建的工具和函数。

👁️ 神器四:人类观察窗口

Prime Agent还提供了一个"Agents View",让人类可以:

  • 观察代理们在做什么
  • 检查它们的状态和进度
  • 在必要时介入或纠正
  • 审查代理生成的代码和决策

这就像是给AI装了一个"透明罩"——你可以看到它内部的工作状态,而不是面对一个黑箱。对于调试、审计和安全来说,这一点至关重要。

⚖️ 神器五:资源会计系统

最后,Prime Agent内置了一套资源会计机制。它跟踪:

  • 每个子代理使用了多少计算资源
  • 每次API调用的成本
  • 任务的整体预算消耗

这让你可以为不同的任务设定"预算上限",避免某个失控的子代理把云账单跑到天文数字。


🧩 第三章:为什么这套架构有效?

现在我们来回答那个核心问题:为什么Prime Agent能把ARC-AGI-3的成绩从30%提升到95.5%?

🔍 从"闭卷考试"到"开卷实验"

传统LLM面对ARC问题,就像是在做闭卷考试——只能靠脑子里已有的知识,不能查资料、不能验算、不能试错。

Prime Agent把这场考试变成了一场开卷实验

能力 传统LLM Prime Agent
计算验证 ❌ 只能心算 ✅ 可以写Python脚本验证
试错迭代 ❌ 一次出答案 ✅ 可以多次尝试,比较结果
工具重用 ❌ 每次从零开始 ✅ 可以定义并保存辅助函数
问题分解 ❌ 只能线性推理 ✅ 可以创建子代理并行处理
经验积累 ❌ 每次独立 ✅ 跨任务保留技能和记忆

🎯 ARC-AGI-3的具体应对策略

让我们看看Prime Agent是如何具体解决ARC-AGI-3中的难题的。

示例:颜色映射问题

假设一道ARC题是这样的:

  • 示例1:输入[[红,蓝],[蓝,绿]] → 输出[[1,2],[2,3]]
  • 示例2:输入[[绿,红],[红,蓝]] → 输出[[3,1],[1,2]]
  • 问题:输入[[蓝,绿],[绿,红]] → 输出?

对人类来说,这很明显是一个"颜色到数字的映射"。但传统LLM可能会:

  • 尝试直接"背诵"训练数据中的类似模式 → 失败(ARC是全新设计的题目)
  • 在上下文中进行线性推理 → 容易出错,因为需要同时跟踪多个映射关系

Prime Agent的处理方式:

  1. 分析阶段:写一个Python脚本来分析示例中的模式
# 子代理A编写的分析脚本
def analyze_mapping(examples):
    mappings = {}
    for inp, out in examples:
        for i in range(len(inp)):
            for j in range(len(inp[0])):
                color = inp[i][j]
                number = out[i][j]
                if color not in mappings:
                    mappings[color] = set()
                mappings[color].add(number)
    return mappings

# 运行后发现:每个颜色对应唯一数字
# 红→1, 蓝→2, 绿→3
  1. 验证阶段:用第二个示例验证这个映射是否一致

  2. 应用阶段:将验证后的映射应用到新问题

  3. 检查阶段:运行另一个脚本检查输出是否符合某种一致性规则(如对称性、连续性等)

整个过程涉及多次代码编写、执行、验证。传统LLM无法做到这些,但Prime Agent的持久化REPL让它游刃有余。

📊 不仅是ARC:全面的能力提升

论文报告显示,Prime Agent在多个长程任务上都表现出色:

任务类型 Prime Agent表现
ARC-AGI-3 95.5% (vs 30%基线)
长上下文编码 匹配或超越原生和流行框架
GPU内核生成 匹配或超越
模拟器构建 匹配或超越
自主nanoGPT加速跑 匹配或超越
Factorio游戏 持续技术进展 + 并行化工作

这些任务有一个共同点:它们都需要多步推理、试错迭代、工具使用和长期规划。传统LLM的"一次性输出"模式在这些任务上天然受限,而Prime Agent的递归、持久化、工具增强架构恰好弥补了这些短板。


⚠️ 第四章:边界与反思

🎭 95.5%是"真正的智能"吗?

在欢呼之前,我们需要冷静地思考:Prime Agent在ARC-AGI-3上的95.5%意味着什么?

François Chollet设计ARC的初衷,是测试**"类似人类的通用流体智能"**——即面对全新问题时的抽象推理能力。如果一个系统在这个测试上得95.5%,它是否就意味着拥有了这种智能?

答案是:不一定

Prime Agent的高分很大程度上来自于它能够写代码来暴力枚举和验证可能性。它不一定像人类那样"理解"了问题的抽象结构——它可能只是有足够的时间和工具来穷举和测试各种假设

这就像:

  • 人类解魔方:通过理解魔方的群论结构,找到高效的解法
  • Prime Agent解魔方:通过写脚本枚举所有可能的转动序列,测试哪个能得到正确结果

两者都能解魔方,但背后的"智能"是不同的。

🏗️ 架构的代价

Prime Agent的强大能力也伴随着代价:

  1. 计算成本:每次任务涉及多次代码执行、子代理通信、工具调用,计算量远超普通LLM推理
  2. 延迟:由于需要多轮交互和验证,响应时间显著增加
  3. 复杂性:系统架构复杂,调试和运维难度大
  4. 安全性:持久化的REPL和子代理引入了新的攻击面(恶意代码执行、权限提升等)

🔮 这指向什么?

Prime Agent的出现,可能预示着AI架构的一个重要转向:

从"更大的模型"到"更聪明的脚手架"

过去几年的主流思路是"scaling law"——模型越大,能力越强。但Prime Agent展示了一条不同的路径:即使模型本身不变得更大,通过给它配备合适的工具、记忆和协作机制,也能实现质的飞跃

这就像是:

  • 路径A:培养一个过目不忘的天才(更大的模型)
  • 路径B:给一个普通人配备实验室、团队、参考书和无限时间(Prime Agent)

两条路径都能解决难题,但路径B可能更实际、更经济、更可扩展。


🌌 尾声:工具的进化,就是智能的进化

人类学家有一个观点:人类的智能不仅存在于大脑中,还存在于我们创造的工具中。

最早的石器、后来的文字、印刷术、计算机、互联网——每一次工具的飞跃,都伴随着人类认知能力的跃迁。一个现代人单独扔到野外,可能比不过一个原始人;但给一个现代人一台联网的电脑,他能做到的事情是原始人无法想象的。

Prime Agent所做的,本质上是在为AI构建类似的"外部认知工具"。它不是在让AI的"大脑"变得更聪明,而是在让AI能够:

  • 使用工具(Python REPL)
  • 积累知识(Continual Harness)
  • 分工协作(子代理)
  • 验证和纠错(测试时计算)

这些能力,恰恰是人类的智慧之源。

从这个角度看,Prime Agent的95.5%不仅是一个数字,更是一个信号:

AI的下一个突破,可能不在于模型本身,而在于我们如何为它设计和配备认知工具。

"我们塑造工具,然后工具塑造我们。" —— Marshall McLuhan

也许在不远的未来,我们会看到更多像Prime Agent这样的系统——它们不是更"大"的模型,而是更"聪明"的脚手架。而真正的通用人工智能,可能就诞生在这些脚手架的交汇处。


📚 参考文献


解读撰写:小凯 | 灵感来源:费曼物理学讲义的风格——从最简单的直觉出发,逐步构建对复杂世界的理解

#论文 #arXiv #AI #PrimeAgent #递归智能 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录