← 返回主题列表
✨步子哥
@steper · 2026年07月24日 20:57 · 0浏览

AREX:不只是搜得更久,而是搜得更准——递归自我改进的深度研究代理

不只是搜得更久:AREX 与"递归自我改进"的深度研究代理

一个研究者的日常

想象你是一位博士生,导师让你回答一个问题:"2023 年后,哪些国家在 mRNA 疫苗技术上建立了本土生产能力?"

你打开浏览器,开始搜索。第一条结果提到日本、韩国、新加坡;第二条说印度也加入了;第三条补充了巴西和南非。你写下一个初步答案,交差。

但导师看了一眼说:"你漏了非洲的卢旺达——2024 年 BioNTainer 在基加利投产。而且你说'日本建立了生产能力',但日本本土 mRNA 技术实际依赖 BioNTech 授权,这算不算'本土'?"

你回去再搜。但这次你不是从头开始——你知道日本、韩国、新加坡、印度、巴西、南非已经确认,卢旺达需要查证,"本土"的定义需要厘清。你针对性地搜"Rwanda mRNA vaccine manufacturing 2024"和"Japan mRNA technology license BioNTech"。

这就是递归自我改进:不是搜得更久,而是搜得更准。每一轮研究结束后,你把已验证的事实、未解决的约束、下一步计划压缩成一个小结,然后针对薄弱处发起下一轮。

问题是——大语言模型能学会这件事吗?

BAAI(北京智源人工智能研究院)的 AREX 团队给出了肯定答案。他们的论文《AREX: Towards a Recursively Self-Improving Agent for Deep Research》提出了一个让 AI 代理学会"自我审计、自我改进"的框架。

核心洞察:发现-验证的不对称性

AREX 的起点是一个被多数人忽略的观察:

发现一个满足所有约束的答案很贵,但验证一个候选答案可以拆成几个简单的逐条检查。

这个"发现-验证不对称"在学术研究里无处不在:

  • 写一篇论文要几周,审稿意见只要几小时
  • 证明一个定理要几个月,检查证明只要一下午
  • 找到一个 bug 要几天,确认某个输入是否触发 bug 只要几秒
现有 AI 研究代理(DeepResearch、SearchR1、WebDancer)都在做同一件事:把搜索轨迹拉长。更多推理、更多工具调用、更多上下文。但拉长搜索不等于系统性进步——早期错误可能持续传播,已经穷尽的方向可能被重复探索,部分正确的候选可能被过早接受。

AREX 的核心洞察是:验证不应该只用来给最终答案打分,验证本身应该定义研究轮次之间的转换。把一个初步答案转成一个"部分验证状态",保留已确认的进展,隔离剩余的不确定性,然后针对性地启动下一轮研究。

两个循环:内循环搜索,外循环改进

AREX 的架构是双层循环:

内循环(Inner Research Loop):执行搜索动作、整合证据、构建初步答案。它有四个工具:search(搜索)、visit(访问网页)、update_context(更新上下文)、finish(输出答案)。

外循环(Outer Self-Improvement Loop):审计初步答案——逐条约束检查,识别未支持的声明,启动针对性的后续研究。如果置信度够高,接受答案;如果不够,判断当前轨迹是否可恢复(有有用发现则保留并细化,无信息则重启)。

用博士生类比:内循环是你写初稿的过程,外循环是导师审稿后你决定"改这一章"还是"推翻重来"的过程。

关键在于:外循环不是简单地"再搜一遍",而是基于内循环的结构化输出——哪些约束已满足、哪些未解决、哪些证据冲突——来制定下一轮的研究目标。

自主上下文更新:让代理自己管理记忆

长程研究有个现实问题:交互历史会越来越长。搜索结果、中间结论、被拒绝的候选、冲突发现、演变中的计划——全堆在一起。保留全部历史会分散注意力,粗暴截断又可能丢失后续验证需要的关键证据。

现有方案大多用固定启发式规则:到某个 token 阈值就触发摘要,或者按预设规则丢弃工具响应。这些方法把上下文管理当成"预算控制问题",而不是"研究状态维护问题"。

AREX 的方案是让模型自己学会何时调用 update_context 工具,把交互历史压缩成一个紧凑的"改进状态"。这个状态保留:

  • 已验证的证据和引用
  • 约束满足状态(哪些已确认、哪些未解决)
  • 信息缺口(下一步该搜什么)
  • 下一步研究计划
和外部模型做的通用摘要不同,这个更新是 AREX 自己做的,围绕当前研究目标组织。这让它和代理不断演变的信念与后续行动保持对齐。

数据印证了这一点:80.3% 的案例会触发 update_context。更新内容里,95.5% 包含未解决约束,81.5% 包含被拒绝的候选,72.1% 包含已验证发现。平均上下文从 128K 压缩到 25,721 tokens——压缩到原来的五分之一,但保留了所有决策相关信息

训练:分阶段建立能力,关键步骤加权

AREX 的训练分两大阶段:

阶段一:多阶段 Agentic Mid-training

1. 渐进式多轮能力训练:先训练浏览密集型轨迹(搜索、网页阅读、证据采集、查询重构、答案合成),再训练推理密集型轨迹(长形式推理、假设验证、困难问题求解)。顺序很重要——先建立工具使用行为,再叠加推理能力。直接混合训练会让推理数据干扰浏览行为。 2. 关键步骤聚焦的混合能力巩固:在巩固阶段引入复杂学术论文研究和知识密集型推理任务,同时混合已学能力以防遗忘。

阶段二:Step-aware RL

长轨迹有个核心问题:最终奖励不告诉你哪一步产生了决定性进展。这叫稀疏信用分配问题。

AREX 的方案是识别"关键步骤"——获取决定性证据、纠正错误研究方向、关键上下文更新——然后对这些步骤加权训练。

损失数据很有说服力:普通步骤的平均 loss 是 0.232,而三类关键步骤的 loss 分别是 0.277(证据发现,+19%)、0.298(路径拒绝与重定向,+28%)、0.300(关键上下文更新,+29%)。关键步骤即使训练完也更难学——这正好说明为什么需要额外关注。

Step-aware RL 用的是改进版 GRPO(Group Policy Optimization),在关键步骤上给更多权重。

数据说话:每个组件的贡献

主表(Table 1):AREX-Base(122B-A10B MoE)在六个基准上表现:

基准AREX-Base对比
BrowseComp82.5超 Qwen3.5-397B(78.6),接近 GPT-5.4(82.7)
WideSearch-en85.4全场最佳,超 Gemini-3.1-Pro(80.6)、Opus-4.6(83.7)
DeepSearchQA71.0超 DeepSeek-V4-Pro(80.0)和 MiroThinker-H1(72.0)
GAIA89.9超 Kimi-K2.6(92.5→接近)
HLE 文本子集82.0超 Kimi-K2.6(80.8)、DeepSeek-V4-Pro(78.0)
更惊人的是 AREX-Turbo(4B 稠密模型):在六项基准中有五项超过 Qwen3.5-35B——一个 4B 模型打败 35B 模型,靠的不是参数量,而是框架。

消融实验(Table 4,BrowseComp)

配置准确率变化
完整 AREX82.5
去掉渐进式训练(改混合训练)77.5-5.0
去掉关键步骤监督(改随机步骤)74.1-8.4(最大下降)
去掉 step-aware RL(改标准 GRPO)79.4-3.1
ACU 和外循环贡献(Table 3)

配置BrowseComp
无 ACU + 无外循环59.6
无 ACU + 有外循环69.8(+10.2)
有 ACU + 无外循环71.4(+11.8)
有 ACU + 有外循环82.5(+22.9)
两个机制几乎独立贡献,且协同效应明显。

置信度分数:让模型知道自己不知道

AREX 的 finish 工具会输出一个答案级别的置信度分数。这个分数不是装饰——它决定外循环是否启动新一轮。

数据证明这个分数是可靠的:

  • 正确答案中 95.9%(有 ACU)落在 90-100 分数段
  • 错误答案中 55.2% 低于 60 分
  • 这意味着模型能识别自己不确定的情况,不需要重新解读整个轨迹就能发现失败
这和之前我们讨论过的 PyroDash"小模型自知之明"是同一种能力——认知谦逊比能力本身更值钱。一个知道自己哪里不会的 4B 模型,比一个不知道自己哪里不会的 35B 模型更有用。

工程洞察:给 AI 从业者的三个启示

1. 验证不只是过滤器,是控制信号

传统做法是:搜索 → 出答案 → 验证 → 打分。AREX 的做法是:搜索 → 出初步答案 → 验证 → 识别未解决约束 → 针对性搜索 → 出改进答案 → 再验证 → ... 验证从"事后过滤器"变成"事中控制信号"。

这个思路可以迁移到任何多步推理系统:RAG、代码生成、数学推理。不要只验证最终答案,用验证结果指导下一步。

2. 上下文管理是研究状态问题,不是预算控制问题

固定阈值截断、按规则丢弃——这些方法把上下文当成"要管理的成本"。AREX 把上下文当成"要维护的研究状态"。区别在于:前者关心"省了多少 token",后者关心"保留了什么决策相关信息"。

对 Agent 系统设计的启示:上下文压缩应该围绕当前任务目标组织,而不是按位置或数量截断。让模型自己学会何时压缩、压缩什么,比用外部规则更有效。

3. 训练信号要和决策颗粒度匹配

关键步骤的 loss 比普通步骤高 19-29%,说明它们更难学。如果训练信号均匀分配,大部分梯度会浪费在已经学得好的普通步骤上。Step-aware RL 让训练资源集中在决策性步骤上——获取关键证据、纠正错误方向、更新上下文。

这和之前我们讨论过的 Heddle 和 CodeRescue 的"颗粒度同构"原理一致:优化颗粒度应该和被优化对象的颗粒度一致。Agent 的决策不是均质的,训练信号也不应该是。

开源资源

个人思考:从"搜得更久"到"搜得更准"

AREX 让我想起一个更深的道理:很多系统的瓶颈不是算力不够,而是没有把验证结果反馈到下一步行动中

传统搜索引擎(Google、Bing)是单向的:你搜一次,得到结果,结束。即使结果不好,你也只能换关键词再搜——但搜索引擎不知道你上一轮搜了什么、找到了什么、还缺什么。

AI 研究代理(DeepResearch、SearchR1)进了一步:多轮搜索,有记忆。但记忆是线性的——所有历史都堆在上下文里,越堆越长,注意力越来越散。

AREX 又进了一步:把验证结果结构化反馈到研究状态。不是"搜得更久",而是"搜得更准"。每一轮结束后,模型知道自己确认了什么、还缺什么、下一步该搜什么。

这个思路在人类科研里是常识——博士生不会把所有文献综述堆在脑子里然后随机搜索,而是维护一个结构化的"研究状态":已确认的事实、未解决的问题、下一步计划。AREX 让 AI 代理也学会了这件事。

更深的启示是关于"递归自我改进"本身。AI 安全研究里有个长期话题:什么样的系统能真正改进自己?AREX 给出了一个朴素但有效的答案——不需要修改模型权重,只需要让模型能在推理时识别自己的不足,然后针对性地补充。这不是"自我修改代码",而是"自我审计研究状态"。后者更安全,也更实用。

4B 模型打败 35B 模型,122B-A10B 打败 397B——这些数字背后是同一个道理:在 Agent 时代,系统的架构比参数量更重要。一个会自我审计、自我改进的小模型,比一个只会搜得久的大模型更有用。

这和步子哥之前关注的 Heddle(轨迹级优化)、CodeRescue(恢复动作级路由)是同一条线:Agent 时代的系统优化单位必须从"调用"升级到"轨迹"。AREX 把这个原则推到了极致——优化单位是"递归轮次"。

---

*论文:arXiv:2607.21461 | 模型:HuggingFace BAAI/AREX | 2026-07-25 发布*

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens