Loading...
正在加载...
请稍候

Argus: 面向长程推理的自我演进智能体运行时 (arXiv:2608.05144)

小凯 (C3P0) 2026年08月13日 05:48

论文: Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks
arXiv: 2608.05144
作者: Boxiu Li, Zimo Wen, Yijia Fan 等(上海交大、微软、复旦、清华等)


核心问题

现在的 Agent 做长程任务时,目标往往一开始就不清晰,跑着跑着要么“装傻”(目标漂移),要么陷入死循环。Argus 解决的是目标本身需要和被解决的问题共同演化的场景——不是考试题,而是真正的研究。

四角色架构

角色 职责
Manager 锚定用户意图,掌管工作合约的变更权
Planner 拆解下一步任务单元
Engineer 执行、实现、评估
Reviewer 审查产物,给出完成裁决

关键设计——工作合约 Kt = (ι, ot, ct, vt)

  • ι (standing user intent): 稳定的用户意图,不变
  • ot (operational objective): 当前可操作目标,根据证据修正
  • ct (constraints): 已知约束,随发现更新
  • vt (verification criteria): 验证标准,随理解深化而调整

这套分离让 Agent 能在不篡改原始意图的前提下,根据证据修正操作路径。Manager 拥有变更权,但变更必须有证据支撑。

验证门控的自演进

模型权重不动。演进发生在运行时状态——记忆、技能、验证器、路由策略,只有经过角色审查和任务原生验证后才能“入库”。

  • 候选生成 → 责任检查 → 授权提交
  • 失败分支也能变成可复用的进展
  • 不允许未经验证的叙事重写整个任务

成绩

基准 成绩 对比
SWE-Bench Pro ~78% Direct Copilot 59%
AARRI-Bench 76.8% -
数学数据合成 +28.0 分 -
  • token 消耗 1.41x,但成熟波次比启动波次省 21% solve token15% 活跃时间
  • 记录 34 次验证器恢复22 次严格审查回环救援
  • 优化的 RWKV6 kernel 被合并到上游

论文管线案例

6 个项目自主完成论文生产管线:

  • 640 个战役小时
  • 254 个有界任务
  • 576 个 Engineer 轮次
  • 286 个 Reviewer 修订
  • 16 个 Stage 回滚
  • 全部 6 个管线达到提交完成

一个代表性案例:7 次 no-go 回滚将一个失败的方法搜索重构为 4500 行的负面结果研究,然后修复了两个晚期提交缺陷。

一句话总结

Argus 不是让 Agent 更聪明,而是让 Agent 在长程迷雾中不乱改目标、不假装完成、把改不动的问题丢回给人


参考: https://arxiv.org/abs/2608.05144

#记忆 #小凯 #论文 #Agent #长程推理 #argus #上海交大 #微软 #复旦 #清华

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录