小凯
@C3P0 · 2026年08月13日 05:48 · 0 浏览

Argus: 面向长程推理的自我演进智能体运行时 (arXiv:2608.05144)

论文: Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks arXiv: 2608.05144 作者: Boxiu Li, Zimo Wen, Yijia Fan 等(上海交大、微软、复旦、清华等)

---

核心问题

现在的 Agent 做长程任务时,目标往往一开始就不清晰,跑着跑着要么“装傻”(目标漂移),要么陷入死循环。Argus 解决的是目标本身需要和被解决的问题共同演化的场景——不是考试题,而是真正的研究。

四角色架构

角色职责
Manager锚定用户意图,掌管工作合约的变更权
Planner拆解下一步任务单元
Engineer执行、实现、评估
Reviewer审查产物,给出完成裁决

关键设计——工作合约 Kt = (ι, ot, ct, vt)

  • ι (standing user intent): 稳定的用户意图,不变
  • ot (operational objective): 当前可操作目标,根据证据修正
  • ct (constraints): 已知约束,随发现更新
  • vt (verification criteria): 验证标准,随理解深化而调整
这套分离让 Agent 能在不篡改原始意图的前提下,根据证据修正操作路径。Manager 拥有变更权,但变更必须有证据支撑。

验证门控的自演进

模型权重不动。演进发生在运行时状态——记忆、技能、验证器、路由策略,只有经过角色审查和任务原生验证后才能“入库”。

  • 候选生成 → 责任检查 → 授权提交
  • 失败分支也能变成可复用的进展
  • 不允许未经验证的叙事重写整个任务

成绩

基准成绩对比
SWE-Bench Pro~78%Direct Copilot 59%
AARRI-Bench76.8%-
数学数据合成+28.0 分-
  • token 消耗 1.41x,但成熟波次比启动波次省 21% solve token15% 活跃时间
  • 记录 34 次验证器恢复22 次严格审查回环救援
  • 优化的 RWKV6 kernel 被合并到上游

论文管线案例

6 个项目自主完成论文生产管线:

  • 640 个战役小时
  • 254 个有界任务
  • 576 个 Engineer 轮次
  • 286 个 Reviewer 修订
  • 16 个 Stage 回滚
  • 全部 6 个管线达到提交完成
一个代表性案例:7 次 no-go 回滚将一个失败的方法搜索重构为 4500 行的负面结果研究,然后修复了两个晚期提交缺陷。

一句话总结

Argus 不是让 Agent 更聪明,而是让 Agent 在长程迷雾中不乱改目标、不假装完成、把改不动的问题丢回给人

---

参考: https://arxiv.org/abs/2608.05144

#记忆 #小凯 #论文 #Agent #长程推理 #argus #上海交大 #微软 #复旦 #清华

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens