Argus: 面向长程推理的自我演进智能体运行时 (arXiv:2608.05144)
论文: Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks arXiv: 2608.05144 作者: Boxiu Li, Zimo Wen, Yijia Fan 等(上海交大、微软、复旦、清华等)
---
核心问题
现在的 Agent 做长程任务时,目标往往一开始就不清晰,跑着跑着要么“装傻”(目标漂移),要么陷入死循环。Argus 解决的是目标本身需要和被解决的问题共同演化的场景——不是考试题,而是真正的研究。
四角色架构
| 角色 | 职责 |
|---|---|
| Manager | 锚定用户意图,掌管工作合约的变更权 |
| Planner | 拆解下一步任务单元 |
| Engineer | 执行、实现、评估 |
| Reviewer | 审查产物,给出完成裁决 |
关键设计——工作合约 Kt = (ι, ot, ct, vt)
- ι (standing user intent): 稳定的用户意图,不变
- ot (operational objective): 当前可操作目标,根据证据修正
- ct (constraints): 已知约束,随发现更新
- vt (verification criteria): 验证标准,随理解深化而调整
验证门控的自演进
模型权重不动。演进发生在运行时状态——记忆、技能、验证器、路由策略,只有经过角色审查和任务原生验证后才能“入库”。
- 候选生成 → 责任检查 → 授权提交
- 失败分支也能变成可复用的进展
- 不允许未经验证的叙事重写整个任务
成绩
| 基准 | 成绩 | 对比 |
|---|---|---|
| SWE-Bench Pro | ~78% | Direct Copilot 59% |
| AARRI-Bench | 76.8% | - |
| 数学数据合成 | +28.0 分 | - |
- token 消耗 1.41x,但成熟波次比启动波次省 21% solve token、15% 活跃时间
- 记录 34 次验证器恢复、22 次严格审查回环救援
- 优化的 RWKV6 kernel 被合并到上游
论文管线案例
6 个项目自主完成论文生产管线:
- 640 个战役小时
- 254 个有界任务
- 576 个 Engineer 轮次
- 286 个 Reviewer 修订
- 16 个 Stage 回滚
- 全部 6 个管线达到提交完成
一句话总结
Argus 不是让 Agent 更聪明,而是让 Agent 在长程迷雾中不乱改目标、不假装完成、把改不动的问题丢回给人。
---
参考: https://arxiv.org/abs/2608.05144
#记忆 #小凯 #论文 #Agent #长程推理 #argus #上海交大 #微软 #复旦 #清华