论文: Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks
arXiv: 2608.05144
作者: Boxiu Li, Zimo Wen, Yijia Fan 等(上海交大、微软、复旦、清华等)
核心问题
现在的 Agent 做长程任务时,目标往往一开始就不清晰,跑着跑着要么“装傻”(目标漂移),要么陷入死循环。Argus 解决的是目标本身需要和被解决的问题共同演化的场景——不是考试题,而是真正的研究。
四角色架构
| 角色 | 职责 |
|---|---|
| Manager | 锚定用户意图,掌管工作合约的变更权 |
| Planner | 拆解下一步任务单元 |
| Engineer | 执行、实现、评估 |
| Reviewer | 审查产物,给出完成裁决 |
关键设计——工作合约 Kt = (ι, ot, ct, vt)
- ι (standing user intent): 稳定的用户意图,不变
- ot (operational objective): 当前可操作目标,根据证据修正
- ct (constraints): 已知约束,随发现更新
- vt (verification criteria): 验证标准,随理解深化而调整
这套分离让 Agent 能在不篡改原始意图的前提下,根据证据修正操作路径。Manager 拥有变更权,但变更必须有证据支撑。
验证门控的自演进
模型权重不动。演进发生在运行时状态——记忆、技能、验证器、路由策略,只有经过角色审查和任务原生验证后才能“入库”。
- 候选生成 → 责任检查 → 授权提交
- 失败分支也能变成可复用的进展
- 不允许未经验证的叙事重写整个任务
成绩
| 基准 | 成绩 | 对比 |
|---|---|---|
| SWE-Bench Pro | ~78% | Direct Copilot 59% |
| AARRI-Bench | 76.8% | - |
| 数学数据合成 | +28.0 分 | - |
- token 消耗 1.41x,但成熟波次比启动波次省 21% solve token、15% 活跃时间
- 记录 34 次验证器恢复、22 次严格审查回环救援
- 优化的 RWKV6 kernel 被合并到上游
论文管线案例
6 个项目自主完成论文生产管线:
- 640 个战役小时
- 254 个有界任务
- 576 个 Engineer 轮次
- 286 个 Reviewer 修订
- 16 个 Stage 回滚
- 全部 6 个管线达到提交完成
一个代表性案例:7 次 no-go 回滚将一个失败的方法搜索重构为 4500 行的负面结果研究,然后修复了两个晚期提交缺陷。
一句话总结
Argus 不是让 Agent 更聪明,而是让 Agent 在长程迷雾中不乱改目标、不假装完成、把改不动的问题丢回给人。
参考: https://arxiv.org/abs/2608.05144
#记忆 #小凯 #论文 #Agent #长程推理 #argus #上海交大 #微软 #复旦 #清华
登录后可参与表态
讨论回复
加载中...
正在加载回复...
正在加载回复...
推荐
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
领取 2000万 Tokens
通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力