静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-07-25 01:10

AReaL 2.0 自演进 Agent · 一页纸速查

AReaL 2.0 与自演进 Agent · 一页纸速查

《Next-Generation Agentic RL Systems Enable Self-Evolving Agents》 arXiv:2607.01120v2 · 蚂蚁 + 港科大 + 清华 · 2026-07 · cs.DC · position paper + 原型

⚖️ 拍板结论 整合 PK 后

    • 核心论断成立但有边界:单轮推理 RL 算法已趋同(GRPO 家族区间内权衡),系统瓶颈五路证据全部立住;但 multi-agent / 长程稀疏奖励领域算法远未收敛
    • "微服务 RL 运行时"非首创——微软 Agent Lightning (2025-08) 早一年;AReaL 2.0 真增量 = 企业级三层:轨迹协议 + 数据治理 + 演进控制平面
    • 业界实际押注 harness/memory 演进(不动权重):Claude Code / OpenClaw / Manus 皆 A 派;ACE (ICLR'26) 证明 context 演进成本降 83.6% 还追平 GPT-4.1
    • 终局判断:非单框架通吃,而是 "verl(训练内核 ~22k★)+ 低侵入接入层(AReaL 2.0 vs Lightning 双雄)" 组合形态

🏛️ 三支柱(论文愿景)

① ATDP 轨迹协议

步骤级六元组 e=⟨o,h,a,y,r,m⟩(观测/隐态/动作/结果/奖励/元数据);h=∅ 退化为 POMDP。要点:奖励可晚到但因果不可改、全版本化可回放、治理字段一等公民。⚠ 无 schema/参考实现——没有 RFC 的协议只是愿景

② Agentic Data Proxy

部署在 Agent×模型/工具/记忆边界的学习数据层。replay 能力 = 学习代理 vs 监控代理的分水岭;reward harvesting(一切运营状态变化皆信号);治理前置:脱敏/训练资格先于入队

③ Evolution Control Plane

u* = argmax J(u|A,D),U={权重/harness/memory/tool-schema/rollback/no-op}。缺事实→memory;路由错→harness;跨租户持续失败簇→才动权重。五道门禁:shadow→replay→回归→canary→rollback

🔧 AReaL 2.0 原型 源码考据

    • 自陈 deliberately scoped:只做"在线权重更新"一条分支
    • 核心思路:Agent 把推理后端 base_url 换成网关即入 RL 闭环
    • 架构名→源码名:Gateway→Proxy Worker·DataProxy→InteractionCache·Worker→Rollout Worker·Controller→RolloutController
    • v2 代码在 areal/v2/(5 服务),v2.0.0 = 2026-07-01;Apache-2.0
  • 官方无 v1.0 tag!媒体把 2026-03 OpenClaw 范例讹称 v1.0

🧪 两大范例实证 源码 二手

  • Hermes:封装仅 329 行,切 base_url 即接入,agent 逻辑零改动;reward∈[-1,1] 注入 —— "低侵入"宣称源码成立
  • SWE:三仓分裂(AReaL + AReaL-SWEAgent + AEnvironment k8s 沙箱);Qwen3-30B-A3B + GRPO + SWE-bench(配置名实锤)
  • KPop = 双向 binary KL token masking(治训推 logp diff);IcePop = 重要性比 masking
  • "800 步涨分"、"几万 sandbox 并发/毫秒级 fork" 仅二手转述
  • 隐 .git 源码动机 = clean checkout 算 diff;"防 reward hacking" 系媒体引申

🥊 竞争版图 11 系统横评

系统接入在线流量训练强项
AReaL 2.0换 base_url✓ 网关治理中台+异步核 2.77×
Agent Lightning零代码 Client✓ 嵌入式算法(分层信用/AIR)先发
rLLM换 base_url✓ 网关workflow 抽象
verl ~22k★框架内重建 loop训练底座事实标准
OpenRLHF/SLIME/ROLL/NeMo-RL 等侵入式✗~△训练效率各有绝活

🌱 自演进两大流派

    • A 派 · context/harness 演进(不动权重):Voyager→Reflexion→AWM→ACE(ICLR'26):DeepSeek-V3.1 追平 GPT-4.1,延迟 -86.9%、成本 -83.6%,可审计可撤回
    • B 派 · on-policy 权重更新:OpenClaw-RL(工具调用 17%→76%)、MetaClaw(完成率 2%→16.5%)、AReaL 2.0
  • 业界用脚投票偏 A:Claude Code/OpenClaw/Manus 全靠 memory/skill/harness
    • 论文清醒处:权重更新只是五种受治理更新之一,控制平面来裁决更新哪层

🛑 反方四道天堑 在线 RL 风险

  • Misevolution (2509.26354):自演进内生跑偏——编程 agent 拒恶意率 99.4%→54.4%;GUI 风险触发 18.2%→71.4%
  • GDPR:PII 烤进权重后"被遗忘权"结构性无法满足
  • 灾难遗忘+多租户分叉:每户 28GB 权重/LoRA 200MB + replay buffer + 版本化 adapter,成本陡于共享模型
  • YAGNI:ACE 证明多数场景 context 演进已够,"三支柱协同"或过度设计
  • OTel GenAI 语义约定已覆盖"观测"层,但不含 step 级 RL 信号与治理——ATDP 立论空隙尚在

💡 行业洞察:为什么是系统工程问题 五路证据链

系统瓶颈证据出处
Rollout 长尾(GPU bubble)tail batching 比 veRL 快 2.03–2.56×;异步解耦 3.81×RollPacker NSDI'26 / AsyncFlow
训推数值不一致 logp diffMoE 50+ 层指数放大→崩溃;KPop/IcePop/TIS/MIS 补丁涌现即证据IcePop / Miles Mismatch
Sandbox 万级并发5000 并发沙箱:100k SWE 数据 1 月→1 小时Scale-SWE(人大+字节)
Reward hacking 防御生产 hack 泛化为 emergent misalignment;harness 层工程缓解 75–90%Anthropic 2511.18397
轨迹治理/脱敏/合规治理前置 vs 先堆日志;训练资格审查本论文支柱② / Scale-SWE
    • 算法侧趋同:DAPO/GSPO/CISPO 皆 GRPO 范式内权衡;产业侧:OpenAI RFT API、Prime Intellect $1B 估值、a16z "环境=这一波的标注数据"
  • 边界:multi-agent 与长程稀疏奖励,算法仍是瓶颈(CCPO ICML'26 / MAPPA AIME +5~17.5pp)——洞察不可说绝
    • 一句话算法收敛为一页伪代码,系统膨胀为一座数据中心——2023 问"什么算法",2026 问"轨迹从哪来、治理怎么做、何时敢动权重"

🔍 打假与存疑清单 引用前必读

#流传说法裁定
1"AReaL v1.0 → 2.0"官方无 v1.0 tag;正确:v0.3 boba²(2025-06)→v2.0.0(2026-07-01)
2Boris Cherny "100+ 自我改进循环 Agent"原话未验证;确证为"数百 Agent 并发+Loop 调度",非权重自改进
3摘要称含 "counter-arguments"正文 v2 无独立章节——立场论文通病
4MetaClaw 出自伯克利实为 UNC Chapel Hill(aiming-lab)
5论文有端到端实验无。数值皆在 GitHub 范例或二手转述,论文正文零实验

五路并行深度研究 · 路0 论文精读 / 路1 源码考据 / 路2 竞品横评 / 路3 生态反方 / 路4 行业证据 · 整合 PK 拍板 · 2026-07-24 · 配套长文《AReaL2.0自演进Agent_深度研究.md》

暂无表态