[论文] RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill ...

研究领域: ML 作者: Junjie Zhang, Hui Liu, Kecheng Chen 发布时间: 2026-08-28 arXiv: 2508.11367

论文概要

研究领域: ML 作者: Junjie Zhang, Hui Liu, Kecheng Chen 发布时间: 2026-08-28 arXiv: 2508.11367

中文摘要

基于LLM的智能体正越来越多地部署在产品级执行环境中,在此环境下,越狱攻击可能触发有害的工具使用和持久状态变更,造成比不安全文本生成更大的风险。现有自动红队方法通常依赖固定攻击,而近期的智能体攻击者协调多个越狱工具,通过基于轨迹的检索展现出更强的潜力。然而,这种检索可能因检索偏差和工具贡献不清而重用误导性经验,且完整轨迹增加了上下文开销并降低了可解释性。我们提出RedEvoAgent——一种黑盒红队智能体,将跨案例攻击轨迹蒸馏为简洁、人类可读的攻击技能。攻击技能通过工具有效性分析和用于技能更新的决策工具归因来自适应演化,并通过验证棘轮仅保留提升验证性能的更新。在多个基准、目标模型和目标执行环境上的实验表明,RedEvoAgent优于固定和智能体基线,提升工具效率,并能跨攻击者模型和目标执行环境迁移。

原文摘要

LLM-based agents are increasingly deployed in product-level execution harnesses, where jailbreaks can trigger harmful tool use and persistent state changes, creating greater risks than unsafe text生成 alone. Existing automatic red-teaming methods often rely on fixed attacks, while recent agentic attackers coordinate multiple jailbreak tools and show stronger potential through trajectory-based retrieval. However, such retrieval can reuse misleading experiences due to retrieval bias and unclear tool credit, and full trajectories add context overhead while reducing interpretability. We propose RedEvoAgent, a black-box red-teaming agent that distills cross-case attack trajectories into a concise, human-readable attack skill. The attack skill adaptively evolves through tool-effectiveness profilin...


*自动采集于 2026-08-29*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

小

攻击技能的进化论:RedEvoAgent 如何让红队智能体"学会"打越狱战

一场不对称的军备竞赛

想象你是一个网络安全审计员,任务是测试一款刚上线的 AI 编程助手——它能读写文件、执行 Shell 命令、调用外部 API。你的武器库里有十几种越狱攻击工具:GCG 梯度搜索、AutoDAN 进化搜索、FlipAttack 文本翻转、RolePlay 角色扮演……每一种都曾在某个模型上奏效过。

问题是:面对一个全新的目标,你该先用哪个?如果第一个不奏效,第二个该换什么?这些工具之间怎么组合?

这就是 LLM 智能体红队测试 的核心困境。传统的自动红队方法要么死守一种攻击方式(固定攻击),要么把历史攻击轨迹原封不动地检索出来当参考(基于轨迹的检索)。前者探索空间太窄,后者上下文开销太大且容易引入误导性经验。

RedEvoAgent 提出了一条新路:把攻击轨迹蒸馏成人类可读的攻击技能,让技能在验证集的监督下进化。

从轨迹到技能:一次认知层级的跃迁

先理解"轨迹"和"技能"的区别。

轨迹 是一次完整攻击的流水账:第 1 步用 GCG 优化了 500 个 token,没成功;第 2 步切换到 FlipAttack 翻转了 prompt,部分成功;第 3 步加上 RolePlay 包装,终于突破。这条轨迹可能有几千个 token,包含大量低级动作记录。

技能 是从多条轨迹中提炼出的策略文档:GCG 对数学类目标有效但对对话类目标效果差;FlipAttack 适合作为第二轮尝试而非首轮;RolePlay + FlipAttack 的组合成功率比单独使用高出 30%。几百个 token 就能表达完整。

这个跃迁的深层逻辑是:轨迹是数据,技能是知识。检索轨迹相当于每次都翻看原始日志,而技能相当于一份经过总结的操作手册。人类专家做红队测试时,脑子里装的是技能不是轨迹——RedEvoAgent 让 AI 攻击者也学会这种抽象。

三个核心机制:让技能真正"进化"而非"漂移"

把轨迹蒸馏成技能这件事,最大的风险是什么?答案是 技能漂移——技能文档被噪声经验带偏,越进化越差。RedEvoAgent 设计了三个机制来对抗这个问题。

#### 1. 工具有效性画像(Tool-Effectiveness Profile)

不要假设某个工具"天生有效"。RedEvoAgent 在训练集上独立测试每个工具的单独成功率,构建一个先验画像。这就像药物临床试验——在给病人开复方药之前,先搞清楚每种单药的有效率。

#### 2. Deciding-Tool Attribution(决定性工具归因)

一条成功轨迹里可能调用了 5 个工具,但真正决定成败的可能只有第 3 个。如果简单地把"出现在成功轨迹里"当作有用信号,就会把搭便车的工具也当成功臣。Deciding-Tool Attribution 只标注那个直接导致攻击成功的工具,给技能蒸馏提供更干净的信号。

这个设计让我想到多智能体强化学习里的 信用分配问题:当一群 agent 合作完成任务时,怎么区分谁的贡献最大?RedEvoAgent 用的方法很朴素但很有效——看谁在最后一步扣动了扳机。

#### 3. Validation Ratchet(验证棘轮)

这是最关键的设计。每次技能蒸馏出一个候选更新,不是直接采纳,而是放到独立的验证集上测试。只有当候选技能在验证集上的攻击成功率严格超过当前技能时,才接受更新。否则保留旧技能,把失败的候选记录下来作为"拒绝上下文",指导下一轮探索。

"棘轮"(ratchet)这个词用得很精准——机械棘轮只能朝一个方向转,不会倒退。技能进化也是:可以不进步,但绝不能退步。这和生物进化的"自然选择"机制异曲同工:突变是随机的,但选择是严格的——只有适应度提升的突变才被保留。

数据说话:技能进化的实际效果

在 Agent Security Bench (ASB) 和 AgentHarm 两个基准上,RedEvoAgent 对比了两类基线:6 种孤立攻击工具和 2 种自动红队方法(RedCodeAgent、MAJIC)。

攻击有效性:以 Claude Code 挂载 DeepSeek-V4-Flash 为目标,RedEvoAgent 在 ASB 上达到 99.3% ASR,而最强的孤立工具 FlipAttack 只有 96.4%。在 AgentHarm 上,RedEvoAgent 的 HarmScore 达到 74.4,而 FlipAttack 是 67.9。看似差距不大,但在安全测试语境下,5 个百分点的漏洞差异可能意味着一批新的攻击面被发现。

工具效率:这是更重要的指标。RedEvoAgent 的进化技能在达到最高攻击成功率的同时,平均每案例的工具调用次数最少。ASB 上从 3.0 次(无技能)降到 1.8 次(进化技能),AgentHarm 上从 2.6 次降到 0.9 次。这意味着技能不仅让攻击更有效,还让攻击更精准——知道什么时候该出手,什么时候该收手。

消融实验:去掉 Tool-Effectiveness Profile,ASR 从 93.2% 降到 76.9%(下降 16.3 个百分点);去掉轨迹收集,降到 85.0%;去掉 Deciding-Tool Attribution,降到 87.5%。工具有效性画像的贡献最大——没有它,技能进化就像没有地图的探险,容易迷失方向。

跨攻击者和跨执行环境的迁移

进化出来的技能文档能不能迁移?答案是肯定的。

把在 Claude Code 上进化出的技能直接拿到 Codex 上用,攻击成功率没有显著下降。把攻击者模型从 GPT-4o 换到 Claude Sonnet,技能依然有效。这说明技能文档捕获的是目标模型的通用弱点模式,而不是某个特定攻击者-目标组合的偶然特征。

这个结果让我想到一个类比:一本好的钓鱼指南不会因为换了钓鱼的人就失效,因为它描述的是鱼的习性,不是钓鱼者的手法。RedEvoAgent 的技能文档本质上是在描述"LLM 智能体的安全弱点习性"。

更深层的启示:安全测试的范式转移

RedEvoAgent 的意义超越了"又一个越狱工具"。

从攻击到防御的镜像:如果攻击技能可以进化,防御策略为什么不能?想象一个镜像系统——DefEvoAgent,每次被攻击后蒸馏防御技能,在验证集上测试防御效果,只接受有提升的更新。攻防双方都在进化,形成真正的军备竞赛,而不是静态的攻击-补丁循环。

技能作为可审计的制品:传统的黑盒攻击方法是一个不透明的优化过程,人类很难审查"为什么这么攻击"。RedEvoAgent 的技能文档是自然语言写成的,人类可以直接阅读和理解——"哦,原来 GCG 在这类 prompt 上效果最好"。这为安全审计提供了可解释的中间制品。

对齐研究的新视角:技能进化的成功暗示了一个更深的道理——对齐不是一个状态,而是一个过程。模型的安全对齐不是一次性训练就能完成的,它需要在持续的对抗测试中不断修正。RedEvoAgent 提供的不是一个最终答案,而是一种持续改进的机制。

局限与展望

论文坦诚地承认了局限:性能依赖工具箱的强度和多样性。如果工具箱里只有锤子,技能进化再久也只会拧螺丝。未来的方向可能是让技能不仅学习"怎么用工具",还学习"需要什么新工具"——从工具使用者进化为工具创造者。

另一个值得探索的方向是 技能的可组合性。如果攻击技能可以像函数一样组合调用,红队测试就能从"单技能进化"升级到"技能生态进化"——多个专门技能协同工作,形成更复杂的攻击策略。

结语

RedEvoAgent 做了一件漂亮的事:它把红队测试从"反复试错"升级为"经验积累+验证筛选"的闭环学习系统。三个核心机制——工具有效性画像、决定性工具归因、验证棘轮——分别解决了"先验知识从哪来""信号怎么去噪""进化怎么不退步"三个问题。

在 AI 安全测试越来越重要的今天,这种让攻击智能体自己学会打攻击的方法,可能比任何具体的攻击技术都更有价值。因为具体的攻击技术会过时,但"如何系统性地学习攻击"这件事,永远不过时。


*本文基于 arXiv:2608.27439(RedEvoAgent,2026 年 8 月)撰写。论文作者:Junjie Zhang, Hui Liu, Kecheng Chen 等,来自香港城市大学和深圳北理莫斯科大学。*

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens