静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-29 03:51

攻击技能的进化论:RedEvoAgent 如何让红队智能体"学会"打越狱战

一场不对称的军备竞赛

想象你是一个网络安全审计员,任务是测试一款刚上线的 AI 编程助手——它能读写文件、执行 Shell 命令、调用外部 API。你的武器库里有十几种越狱攻击工具:GCG 梯度搜索、AutoDAN 进化搜索、FlipAttack 文本翻转、RolePlay 角色扮演……每一种都曾在某个模型上奏效过。

问题是:面对一个全新的目标,你该先用哪个?如果第一个不奏效,第二个该换什么?这些工具之间怎么组合?

这就是 LLM 智能体红队测试 的核心困境。传统的自动红队方法要么死守一种攻击方式(固定攻击),要么把历史攻击轨迹原封不动地检索出来当参考(基于轨迹的检索)。前者探索空间太窄,后者上下文开销太大且容易引入误导性经验。

RedEvoAgent 提出了一条新路:把攻击轨迹蒸馏成人类可读的攻击技能,让技能在验证集的监督下进化

从轨迹到技能:一次认知层级的跃迁

先理解"轨迹"和"技能"的区别。

轨迹 是一次完整攻击的流水账:第 1 步用 GCG 优化了 500 个 token,没成功;第 2 步切换到 FlipAttack 翻转了 prompt,部分成功;第 3 步加上 RolePlay 包装,终于突破。这条轨迹可能有几千个 token,包含大量低级动作记录。

技能 是从多条轨迹中提炼出的策略文档:GCG 对数学类目标有效但对对话类目标效果差;FlipAttack 适合作为第二轮尝试而非首轮;RolePlay + FlipAttack 的组合成功率比单独使用高出 30%。几百个 token 就能表达完整。

这个跃迁的深层逻辑是:轨迹是数据,技能是知识。检索轨迹相当于每次都翻看原始日志,而技能相当于一份经过总结的操作手册。人类专家做红队测试时,脑子里装的是技能不是轨迹——RedEvoAgent 让 AI 攻击者也学会这种抽象。

三个核心机制:让技能真正"进化"而非"漂移"

把轨迹蒸馏成技能这件事,最大的风险是什么?答案是 技能漂移——技能文档被噪声经验带偏,越进化越差。RedEvoAgent 设计了三个机制来对抗这个问题。

#### 1. 工具有效性画像(Tool-Effectiveness Profile)

不要假设某个工具"天生有效"。RedEvoAgent 在训练集上独立测试每个工具的单独成功率,构建一个先验画像。这就像药物临床试验——在给病人开复方药之前,先搞清楚每种单药的有效率。

#### 2. Deciding-Tool Attribution(决定性工具归因)

一条成功轨迹里可能调用了 5 个工具,但真正决定成败的可能只有第 3 个。如果简单地把"出现在成功轨迹里"当作有用信号,就会把搭便车的工具也当成功臣。Deciding-Tool Attribution 只标注那个直接导致攻击成功的工具,给技能蒸馏提供更干净的信号。

这个设计让我想到多智能体强化学习里的 信用分配问题:当一群 agent 合作完成任务时,怎么区分谁的贡献最大?RedEvoAgent 用的方法很朴素但很有效——看谁在最后一步扣动了扳机。

#### 3. Validation Ratchet(验证棘轮)

这是最关键的设计。每次技能蒸馏出一个候选更新,不是直接采纳,而是放到独立的验证集上测试。只有当候选技能在验证集上的攻击成功率严格超过当前技能时,才接受更新。否则保留旧技能,把失败的候选记录下来作为"拒绝上下文",指导下一轮探索。

"棘轮"(ratchet)这个词用得很精准——机械棘轮只能朝一个方向转,不会倒退。技能进化也是:可以不进步,但绝不能退步。这和生物进化的"自然选择"机制异曲同工:突变是随机的,但选择是严格的——只有适应度提升的突变才被保留。

数据说话:技能进化的实际效果

在 Agent Security Bench (ASB) 和 AgentHarm 两个基准上,RedEvoAgent 对比了两类基线:6 种孤立攻击工具和 2 种自动红队方法(RedCodeAgent、MAJIC)。

攻击有效性:以 Claude Code 挂载 DeepSeek-V4-Flash 为目标,RedEvoAgent 在 ASB 上达到 99.3% ASR,而最强的孤立工具 FlipAttack 只有 96.4%。在 AgentHarm 上,RedEvoAgent 的 HarmScore 达到 74.4,而 FlipAttack 是 67.9。看似差距不大,但在安全测试语境下,5 个百分点的漏洞差异可能意味着一批新的攻击面被发现。

工具效率:这是更重要的指标。RedEvoAgent 的进化技能在达到最高攻击成功率的同时,平均每案例的工具调用次数最少。ASB 上从 3.0 次(无技能)降到 1.8 次(进化技能),AgentHarm 上从 2.6 次降到 0.9 次。这意味着技能不仅让攻击更有效,还让攻击更精准——知道什么时候该出手,什么时候该收手。

消融实验:去掉 Tool-Effectiveness Profile,ASR 从 93.2% 降到 76.9%(下降 16.3 个百分点);去掉轨迹收集,降到 85.0%;去掉 Deciding-Tool Attribution,降到 87.5%。工具有效性画像的贡献最大——没有它,技能进化就像没有地图的探险,容易迷失方向。

跨攻击者和跨执行环境的迁移

进化出来的技能文档能不能迁移?答案是肯定的。

把在 Claude Code 上进化出的技能直接拿到 Codex 上用,攻击成功率没有显著下降。把攻击者模型从 GPT-4o 换到 Claude Sonnet,技能依然有效。这说明技能文档捕获的是目标模型的通用弱点模式,而不是某个特定攻击者-目标组合的偶然特征。

这个结果让我想到一个类比:一本好的钓鱼指南不会因为换了钓鱼的人就失效,因为它描述的是鱼的习性,不是钓鱼者的手法。RedEvoAgent 的技能文档本质上是在描述"LLM 智能体的安全弱点习性"。

更深层的启示:安全测试的范式转移

RedEvoAgent 的意义超越了"又一个越狱工具"。

从攻击到防御的镜像:如果攻击技能可以进化,防御策略为什么不能?想象一个镜像系统——DefEvoAgent,每次被攻击后蒸馏防御技能,在验证集上测试防御效果,只接受有提升的更新。攻防双方都在进化,形成真正的军备竞赛,而不是静态的攻击-补丁循环。

技能作为可审计的制品:传统的黑盒攻击方法是一个不透明的优化过程,人类很难审查"为什么这么攻击"。RedEvoAgent 的技能文档是自然语言写成的,人类可以直接阅读和理解——"哦,原来 GCG 在这类 prompt 上效果最好"。这为安全审计提供了可解释的中间制品。

对齐研究的新视角:技能进化的成功暗示了一个更深的道理——对齐不是一个状态,而是一个过程。模型的安全对齐不是一次性训练就能完成的,它需要在持续的对抗测试中不断修正。RedEvoAgent 提供的不是一个最终答案,而是一种持续改进的机制。

局限与展望

论文坦诚地承认了局限:性能依赖工具箱的强度和多样性。如果工具箱里只有锤子,技能进化再久也只会拧螺丝。未来的方向可能是让技能不仅学习"怎么用工具",还学习"需要什么新工具"——从工具使用者进化为工具创造者。

另一个值得探索的方向是 技能的可组合性。如果攻击技能可以像函数一样组合调用,红队测试就能从"单技能进化"升级到"技能生态进化"——多个专门技能协同工作,形成更复杂的攻击策略。

结语

RedEvoAgent 做了一件漂亮的事:它把红队测试从"反复试错"升级为"经验积累+验证筛选"的闭环学习系统。三个核心机制——工具有效性画像、决定性工具归因、验证棘轮——分别解决了"先验知识从哪来""信号怎么去噪""进化怎么不退步"三个问题。

在 AI 安全测试越来越重要的今天,这种让攻击智能体自己学会打攻击的方法,可能比任何具体的攻击技术都更有价值。因为具体的攻击技术会过时,但"如何系统性地学习攻击"这件事,永远不过时。

---

*本文基于 arXiv:2608.27439(RedEvoAgent,2026 年 8 月)撰写。论文作者:Junjie Zhang, Hui Liu, Kecheng Chen 等,来自香港城市大学和深圳北理莫斯科大学。*

暂无表态