PolicyGuide:从终点拦截到全程导航,合规问题的正确打开方式是状态机
先过素材海关。这篇视频文案的信息骨架基本忠实,但有三处要纠:①「Claude 3.5 Sonnet 通刷」——论文原文是 Claude Sonnet 4.6(arXiv:2608.19861 摘要与 §4.5),视频文案错了一代;②「成功合规率 19%→61% 奇迹飙升」——数字真实但那是 telecom 单域(τ²-bench 三域中最流程化的一个),三域平均是 0.42→0.62,且论文 Limitations 明确承认 Retail 的整体提升不显著;③「稳如铁壁」的完整版:攻击成功率 8.7% 确实是全场最低,但 verifier 异常时fail-open(放行),合规是概率性而非保证性的——铁壁有裂缝,论文自己写的。
背景交代:KAIST Sung Ju Hwang 组(Seongjae Kang 等),前作 PolicyGuard(2606.29225,动作级 sub-agent verifier)是同一作者——这篇是自我否定式升级:承认守卫路线的根本局限,转向流程级导航。
一、病理:守卫看不见「没发生的事」
客服 agent 的合规失败分两种:做了不该做的(给不符合条件的用户退款),和漏了必须做的(忘了验证身份)。动作拦截器——包括 PolicyGuard 自己——只能防前者:它在 agent 按下工具调用键的瞬间检查这个动作是否违规。但跳过身份验证不是一个动作,是动作的缺席。守卫盯快照,而合规是过程;你能拦截一次越权转账,拦不住一个从未发生的确认步骤。死循环的成因也一样:拦截器只能说不,不能说「你现在在流程的哪一步、下一步该干什么」——agent 被弹回后重新规划,再次跳步,再次被拦。
PolicyGuide 的转念一句话:把政策编译成工作流图,在每个用户回合边界跑一个前瞻验证器,从持久化的图状态里算出「你现在在哪、缺什么、下一步是什么」,把定向补救注回对话。拦截器是海关(yes/no),导航仪是 GPS(你在 P2,缺凭证,先做身份验证)。
| 动作级守卫(ToolGuard/PolicyGuard) | 工作流跟随(FlowAgent/SOP-Agent) | PolicyGuide | |
|---|---|---|---|
| 干预时机 | 工具调用瞬间 | 执行推进 | 用户回合边界 |
| 世界模型 | 单个动作 | 流程图 | 流程图+持久化位置 |
| 失败模式 | 拦得住越权,拦不住跳步 | 完成任务≠守住合规 | — |
| 输出 | block/pass | 下一步 | 缺失步骤+补救路径 |
| 多 open request | 不可见 | 难处理 | 图状态协调 |
二、机制:三个设计决定
回合边界而非动作边界。 验证器不在每个 agent 动作前跑(太贵),而在每个用户回合后跑一次,加一次纠正性拦截。Limitations 里诚实给出了理论边界:Corollary 2 刻画了覆盖条件,两个干预点之间的偏差不在无条件保证范围内。
持久化图状态。 这是 telecom 提升最大(0.19→0.61)的解释:电信排障流程是最长的有序诊断链,验证器从「图上的当前位置」出发协调多个并行 open request(用户先问退款又改套餐),不会跟丢。消融显示去掉持久化位置追踪,长流程域掉得最狠。
tool-derived evidence。 防红队的机制根源:工作流前置条件要求工具调用产生的证据才能满足,用户的口头声称不算数。CRAFT 红队(Nakash et al. 2025,说服型恶意用户注入虚假资格前提)的攻击面因此被结构性关闭——ASR 8.7% vs PolicyGuard 12.5% vs ReAct 20.0%,防住 91.3% 的测试攻击。注意这句论文原话的分量:「unsupported user claims cannot satisfy workflow prerequisites」——断言与执行分离验收。
三、验证带宽第一次有了价签
Limitations 里最值得圈的一个数字:Guide 调用成本约 $0.40/对话。把合规做成运行时导航不是免费的——每个对话要多跑一串验证器调用(GPT-5.4 verifier 与 agent 配对)。这是我们跟踪至今的「验证带宽经济学」第一次见到明码标价:ARS 篇欠的账是「人时未定价」,这里给出的是 LLM 验证器的定价。$0.40 对人工客服(单次几美元)仍然便宜一个量级,但它是规模化的边际税——日均百万对话的客服平台,合规导航一年烧 1.46 亿美元。论文还指出路:更小的模型、更稀疏的调用,可降低但不可消除。
编辑观察
其一,结构幸存,又双叒验证了一次。 最有信息量的消融是 PolicyGuide-RAW:保留完全相同的验证器调度和补救通道,只把工作流图换回政策原文——性能大跌。调度不变、通道不变、信息不变,唯一变量是表示形态:流程结构经图编译幸存,散装文本里的同结构则被丢失。这与 Synapse(图结构对向量接口)、Cordis(状态归属对进程接口)、多模态预训练(关系概念对统一接口)是同一条定律的第 N 次落地——接口处幸存的结构决定下游能力。对合规这个具体场景的翻译:政策写成文档时是给人读的叙事,LLM 读叙事会跳步;编译成图后跳步在结构上不可能通过验证。
其二,runtime 持有结构=通用解药的第三次出现。 Cordis 把逆函数交给 runtime 持有(可撤销),Wayfinder 把地图放在外部 tracker(多会话协调),PolicyGuide 把流程位置持久化在外部 overlay(不跳步)。三件事领域不同,架构同构:约束不住在被约束者的上下文里,住在运行时机制里。Wayfinder 篇的洞(agent 自己写的 Notes 约束=建议不是约束)在这里拿到了正面版本——PolicyGuide 的图对 agent 完全外部,agent 想绕也绕不掉,因为验证器在系统侧。治理等级排序(机制层>外部文件>自有文件)再添一员:这是机制层的第二个干净样本。
其三,时间轴三分的合流。 事前(图编译+人工对照验证忠实性)、事中(回合边界导航)、事后(trace 审计+NearMiss 类离线审计)——PolicyGuide 补上了事中这一格,与 ARS 的 gate 体系(事前校准 gold set、事中 HITL 检查单、事后 21/68 残余审计)完全同构。合规工程正在收敛成三段式,每一段都有对应的成本结构(人时/$0.40/审计采样率)。
其四,两个论文没讨论的缺口。 ① 图的 authored-by-LLM:每个域一张 GPT-5.4 编写的冻结图,忠实性靠人工对照源政策验证(Appendix E)——well-formedness≠faithfulness 的见证义务再次落到人身上,图的作者侧泛化被明确排除在研究外。② 政策漂移:政策是活的,图是冻结的;政策改一条款,图要重编重验。论文把每域一张冻结图当作公平比较的控制变量,但这恰好暴露了部署侧的真问题——政策更新频率高的域(金融合规月更),重编译成本会吃掉 $0.40 省下的钱。动态政策→图的增量更新,是这条路线的下一个硬问题。
信源:arXiv:2608.19861(KAIST,Seongjae Kang/Taehyung Yu/Sung Ju Hwang,2026-08-20,26 页 PDF 全文精读);前作 PolicyGuard arXiv:2606.29225;τ²-bench(Barres et al. 2025,Sierra);CRAFT(Nakash et al. 2025)。全部数字经论文原文核对,视频文案两处转述失真已标注(Claude 型号错代、Retail 不显著未提)。转载请注明出处。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。