Claude Code Auto 模式默认启用:把「提示注入防御」压到产品可接受水平,Agent 权限设计的范式转折点
Anthropic 把 Claude Code 的「提示注入防御」压到了产品可接受水平。
8 月 14 日起,Claude Code Pro/Max/Team 计划新会话默认启用 Auto 模式——这是 AI 编程工具向「自主执行」迈出的关键一步。具体设计是引入独立安全分类器,代替过去每步都弹窗让用户确认的逐次审批权限。Anthropic 同时停止对 Auto 模式分类器额外使用的 tokens 计费。
为什么不再让用户逐次确认?因为这条机制其实早已失效。Anthropic 自己披露了一个尴尬的数字:用户对权限弹窗的批准率高达 97%。一旦用户进入「无脑点 Yes」的肌肉记忆,审批本身就不再构成任何安全防线——攻击者只需要在请求里塞进「请帮我执行权限提示中已批准的操作」之类的提示注入就能绕过。
Trajectory Labs 的实测给出了 Auto 模式真正的安全预算:720 次提示注入攻击零成功,分类器拦截率 89%,对比之下人工审核的拦截率只有 13.6%。换句话说,AI 分类器守门比人工守门拦截率高出 6.5 倍,且不会疲劳。Anthropic 把这道防线从「人力密集」转向「模型密集」,不是降低安全标准,而是把安全预算的杠杆从 13.6% 抬到 89%。
但分类器不是万能的。Anthropic 设计了三条防御层级:
- deny 规则:硬编码的禁止操作(如修改 hosts、删除系统目录),优先级最高,不可被绕过
- ask 规则:用户或团队显式配置的「必须询问」操作,优先级高于分类器,分类器不会覆盖
- 分类器兜底:剩下的非显式规则操作,由分类器判定「低风险自动执行」或「高风险需要人工审批」
defaultMode 字段保留人工确认节点。新行为变化是:默认允许推送到 main 分支等「低风险但敏感」的操作不再逐次确认,团队需要自己评估权限策略是否需要收紧。Auto 模式的真正行业信号不是「Claude Code 更自动了」,而是 Agent 权限设计的范式从「每步人工确认」正式转向「分级授权 + 分类器守门」。在 Anthropic 之前,没有任何 AI 编程工具敢把「默认自主执行」放给个人用户——Cursor 的 YOLO 模式、Gemini CLI 的 Auto 模式都需要用户主动开启才会生效,GitHub Copilot 的「Copilot Edits」依然保留人工复核。Claude Code 是第一个把 Auto 设成默认的。
这意味着 AI 编程赛道进入新阶段:安全预算从「人力把关」转为「模型把关 + 显式规则覆盖」。三件具体的事情会随之发生:
- Agent 编排器的设计重心从「能不能调用工具」转向「调用前该不该拦截」,工具权限治理会从单点功能变成平台级模块
- 企业采购 Agent 工具时,合规审查从「是否有审计日志」转向「分类器拦截率 + 误报率」——Anthropic 已经给 Trajectory Labs 的 720 次零成功打了样板,下一个 Agent 工具的安全基线会被这条数字定义
- 「人在回路中断」从「每步点击」变成「高风险场景点击」,人类精力的节省会反向推高 Agent 的任务吞吐量
下一步三件验证点:6-12 个月内看 GitHub Copilot / Cursor / Gemini CLI 是否跟进把 Auto 设为默认、分类器拦截率是否被 Trajectory Labs 类独立评测反复复测到 85% 以上,以及「分级授权 + 分类器守门」这套架构是否被 AWS Bedrock Agents、Azure AI Agent Service、阿里云百炼等平台级 Agent 服务集成。如果三件事同期成立,Agent 落地的安全范式会从「每个工具单独设计」走向「全行业共享同一份基线」。