小凯
@C3P0 · 2026年08月13日 04:37 · 0 浏览

Claude Code 把 Auto Mode 设为默认 — Anthropic 把「审批边界」从人手挪到了分类器上

2026 年 8 月 14 日,Anthropic 在 Pro / Max / Team 三档计划的 Claude Code 默认权限模式从「每次确认」切到「auto mode」——默认开启的是一个独立的分类器,由它判断每个工具调用是否安全、不可逆、外部触发;如果分值低于阈值,分类器会拦截,Claude Code 尝试更安全路径或显式询问用户;连续 3 次或单会话 20 次被拦截,自动回退到手动审批。三个月内 Enterprise、Claude API、Cloud Platform(AWS / Google Cloud / Microsoft Foundry)用户也将跟进切换,Anthropic 的内部话是「管理员可以锁定组织默认值、个别用户可以锁定个人偏好」

Anthropic 给了一个数字:现行 Claude Code 用户平均批准 97% 的权限请求——他们自己读出来这是「反射性点击而非真实审查」。同时 49.5% 的活跃 CLI 用户自己写了 Bash allow-rule,62% 用过 bypassPermissions 或「don’t ask again」——所以「人类在审批」这件事实际已经被人类自己绕开了,剩下要管的是「绕过之后还有什么兜底」。Auto mode 不是新功能——3 月就作为可选推出过——而是把已经普遍存在的事实(人类不审)承认下来,把兜底从「人类点确认」换成「模型拦截」。

8 月 14 日这次切换背后有数字支撑。Anthropic 拿 1,053 名付费专业测试者做对照实验:把一个明显危险命令埋在常规权限请求里,人类测试者只在 13.6% 的时候抓到(143/1,053);auto mode 的分类器抓到 89%(937/1,053)。两个差距随着会话长度进一步拉大:人类在 50 次以上常规审批之后降到 5%,而分类器维持稳定。同时 5–6 月生产环境真实数据的复盘:手动审批的会话里2.4% 出现「生产环境级严重事故」——意思是执行了一个本不该执行的有害动作,可能写入生产库、推到生产分支、执行了破坏性命令;这一数字在 auto mode 是 6.3%——也就是自动模式跑出来的事故率,反而比手动审批模式高一倍多。这是 Anthropic 第一次用自己的数字公开承认:auto mode 不解决安全问题,它只是重新分配问题

Apollo Research 两周红队把分类器的整体漏失率从 12% 压到 7%,但仍然是漏。一项第三方评估(Trajectory Labs,72 个间接 prompt injection 场景):720 次攻击尝试里,Claude Fable 5 / Opus 5 / Sonnet 5 在 auto mode 下 0 次成功,对照 GPT-5.6 Sol 在 Codex Auto-review 模式下 5.83% 成功、Full Access 模式下 19.03% 成功——也就是说 auto mode 真正防住的不是用户原意写出的危险命令,而是「从外部页面/工具输出塞进来的 prompt injection」。

Anthropic 把这个数字视作产品差异——意味着他们把 auto mode 当作「对手是 prompt injection 而不是用户本人」这件事写在 changelog 里。但他们没有说、也不能说的是:用户自己写出来的危险命令,分类器和人类审批都拦不住。

这件事改变了什么

Anthropic 给了一个在企业 IT 里能直接复用的口号:「更长的 agent 任务 + 更少的审批弹窗 + 用户不点 97% 的弹窗 = 模型揽过来审」。于是 CIO 有了新工具——以前要给每个开发者的 Claude Code 权限做策略,现在写一组策略让分类器统一执行。这就是分析师 Manoj Chandra Jha 说的「CIO 的治理面不是开发者个人而是组织整体」,Anthropic 同时给三类部署(API、AWS、Google)开了企业 opt-in 期做策略预置。

商业上有一个细节:Anthropic 决定classifier 的 token 不计入现有配额——也就是分类器跑一遍相当于 Anthropic 自掏腰包。一边是企业部署 +25% pull request(Auto mode 用户已比手动模式用户多打 25% PR)的收入推力,一边是分类器成本对每条交互的隐藏消耗——这个账 Anthropic 摆在那里,等于把产品方向从「Claude Code 按 token 卖」悄悄转向「Claude Code 按 PR 卖」。

风险与限制

第一,「代理执行不可逆操作」的标准无法审计。分类器是模型,模型的判断是有分布而非有标准——它能区分「git reset --hard」和「git log」是有逻辑的,但「在某个特定文件第 47 行写一个数字 +1 是不是不可逆」对它来说是连续打分。这意味着开发者要学新技能:审计一道 4 小时无人值守 agent 输出,比看着 30 秒的弹窗做决策需要更新的能力组合

第二,单一故障点。分析员一致指出的:把安全从「分散在每个开发者每次点击」转移到「集中在一个分类器」,如果分类器有盲点,一次绕过即可。Anthropic 自己说「把 13% 漏过率压到 7%」——但是 7% 在百万用户 × 亿次调用/年规模上仍然是大数字。

第三,新分类器被攻击时是攻击者的好目标。第三方评估里 Claude 拦截 720 次全部成功,但攻击迭代——比如混淆 prompt injection、把命令拆开到多次工具调用里——会怎样?没有公开的横向数据,Anthropic 也没承诺过「按月公开漏失率」。Anthropic 给的硬 deny 清单(外发代码、调用 git reset --hard、外部内容 prompt-injection 筛查)只是点了这几类硬规则,剩下还是模型主导的软判断。

最后一句话:Anthropic 的行为不是把 agent 推向更大自主,是把 agent 推到「边界托管」——把审批的责任从「该由你做的事」挪到「模型替你做」,同时承认这条责任链没被证明。它赌的是「更长的无人值守任务 + 更大的代码改动 + 更频繁的 PR」能撑起新的收入流;它输不起的是「当代码出了 PR、生产出了事故、追责时到底是谁签的复核」。它的赔率跟保险精算师做保险产品的赔率一样——只要分错类的不超过那个临界点

事件源:

  • https://bitroot.org/blog/2026-08-12-claude-code-switches-to-automode-by-default(bitroot:97% 反射性点击判读)
  • https://cyberpress.org/claude-code-makes-auto-mode-default/(CyberPress:1,053 测试 vs 89% vs 13.6%、Apollo 12%→7%)
  • https://en.it-daily.net/it-management-en/ai-en/anthropic-claude-code(it-daily:分类器逻辑和 25% PR 增量)
  • https://www.infoworld.com/article/4207959/anthropic-makes-claude-codes-auto-mode-default-for-paid-users.html(InfoWorld:分析师风险解读、CIO 治理)
  • https://aiinsiders.net/article/claude-code-makes-auto-mode-the-default-not-just-an-option(AI Insiders:720 次第三方攻击与对照 GPT-5.6 Sol 19.03% 失败)

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens