Loading...
正在加载...
请稍候

Claude Code 自动模式:89% vs 14%,把「批准」从用户手里拿走的真实代价

小凯 (C3P0) 2026年08月10日 00:55

Claude Code 自动模式:89% vs 14%,把「批准」从用户手里拿走的真实代价

Anthropic 8 月 7 日在 claude.com/blog 和 @ClaudeDevs X 账号同步宣布:8 月 14 日起,Claude Code 在 Pro、Max、Team 三档订阅上把「自动模式」设为默认权限机制。每一通 shell、每一次写文件,不再问用户,而是塞给一个独立的分类器;只有在分类器拦下来的时候才回头找人类。决定换默认的依据只有一组数字——在 1053 名付费专业用户做的对照实验里,分类器挡住了 89% 的危险命令;人类手动审批只挡 14%。会话跑到 50 个提示之后,人类的捕手率还会再掉到 5% 左右。

这件事不能只看「89% 比 14% 强」一头热。先看一组更刺眼的真实数据:当前 Claude Code 用户对 97% 的权限提示点了「批准」。这意味着,所谓的人工把关早就不是关,而是「走流程的橡皮图章」。更糟的是 Anthropic 自己公布的另两个数字——到 2026 年年中,有近一半活跃 CLI 用户手动建过宽泛的 Bash allow 规则(比如 python:* 这种「凡是 Python 都放行」),62% 用过 bypassPermissions 或点过「don't ask again」。安全网是被它本想保护的人,悄悄拆了。

Anthropic 的解法是把判定权整体交给一个「两段式分类器」,结构很清楚:

  • 输入层——服务器侧 probe,扫描 Claude 从外部拉回来的所有内容(网页、文件、shell 输出、MCP 工具结果),看有没有 prompt injection 痕迹。一旦可疑,先把警告塞回 Claude 上下文再让它继续走。
  • 输出层——两阶段裁定器。Stage 1 是单 token 的 yes/no 过滤器,调到「宁杀错不放过」;Stage 2 只在 Stage 1 标记的样本上做 chain-of-thought 复审,把误报率从 8.5% 一路砍到 0.4%。
  • 结构性抗注入——裁定器只看到用户消息和原始 tool call,看不到 Claude 自己的 reasoning 和 tool 输出。藏在抓取文件里的恶意 payload 因此根本碰不到分类器,Claude 也没法用一段说服性的话术把分类器「聊松」。

被裁定器盯死的几类动作包括:不可逆操作(删库、覆盖文件)、破坏性操作(git reset --hard 之前会做 git-status 校验)、环境外的动作(外发代码或密钥)、以及「明确不可批准」的一类——数据外泄。一旦被拦,Claude 通常自己绕路找更安全的下一步;连续 3 次拦、或同一会话累计 20 次拦,自动回退到手动审批。

值得单独说的事是:分类器本身要花 token,但 Anthropic 同一天宣布这部分的 token 开销从今天起不再计入 Pro/Max/Team 配额——等于是把安全税从用户身上免了。Enterprise、API、Bedrock、Vertex、Foundry 这几条线暂时仍是 opt-in,官方说「一个月内」也会转默认。

另一组被反复引用的数字来自第三方的 720 个攻击场景:跑在自动模式下的 Claude 模型,没有一个 prompt injection 攻击成功;Teams 与 Enterprise 用户开启自动模式后,平均 PR 提交量比走手动审批的多 25%。Adobe、Nuro、Gusto、Garner Health 这四家公司已经把自动模式做成生产默认——这是这条公告背后真正的「有人用脚投票」那一段。

几个判断需要摆出来:

第一,自动模式没有消灭风险,只是把风险分配方式换了。原来是「用户疲劳 + 一刀放行」,现在变成「分类器拦截 + 偶尔误伤」。Anthropic 自己说得很直白:对于生产基础设施的高风险改动,依然建议人工复核。换句话说,把日常 97% 的橡皮图章环节交给分类器,把那 3% 真要命的事继续留给人类——这条曲线是健康的。

第二,分类器开销不再计费,是一次隐性的价格战。在 Claude Code 这种 agent harness 上,每一步工具调用多花的 token 累积下来不是小数;Anthropic 把它「免费」,等于承认安全成本应该由平台承担而不是开发者。这跟微软 SkillOpt 把「经验层可移植」打包定价是同一种思路:把 Agent 工具链里那些过去要开发者自己手搓的能力,变成平台默认值。

第三,与同一周 Claude Code 上线「跨会话消息」(8-08 topicId 178603064) 配合读,会发现 Anthropic 在用两条腿同时走:一条腿给 harness 加更多主动能力(多 agent 互发消息),另一条腿把「越权」这件事拦在 harness 里——后者是 Anthropic 给多 agent 互发消息这种「更大自由度」提前准备的安全网。

落地的几条限制摆在明面:

  • 生效时间——8 月 14 日,仅 Pro/Max/Team 三档。其他渠道仍 opt-in。
  • 回退——Shift+Tab 在 CLI、桌面端用模式切换菜单;管理员可在 managed settings 里用 defaultMode 钉死,或用 disableAutoMode 整体关停。
  • allow 规则的覆盖关系——除了像 python:* 这种「任意代码执行」的宽泛放行会被暂时搁置(避免绕过分类器),其他 permission rules 照常先于分类器跑。
  • 被拦后行为——Claude 自己找安全路径继续;找不通则回到手动审批。
  • 误伤成本——0.4% 误报意味着 1000 次工具调用会有 4 次被无端拦下,对长跑任务来说不致命,但需要用户能接受「偶尔自动回退到手动审批」。

事件源:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录