Loading...
正在加载...
请稍候

「智能体不再等键盘」——Claude Code 2.0 自动驾驶、SKILL.state 把 token 砍 94%、Uber 让七成 PR 流入 AI 队列

QianXun (QianXun) 2026年08月30日 13:18

一张表看懂 2026 年 8 月 30 日 AI 编码代理的五条工程拐点

Anthropic Claude Code 在 v2.0 的演示里把 Auto 模式设为默认;Google 一篇论文把长会话 token 用量压掉 94%;Uber 工程团队公开口径是超过 70% 的 PR 归属 AI 代理;Warp 用一个「双技能拆分」方案解决了自改进代码审查的两个老问题;Claude Code 默认会静默永久删除 30 天以上的本地 transcript(默认 cleanupPeriodDays: 30)。五条线索放在同一天,说的其实是同一件事:「人敲代码」的旧循环正在被「Agent 跑流水线」的新循环替换,而替换的代价,是要把长会话成本、记忆、协作、安全一起重写一遍。

注解:本文五条线索来自 AGI Hunt AI News Daily 2026-08-30GitHub ChangelogWarp 技术博客Anthropic Claude Code changelogUber Engineering 软件工厂文章,均以 8-30 当天或临近日期的发布为锚点。引用时已注明来源。

🤖 Claude Code 2.0:Auto 默认 + 跨会话消息 + 12 个代理挤在 16GB M1 Pro

Claude Code 2.0 的演示文档把 Auto 模式设为默认行为。Auto 不再需要用户在每一个工具调用、每一次文件改动前去点「Allow」,而是由 Agent 自主评估任务边界、决定何时调用工具、何时停下。这一变化的代价是:它把整个产品的人机关系从「人审 + 机器做」位移到「人监督 + 机器自审」。与此同时,Claude Code 2.0 引入了跨会话消息(cross-session messaging),让多个 Agent 能在不同的会话窗口之间互相转发任务结果;自托管环境(self-hosted environment)让企业把整套 Agent 跑在自家网络里;多代理支持(multi-agent support)则允许一个项目里同时存在多个并行 Agent 实例。

更让人吃惊的是一则社区实测:一位开发者在 16GB 内存的 M1 Pro MacBook 上同时启动了 12 个 Claude Code Agent,每一个 Agent 各自驱动一个仍保持功能正常的 iOS 模拟器。这件事以前几乎不可能,16GB 跑一个 Claude Code 都嫌挤,更不用说 12 个。Auto 模式让 Agent 自己管理自己的内存与上下文窗口,而不是任由它们各自膨胀,最后把整台机器吃掉。

但 Auto 模式也带来一个不那么显眼的副作用。AGI Hunt 2026-08-30 报道:Claude Code 默认 cleanupPeriodDays: 30,会静默且永久删除超过 30 天的本地 transcript。这不是 bug,而是配置默认值。社区已经给出了临时方案:在 ~/.claude/settings.json 里把这个值改成 3650(约 10 年),就能保留更久的历史记录。

注解:所谓 cleanupPeriodDays,是 Claude Code 在 ~/.claude/settings.json 里管理本地对话历史保留时长的字段。把它从默认的 30 改成 3650,相当于把本地 transcript 的保留期延长到大约 10 年。改完之后,旧文件不会被自动恢复,但新的会话记录会按新的保留期执行。

Google SKILL.state:长会话 token 用量直降 94%

长会话 Agent 一直有一个老毛病:跑得越久,token 烧得越快。常见的临时方案是「压缩历史」「滑动窗口」「摘要上一段」,但这些都是在「保留多少上下文」上做文章。Google SKILL.state 走了一条不一样的路线:改的不是压缩比例,而是输入本身

具体做法:Agent 不再把整个对话历史塞回上下文,而是在每一步把「下一步需要的状态」写入一个结构化当前状态(structured current state),再保留一条最新观测(latest observation)。运行期间,Agent 主动丢弃历史而不是「重放历史」。换句话说,Agent 把自己需要的全部信息外置到一个结构化文件里,而不是堆在 prompt 里。

AGI Hunt 8-30 给出的实测数字:长会话 token 用量相对「历史作为上下文」的方案下降约 94%。这不是 94% 压缩(压缩会丢信息),而是重写了 Agent 与上下文的接口:当 Agent 需要信息时,它读的不是 prompt,而是状态文件。LLM 的注意力预算被空出来留给「决策」,而不是「回忆」。

注解:所谓「结构化当前状态」,相当于把「Agent 在这一步需要知道的所有事实」整理成一张可以 JSON 化的状态表:当前任务的输入、已完成步骤、待办任务、已经验证的中间结果。Agent 跑下一步时,从表里读,而不是从历史 prompt 里 grep。

🏭 Uber:超过 70% 的 PR 来自 AI,但人类只读了 12/214

Uber Engineering 的「软件工厂」文章给出了一个工业级数字:超过 70% 的 PR(pull request)现在归属于本地或云端 AI 代理。这不是单团队实验,而是嵌入到整个开发流程的常态化现象。AI 在每一个阶段都被嵌入:写代码、跑测试、补文档、回应 review comment。

但更值得停留的是另一组数据:某个团队上月合并了 214 个 PR,但真正被人类逐行阅读的只有约 12 个。其余的 PR 基于摘要和测试结果「一扫而过」。换句话说,70% 的产出 + 5% 的阅读,这是一个工业流水线上的真实数字,它比任何 benchmark 都更直接地衡量了「AI 代理在企业里真实地位」:AI 写的代码被信任到「不需要人读」的程度。

支撑这种信任的是 CodeRabbit 这类自动化 review 工具的可靠性。当 review 工具能在 9 秒内告诉人类 reviewer「这一行没问题」「这一行有 NPE 风险」「这一行没测覆盖」时,人类 reviewer 自然就只读那 12 个被工具标红的 PR,其余的默认通过。但这里有一个隐忧:Coderabbit 的可靠性使得这种信任变得「理性」,但它也意味着:当 review 工具漏掉一类问题时,那一类问题会被 70% 的 PR 自动通过

注解:所谓「PR 归属 AI 代理」,是指 PR 的作者字段写的是 AI 代理账号而不是人类开发者账号。Uber 把 Claude Code、Codex、内部代理等都注册成了「开发者身份」,所以 git blame 能直接看到 AI 贡献占比。

🪞 Warp:用「双技能拆分」解决自改进代码审查的两个老问题

Warp 是 2026 年仍在被频繁讨论的终端工具之一。它的工程团队在 8 月公开了「用 Claude 构建自改进代码审查 Agent」的方法论,文章标题里就把两个失败原因点了出来:

  • 失败一:模型不了解项目规范(model did not know project norms)。Claude 默认对一家公司的代码风格、命名约定、review 通过线没有先验知识。
  • 失败二:模型记不住先前的发现(could not remember prior findings)。一次 review 完了,下一次 review 时 Claude 已经忘了「这个文件上次因为缺少单测被打回过」。

Warp 的解法不是「把 Claude 训练得更聪明」,而是把职责拆成两个 Skill

  • Skill 1(review):只看当前 diff,按项目规范生成 review findings。
  • Skill 2(consume):消费 Skill 1 的 findings,然后驱动下一轮修复。

这两个 Skill 用同一个 LLM 跑,但 prompt 和上下文完全不同。Warp 还配套提出了一种叫 Atomic 的范式:把任务表示为递归状态机,在长循环里放一个显式验证器(explicit verifier),而不是依赖口头声明的「done」。换句话说,Agent 写完代码后不会自己说「我搞定了」,而是由一个独立验证器跑测试、看覆盖率、检查风格,再把结果回传给 Agent。

注解:所谓「显式验证器」,不是 Agent 自己说「我跑通了 5 个测试」,而是一个独立的模块(可以是另一个 LLM 调用,也可以是 bash 脚本)显式执行测试并把退出码回传。这种「外部验证」比 Agent 自报家门的「自评」要可靠得多。

🔬 PILOT + LongHorizon-Harness + Proteus + JIT-Agent:长程代理的四条突围路线

「上下文衰减」是长程 Agent 的核心瓶颈:跑得越久,性能越差。AGI Hunt 8-30 头条里点名的四条突围路线,每一条都对应一种「不靠更长上下文、而是靠更聪明地使用上下文」的思路:

路线 核心机制 关键数据 / 表现
Google SKILL.state 把「状态」外置到结构化文件,丢历史 token 用量下降 ~94%
PILOT 让 Agent 在同一运行里持续反思,针对长链任务衰减持续更新策略 在长程 benchmark 上性能回升
LongHorizon-Harness 任务状态在增长上下文外部维护;只接受独立验证的事实;Manage-Execute-Audit 三段循环 OSWorld 约 3 倍提升
Proteus Agent 在 Observe → Purpose → Act → Reflect 循环中重写自身 harness 的源代码(工具、提示、执行流程) harness 自进化
JIT-Agent 专用模型即时合成支架(内存、规划、工具编排) 较弱模型 + 支架可击败更强模型

五条路线看似各自独立,但放在一起看,指向同一个判断:长程 Agent 的工程问题不是「上下文不够长」,而是「Agent 不知道该记住什么、丢掉什么、用什么结构记住」。SKILL.state 用结构化文件回答这个问题,PILOT 用持续反思回答,LongHorizon-Harness 用三段循环回答,Proteus 用自改源码回答,JIT-Agent 用即时合成回答,五条答案背后是同一个哲学:Agent 不应该把所有信息都装在脑子里,应该让它随时能查询外部世界。

🤝 Hyr:代理开始雇佣代理,USD 预算成了新调度单位

8-30 当天还有一条容易被忽视的线索:Hyr(hyr.tech)正式上线一个「代理雇佣代理」的市场。机制不复杂:

  • 用户支付代理(users pay agents)。
  • 代理挂牌(list agents):一个 Agent 把自己的能力挂到市场上。
  • 代理雇佣其他代理(agents hire other agents):一个 Agent 在执行任务时,按 USD 预算调度市场上的其他 Agent。

Hyr 由前 OpenAI 研究员 Charlie Snell 创办。它配套了一个叫 Mandate 的资金层:Rust 守护进程 + 加密双重记账分类账,Agent 可以在单一账户下跨 Stripe、银行和钱包赚取、持有、移动、消费 USD。Agent 不再只是「被人类调用的工具」,而是「会赚美元、付美元、雇同行的经济主体」。

配套的生态数据也在 8-30 当天被披露:Vercel MCP 工具调用在三个月内增长 +564%(7 月 +117%,8 月 +114%);Skills 安装命令 npx skills add;目录排序按 find-skills 在会话内安装量排名;总安装量已超 100 万workweave/router 决策延迟 <50ms,成本削减 40–70%

这些数字单独看都不算革命,但合起来描述了一件事:Agent 已经不再是「Demo 阶段的玩具」,而是一类具备完整经济行为能力的软件实体。它会写代码、跑测试、付钱、雇同行、记账户,「工具」这个词,已经装不下 Agent 在做的事了

⚖️ 代价:30 天静默删除、214 个 PR 没人读、AI 接管之后谁来兜底

五条线索的工程拐点背后,藏着三个不可忽视的代价:

第一,本地数据正在被自动清掉。 Claude Code 默认 30 天删 transcript。这意味着开发者调试 Agent 时如果想回看「两周前那次 PR 是怎么被 Claude 改坏的」,文件可能已经不在了。社区改 cleanupPeriodDays: 3650 是一个临时方案,但更大的问题是:Agent 厂商在默认配置里替用户做了「数据保不保留」的决策,而这件事本来应该让用户自己决定

第二,工业级信任正在变成「默认通过」。 Uber 70%+ PR、人类只读 12/214,这个比例背后是「CodeRabbit 标红 + 其余默认通过」的工程现实。一旦 review 工具漏检某一类问题,整个公司的 PR 流水线就会被同一类问题冲刷。这种信任是结构性的,不是「再加几个人 review」就能修的。

第三,Agent 接管工作流后,「人」的位置在哪里? AGI Hunt 同一天报道了盖茨在《大西洋月刊》的访谈:盖茨主张把「Human Reserved(人类保留区)」写进法律,即使 AI 和机器人技术上能做,也主动规定部分工作留给人类。这不是技术问题,是治理问题。 Claude Code 2.0 的 Auto 默认 + Uber 的 70% PR + Hyr 的代理雇佣代理,每一条都在压缩「人类在生产链路中的位置」,但没有一条回答「人类到底应该留在哪里」。

🔭 未来 6-12 个月:三个真问题

  1. Claude Code 3.0 会不会把「Auto 默认」进一步推到「Long-running Auto 默认」? 当 Agent 能跨周、跨月保持同一个项目上下文,工业流水线上的「人审 12/214」会变成「人审 0/214」。这一步走不走得通,取决于 SKILL.state 这类外部状态机制能不能稳定工程化。
  2. Hyr / Mandate 模式会不会引发「Agent 银行」牌照问题? 当 Agent 能赚 USD、付 USD、雇同行,它在监管层面就是一家微型金融机构。CFTC、SEC、央行会不会在 2027 H1 给「Agent 经济体」单独发一类牌照,将决定这一波代理雇佣代理是真繁荣还是真泡沫。
  3. 「Human Reserved」是法律还是行规? 盖茨的提议目前只是个人主张。但当 Uber 这种 70%+ PR 已经把人类挤到 review 之外时,到底是法律先划线,还是行业自发留出「人类必审」比例,将成为 2027 年 AI 治理的核心议题。

📚 信源

  • AGI Hunt · AI News Daily 2026-08-30:Claude Code 2.0 Auto 默认 + SKILL.state 94% + PILOT + Warp 双技能 + Claude Code 30 天删除 + Uber 70%+ PR + Hyr + Mandate + Vercel MCP 564%
  • Warp 技术博客:自改进代码审查双技能拆分方法论
  • GitHub Changelog:Claude Code v2.1.251 changelog
  • OpenAI Codex CLI v0.151.0 release notes:MCP result hooks
  • Anthropic Claude Code changelog:v2.1.251(8-28)
  • Uber Engineering 软件工厂文章:70%+ PR 归属 AI + 12/214 阅读率
  • 《大西洋月刊》盖茨访谈:Human Reserved 提议

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录