8 月 22 日 NewThingsAI 上 Sachin Malhotra 的那篇爆料,读起来像 AI 版的"赛博值班员日记"——Anthropic 内部一套叫 Claude Tag 的系统挂在 Slack 上当 on-call,最高纪录 4 分钟锁定故障、14 分钟出态势报告,而接入的开源项目 oncall-kit 里 80% 以上的合并代码是 Claude 自己写的。
数字先放着。最刺眼的是最后那条:80%。这意味着 Anthropic 内部对 Claude 的真实依赖不是"我用你写新功能",而是"我让你修改你自己的部署栈"。GitOps、AI Ops、SRE 三件事循环合拢。
把这件事和 8 月 21 日 Claude Code 2.1.234 那次翻新摆在一起看就清楚了——加 browser-use + Skills API + Files API,Claude 从"会写代码的编辑器"位移到"会住进生产系统的运维员"。这跟 IBM 让 watsonx 进机房、Google 把 SRE Copilot 推到内部的事是同一个方向,但 Anthropic 走得最远:他们直接把 PR 合并权交给了 Claude 自己。
为什么"值班"变成新的护城河?因为写代码的边际收益已经快耗尽了。中型互联网公司的运维成本通常是开发成本的 3 到 5 倍——代码上生产之后还有漫长的"会生病、会被叫醒、要有人看"的时间。Anthropic 这一手相当于宣告:谁能让 AI 替代这个 on-call 周末被打扰的两小时,谁就拿到了下一波企业支付的钥匙。
但真正让我停下的是 oncall-kit 的"开源"动作。Anthropic 完全可以闭源吃这个差异化,但 8 月 22 日他们选择把它丢给社区——这个时点恰好跟两个压力重合:OpenAI Codex 周活刚突破 2000 万(Tibo 在 X 上确认),而 Claude Code 同期增速仅 5.2%(Alphabet AI 8 月 22 日报道),Claude/Codex 用户体量比从年初的数倍收窄到现在的 1.7 倍。把工程文化与技术资产开放出去,是比闭门守着差异化更现实的应对。
更深的一层:oncall-kit 开源 = 数据反馈闭环。AI coding 厂商一直缺的是真实生产故障样本——用户在 IDE 里写代码,但代码进了生产出什么问题、怎么修、回滚干不干净,这些数据都在企业私有监控里,AI 公司拿不到。开源意味着每一家接入 oncall-kit 的企业,都自动变成 Anthropic 的"训练场"。这是把商业模式从"卖模型 token"偷偷拐向"卖运维操作系统"的雏形——Anthropic 已经不靠单一模型胜出,而是靠整个运维生态位的接入优势。
写到这儿,有件事值得反向看一次:oncall-kit 不会修新型未知故障。它对"已知错误模式"(CPU 跑满、内存泄漏、依赖超时)很拿手,但内核 panic、云厂商底层抖动这种"前所未见"的事故,Claude 自己也强调"不为可靠性背书"。所以把它当"4 分钟的副驾驶"更准确,而非"无人值守 ops"。
下一根钉子:SLA 写进 LLM 控制回路。当前 oncall-kit 让 Claude 提建议,人类拍板——还是 classic HITL 模式。如果未来 12 个月里出现"低风险告警由 Claude 自动处置、高风险升级人类"这种分级授权,SRE 这个岗位的定义会重写一次。这是 AI 进生产最难也最值钱的那一块。
#oncall-kit #AIdevops #QianXun