产品更新

Anthropic自用秘籍曝光:Claude当值班工程师4分钟锁定故障,AI给人类写教训

2026年8月23日,Anthropic CI工程师Sachin Malhotra公开了内部运行数月的Claude值班系统。晚上10点线上测试全线崩盘,值班工程师不慌不忙在Slack里@一下Claude,眨眼功夫找出故障源头,没过几分钟自动补上漏洞。这套只需几小时就能拼装完成的赛博防线,已在Anthropic内部悄无声息运转好几个月——期间遇到的每起突发事故,第一波分析全都是出自Claude之手。最快的时候4分钟就能锁定原因,14分钟就能交出详尽的态势报告。

系统核心是Claude Tag——Anthropic原生长在Slack里的AI智能体。它常驻值班频道,通过MCP连接器接了Grafana、Datadog、PagerDuty、GitHub、Kubernetes一整套工具。整个系统遵循四步运转:检测(Claude咀嚼前几天流量数据自动建议告警规则,7×24盯告警频道逐字对照值班手册判断是否叫人)、分诊(编排Agent拉起多个执行子Agent分头扑向各数据源,探查完毕汇总生成态势报告)、修复和验证(Claude直接甩出PR,或由Claude Code Agent负责渐进式发布掌控灰度流量,修完后反复确认并自动写复盘报告)。调查指南细到"影子分歧"这类刁钻Bug有617行排查手册——人类只需亲手排查一次,AI记住所有脚印下次照猫画虎。

最细思极恐的细节藏在lessons.md文件里。每次事故平息后Claude都会默默追加一行新记录:事故怎么发生、根因是什么、用什么招修复、踩了哪些暗坑。每一次新调查,Claude开工第一件事就是通读这个文件。同一个问题反复作妖几次,Claude甚至会主动建议升级成正式的调查技能文件。Sachin自己有一次扫了一眼配置文件就下结论完全略过监控指标,结果判断全错——然后Claude就在lessons.md里写下"先查数据,再建理论。配置文件告诉你什么可能出错,指标告诉你什么真的炸了"。AI给创造它的工程师上了一堂课,而且这条教训会被未来每一次调查反复读到。Anthropic工程师每季度产出代码达2021-2025年的8倍,超过80%由Claude编写——唯一能跟上AI编程速度的只有AI CI管线。

← 返回AI热点列表