产品更新

Claude遭遇大规模服务故障:认证网关数据库流量失衡,42分钟后恢复

2026年8月17日凌晨(北京时间5时58分/UTC时间8月16日21时58分),Anthropic旗下AI平台Claude发生大规模服务中断。监控系统第一时间捕捉到错误率急剧攀升,用户陆续报告无法登录Claude.ai网页端、Claude Code开发工具以及Claude Cowork协作平台。Anthropic状态页面将三项服务全部标记为"大规模服务故障(Major Outage)"。整个中断过程持续约35至42分钟,至6时42分系统遥测数据显示流量和错误率全面回归正常。

经Anthropic工程团队初步调查,故障直接技术原因为主要认证网关数据库遭遇严重的流量分布不均(acute traffic imbalance),引发连锁反应:认证请求在数据库中大量堆积形成"队列反压",持续压力导致应用服务器资源耗尽开始提前丢弃连接请求,最终用户端收到HTTP 500内部服务器错误及网关超时提示。值得注意的是,面向开发者的Claude API和Claude Console服务因无需登录鉴权绕过该网关,全程保持正常运行未受影响。

为快速恢复服务,Anthropic工程师采取两步紧急操作:一是将流向故障网关的API请求切换至冗余网关集群分流压力,二是调整用于管理提示词状态的内存池配置释放系统资源。截至发稿所有服务已完全恢复,未报告数据丢失或安全泄露。Anthropic表示将发布正式的事后分析报告,详述长期架构改进方案包括认证网关弹性扩容策略、流量预警机制优化以及队列治理升级。此次故障发生于Anthropic冲刺2万亿美元IPO的关键时刻,也暴露了AI平台在快速增长下系统韧性面临的挑战。

← 返回AI热点列表