
ChatGPT、Claude、Grok 罕见集体宕机 3 小时 40 分:AI 生产化时代的可用性警钟
美东时间9月3日上午,OpenAI、Anthropic、xAI 三大 AI 平台在约 90 分钟窗口内接连大规模故障,Downdetector 上 OpenAI 相关报告超 1.2 万份,AI 编程工具 Cursor 亦受波及,故障持续约 3 小时 40 分后全部恢复。OpenAI 称"路由错误"、SpaceX 指孟菲斯算力中心中断,Azure/Cloudflare 疑云未解、无人认领根因。AI 服务"多供应商冗余"假设被打破,企业多云容灾与 SLA 议题急升温。
【新闻原文】
美东时间9月3日上午,美国主流 AI 服务遭遇罕见集体宕机:Anthropic 的 Claude、xAI 的 Grok 与 OpenAI 的 ChatGPT 在约一个半小时的窗口内接连出现大规模服务异常,谷歌 Gemini 与微软 Copilot 的中断报告也同步飙升,AI 编程工具 Cursor 因依赖 Claude、ChatGPT 和 Grok 一度部分服务不可用。Downdetector 数据显示,OpenAI 相关故障报告超过 1.2 万份,Claude 约 1200 份,Grok 约 1000 份。本次大规模故障持续约 3 小时 40 分,至北京时间9月4日凌晨 1 时 10 分左右所有服务陆续恢复。
各家对故障原因的口径并不一致。OpenAI 发言人称,当地时间 7 时 43 分左右出现的"路由错误"导致部分用户无法使用 ChatGPT 与 Codex,8 时 17 分修复;Anthropic 状态页显示 Claude Mythos 5.1、Fable 5.1、Opus 5 等模型错误率先后升高,公司称"已找到原因"并于 9 时 16 分标记解决;xAI 旗下 Grok 于 6 时 30 分全面宕机,10 时 05 分恢复,其关联方 SpaceX 公开表示故障源于"孟菲斯算力中心当天早晨的一次中断"。值得玩味的是,微软 Azure、亚马逊 AWS、Cloudflare 三家的公开状态页当天均未报告能解释三起故障的重大并发事件——尽管 Cloudflare 当日存在 R2 自定义域名 HTTP/3 失败与 WARP 地理位置识别错误两项已知问题,Azure 故障报告也有激增,但没有任何一家基础设施商认领根因。
市场层面,美股当天三大指数全线大涨、涨幅均超 1%,戴尔、Snowflake 等巨头超预期财报强化了 AI 需求信心;而宕机事件的另一面效应同步显现——主打本地化部署的 Palantir 当日大涨 7.71%,国内智谱等厂商借势营销"我们还在"。多家媒体将此事件定性为"有报告以来最大规模的 AI 集体宕机",企业客户对 AI 服务可靠性的关注被推到前所未有的高度。
【企服观察】
三大 AI 平台同框故障,几乎是一次免费的全球级"容灾演习"。它给所有把 AI 塞进业务流程的企业提了一个必须正视的问题:当 AI 从聊天玩具变成生产工具,可用性就是能力的一部分。
第一,"切换到另一家"的容灾假设被证伪了。很多企业 API 选型时做了双供应商冗余:ChatGPT 挂了切 Claude,Claude 挂了切 Grok。但当天三家的故障发生在同一个 90 分钟窗口内——如果它们共享同一云计算层、同一家 CDN 甚至同一个数据中心园区,那么"模型层的冗余"在"基础设施层的共因故障"面前毫无意义。这次官方口径各异、根因成谜,反而更让人生疑:三家不约而同沉默,可能是因为说清楚细节比宕机本身更难堪。企业要做的是绘制 AI 依赖地图:把每个关键业务的模型供应商、其承载云、区域部署全部列出来,识别真正的共因故障域,冗余必须做到"跨云+跨区域"才算数。
第二,AI 服务的 SLA 要重新谈。传统云服务有明确的可用性承诺和故障赔付条款,而多数 AI API 合同在这方面含糊其辞。这次故障让无数自动化流水线、Agent 任务和编程会话中断,但没有任何一家平台主动提出赔付。建议企业采购 AI 能力时把三件事写进合同:历史可用率数据(要求提供过去 12 个月状态页记录)、故障赔付条款(按停机时长返还服务费)、重大事件的根因报告义务(RCA 报告期限)。供应商愿不愿意签这些条款,本身就是选型的重要信号——敢承诺的大概率对自己的基础设施有底气。
第三,Agent 时代的故障恢复需要重新设计。人肉操作中断了可以重来,但无人值守的 Agent 任务中断在半路,状态是什么、如何续跑、会不会重复执行造成业务事故(比如重复下单、重复发通知)?这次宕机给所有做 Agent 应用的团队上了一课:任务必须设计幂等性和断点续跑能力,关键动作要有事务保护,Agent 编排层要有"全局暂停/恢复"开关和异常告警。不能因为过去几个月没出事,就假设永远不出事——AI 平台的故障不是会不会来,而是什么时候来。
第四,本地化与私有化部署迎来一轮订单窗口,但要冷静评估。宕机当天 Palantir 大涨 7.71%,国产模型厂商忙着喊"我们还在",私有化部署、国产算力的销售话术已经满天飞。对企业来说,本地化部署确实消除了"海外平台集体抖动"的敞口,但换来了自己扛运维、自己保算力的责任——机房断电、GPU 集群故障、模型服务 OOM,哪一个都不省心。合理的策略是分层:核心业务(涉及客户资金、生产控制、合规数据)走本地化+私有算力;长尾业务继续用公有云 API 享受最新模型红利,同时设置人工降级预案。一刀切地"全本地化"或"全上云"都是偷懒。
第五,监管大概率会跟进。当 AI 服务的中断可以同时影响金融、医疗、政务、制造等行业的关键流程,"AI 关键基础设施稳定性"进入监管视野只是时间问题。参考金融行业对核心系统的容灾要求(两地三中心、RTO/RPO 指标),未来对面向企业的 AI 服务出台可用性分级、故障报告时限等要求是完全可能的。提前把内部 AI 应用的业务连续性计划(BCP)做起来的企业,既是给自己上保险,也是提前满足未来的合规要求。
最后说一句:这次三小时四十分钟的集体宕机,是 AI 行业走向"水电煤"过程中的一次成人礼。水电煤的标准从来不只是"能力多强",而是"永远在线"。谁先把可靠性当成产品来做,谁就能在 enterprise 市场的下半场拿走最优质的客户。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。