美国时间9月3日上午,AI行业三大聊天服务罕见地同时瘫痪。MacRumors在上午8点56分报道,ChatGPT、Claude和Grok在网页端和手机端同时出现大面积故障。OpenAI状态页承认ChatGPT与编程工具Codex出现问题,Anthropic状态页显示Claude错误率升高,xAI的Grok官网也挂出了故障横幅。三家公司在状态页上的说法高度一致:问题已确认,正在调查。
故障如何展开
用户最早注意到的症状是ChatGPT直接返回404错误,不是常见的排队提示,而是干脆找不到服务。HN上ChatGPT Is Throwing 404一条帖子在数小时内积攒330个点赞,紧随其后的Elevated Errors for Multiple Models拿到185个。开发者社区的反应更快:OpenAI的Codex客户端无法连接,GitHub上openai/codex仓库编号28756的issue迅速变成故障现场直播,有人贴出报错截图,有人猜测是鉴权服务出了问题。
由于三家同时出事,是不是同一家上游供应商出了问题成了讨论焦点。Ask HN上一条提问直白地写道:OpenAI、Claude和Grok为什么同时宕机,这是巧合吗?提问下面聚集了各种猜测,从CDN故障、云厂商事故到BGP路由异常都有人分析。截至三家公司恢复服务,没有任何一家给出根因解释,状态页上留下的只有从调查中到监控中的标准流程字样。
一次集中化的压力测试
这次事故真正刺痛的是把AI当成生产依赖的用户。有评论算了一笔账:写代码用Codex、写文档用Claude、查资料用Grok的人,在9月3日上午突然发现自己没有任何可用的AI工具,只能退回搜索引擎和本地编辑器。几小时后三家服务陆续恢复,MacRumors更新称聊天机器人正在陆续回到线上,但依赖它们的工作流在那几个小时里是真实停摆的。
故障的集体性让人不安。三家互相竞争、基础设施各不相同的公司在同一时间窗口出问题,概率上并不常见。过去两年里ChatGPT单独宕机的事故屡见不鲜,Claude和Grok也各有历史,但三家同框还是第一次引发这么大规模的讨论。无论最终根因是共同的云依赖还是单纯的巧合,这次事件都会被写进AI服务不能作为唯一依赖的老生常谈里。
对企业用户来说,更实际的问题是服务等级协议。三家的企业版合同都承诺可用性指标,但大规模故障时的赔偿条款向来苛刻。这次故障发生在美股盘前,OpenAI恰好处于GPT-5.6 Luna向免费用户全面开放的推广期,服务中断的时间点让推广节奏多少受了影响。事故复盘报告什么时候发、发不发,值得继续盯着各家状态页。
从工程视角看,三家服务的共同点其实比竞争关系更多:都在超大规模GPU集群上跑推理,都依赖少数几家云厂商的网络骨干,都把鉴权和会话状态放在自建的分布式存储里。行业观察者早就指出,头部AI服务商的供应链高度重叠,同一批硬件、同一批网络路径、甚至同一批工程师流动,故障域重叠并不奇怪。真正稀缺的是透明度,多数公司的事后复盘只有寥寥几行,距离用户期待的事故报告相去甚远。