跳到主要内容

AI 巨头集体宕机:GPT-6 发布夜暴露服务脆弱性

2026 年 9 月 3 日,本应是 OpenAI 旗舰模型 GPT-6 Astra 的舞台。结果这一天被舆论贴上了「LLM 史上最黑暗一天」的标签——ChatGPT、Claude、Grok 三大 AI 服务在同一个早晨集体宕机,中断持续近 4 小时,直到北京时间 9 月 4 日凌晨 1 点 10 分前后才陆续恢复。

戏剧性的是,宕机平息几小时后,OpenAI 如期发布 GPT-6 Astra,宣称「人类来到 AGI 时代」。一边是号称迈向通用人工智能的重磅产品登场,一边是 AI 基础设施集体「罢工」,这场反差给整个行业留下了比模型跑分更值得咀嚼的问题:当 AI 从工具变成基础设施,它到底有多可靠?

92 分钟内,三家相继失联

故障监测平台 Downdetector 的数据还原了事件轮廓:OpenAI 收到的用户报告超过 1.2 万份,Claude 约 1200 份,Grok 约 1000 份,三家合计超过 1.4 万份。美东时间 9 月 3 日早晨 9 点半,Claude 率先报告异常;此后 92 分钟内,Grok 与 ChatGPT 相继确认大规模中断,网页端、App 与 API 全部无法访问。

受影响的不止聊天窗口。OpenAI 的编程工具 Codex 一同失联,AI 编程工具 Cursor 也承认部分服务因依赖的 Claude、ChatGPT 和 Grok 故障而受损。对把自动化任务交给 API 的开发者来说,宕机窗口内的每一分钟,都直接折算成停摆的流水线——这是 AI 依赖度上升后最直接的代价。

共享的地基:集中性风险的公开化

故障源头至今没有统一说法。坊间推测指向底层云基础设施,有分析点名 AWS,也有观点认为三家共享 Azure 的计算资源,「多因素叠加」的说法同时存在。值得注意的一个细节是,谷歌 Gemini 大体维持可用,成了少数还能正常工作的主流大模型——正如 TechTimes 的报道所指出的,Azure East US 区域当日上午出现故障,而跑在 Google Cloud 上的 Gemini 因此幸免,这反而证实了头部闭源模型对单一云厂商的高度依赖。

唯一给出明确解释的是 xAI:SpaceXAI 发布简短声明,就孟菲斯数据中心的故障向 Grok 用户及受影响的「计算合作伙伴」致歉。「计算合作伙伴」这个说法,承认了一个公开的秘密——头部 AI 公司共用同一批底层算力,模型层面的竞争再激烈,地基是共享的。一个上游节点的故障,就能让头部产品同时倒下。

可靠性:被重新估值的竞争维度

这次事件真正值得审视的,不是某一家公司的修复速度,而是 AI 行业对底层基础设施的集体依赖。头部模型厂商把大量算力集中托管在少数云厂商的数据中心,可靠性因此悬于一条供应链之上。OpenAI 过去一年已多次出现服务中断,7 月更一度连续多日未能保持稳定服务,基础设施承压并非偶发事件。

宕机的直接损失可以量化,信任的折损难以估量。宕机进行时,Hugging Face 联合创始人 Thomas Wolf 在社交平台转发汇总三家宕机消息的推文,先是提问「这种情况下你会用哪个 AI」,几小时后更正为「宕机的是所有闭源 AI 服务」。一次补正,把讨论从「选哪个」拉到「还剩什么」——闭源阵营的集中性风险,正在以各种形式暴露。

对企业客户而言,这个问题更现实:他们正把越来越多的工作流迁到 AI 产品上,一次集体失联就足以打断整条生产链。「你会用哪个 AI」背后真正的问题是,用户敢把多少关键业务交给它,而它会不会在某天早晨与对手一起倒下。尽管 OpenAI 在 24 分钟内解决了 ChatGPT 与 Codex 的错误,主要提供商全年也维持着约 99.9% 的可用性,但对依赖 AI 完成核心业务的企业来说,那 0.1% 的窗口恰恰是风险最集中的地方。

结语:AGI 宣言的第一天

当天下午,三家公司的状态页先后转绿,GPT-6 Astra 按计划向首批机构开放。但这次宕机真正留下的,不是几小时的中断记录,而是一个需要重新估值的风险项:头部 AI 服务共享同一片底层算力,模型能力的比拼之外,可靠性的竞争才刚刚开始。

对行业而言,这次事件可能带来几层深层变化:一是企业级客户会把多云、多模型容灾写进采购要求,不再把鸡蛋放进一个篮子;二是开源模型的「可自托管」属性被重新定价,成为对抗集中性风险的现实选项;三是云厂商与模型厂商的绑定关系会被重新审视,AI 基础设施的供应链韧性将成为一个独立议题。AGI 时代的第一天以集体宕机开场,或许是最好的提醒:在通往通用人工智能的路上,先要证明自己靠得住。