
北京时间 9 月 3 日深夜,如果你正打算让 AI 帮你改一段代码、润色一封邮件,或者帮学生整理学习资料,大概率会收到一个冰冷的错误页——不只是某一家,而是 ChatGPT、Claude、Grok 三大 AI 服务几乎同时“罢工”。谷歌 Gemini、微软 Copilot 也收到大量中断报告。这场持续约 3 小时 40 分 的大规模宕机,被称为有记录以来最严重的一次 AI 集体故障。
一、事件时间线:三大家不是同时,而是连锁倒下
| 时间(美东 9 月 3 日) | 受影响服务 | 公开说法 |
|---|---|---|
| 上午 9:23 左右 | Claude(Anthropic) | 技术人员称“基础设施问题”,多模型错误率飙升 |
| 上午 9:25 左右 | Grok(xAI) | SpaceX AI 称孟菲斯计算中心故障并致歉 |
| 上午 11:00 左右 | ChatGPT / Codex(OpenAI) | 发言人称“路由错误”导致部分用户 404 |
| 约 12:00 前后 | Cursor 等依赖上游的工具 | 公告部分服务因上游模型故障受影响 |
到北京时间 9 月 4 日凌晨 1:10 前后,各服务才陆续恢复正常。
二、不是黑客攻击,也不是“三个员工道歉”
事件爆发后,网上很快传出两种说法:一种是“被黑客攻击了”,另一种是“GPT 有三个工作人员站出来道歉”。
先说结论:OpenAI 在故障后 27 分钟内就排除了外部入侵可能,所以“被黑”基本不成立。
至于“三个 GPT 员工道歉”——我在公开报道中没有找到权威信源支撑这个说法。实际情况是:
- OpenAI:由一位未具名发言人对外解释是“路由错误”,没有员工公开道歉;
- Anthropic:开发者关系工程师 CJ Avilla 在社交媒体上通报是“基础设施问题”——这是状态更新,不是道歉,而且他属于 Claude 团队,不是 GPT/OpenAI;
- xAI / Grok:倒是发了一份官方致歉,但对象是孟菲斯计算中心故障,跟 GPT 无关。
所以“三个 GPT 员工道歉”更像是把三家公司不同的公开表态揉在一起、加工出来的误传。
三、为什么“同时”崩?——真正的关键词是“惊群效应”
三家厂商给出的原因各不相同:路由错误、计算中心故障、基础设施问题。那为何时间凑得这么巧?
英文技术复盘里提到一个关键概念:惊群效应(thundering herd)。简单说:
- ChatGPT 一挂,大量用户和自动脚本立刻涌向 Claude;
- Claude 被这拨“逃难流量”冲垮,用户又涌向 Grok;
- 很多企业部署了“主模型挂了自动切备用模型”的 failover 脚本,能在毫秒级把百万请求从一个平台搬到另一个平台——本意是高可用,结果却成了“把局部故障传染成全局雪崩”的加速器。
再加上 OpenAI、Anthropic、xAI 都以不同方式依赖 Azure、Cloudflare 等共享云基础设施,地基一旦共振,楼上的竞品们也一起晃。
四、对普通人和开发者意味着什么
- 别把鸡蛋放一个篮子:关键工作流不要只依赖一家模型,重要任务本地备份或准备离线方案;
- failover 脚本要加“限流”:自动切换本身不可怕,可怕的是无限制地瞬间把全部流量砸向备用方;
- 理解 AI 服务的“水电煤”属性:当工具深度嵌入日常,宕机就不再是“忍几分钟”的小事,而是生产力停摆;
- 对网传细节保持警惕:重大故障往往伴随大量合成叙事,看到“精确数字 + 画面感细节”先打问号。
五、写在最后
颇具戏剧性的是,这场“AI 史上最黑暗一天”平息几小时后,OpenAI 就发布了 GPT-6 Astra 并宣称“欢迎来到 AGI 时代”。一边是全球级宕机,一边是模型能力的代际跃升——两件事撞在一起,把 AI 产业的脆弱与激进同时摆上了台面。
技术越是强大,越需要基建冗余和信息透明。下一次再遇到“AI 集体罢工”,我们至少可以冷静地多问一句:这是真被黑了,还是又一次“惊群”?



