三大 AI 聊天界面同时报错

北京时间 9 月 3 日深夜,如果你正打算让 AI 帮你改一段代码、润色一封邮件,或者帮学生整理学习资料,大概率会收到一个冰冷的错误页——不只是某一家,而是 ChatGPT、Claude、Grok 三大 AI 服务几乎同时“罢工”。谷歌 Gemini、微软 Copilot 也收到大量中断报告。这场持续约 3 小时 40 分 的大规模宕机,被称为有记录以来最严重的一次 AI 集体故障。

一、事件时间线:三大家不是同时,而是连锁倒下

时间(美东 9 月 3 日) 受影响服务 公开说法
上午 9:23 左右 Claude(Anthropic) 技术人员称“基础设施问题”,多模型错误率飙升
上午 9:25 左右 Grok(xAI) SpaceX AI 称孟菲斯计算中心故障并致歉
上午 11:00 左右 ChatGPT / Codex(OpenAI) 发言人称“路由错误”导致部分用户 404
约 12:00 前后 Cursor 等依赖上游的工具 公告部分服务因上游模型故障受影响

到北京时间 9 月 4 日凌晨 1:10 前后,各服务才陆续恢复正常。

二、不是黑客攻击,也不是“三个员工道歉”

事件爆发后,网上很快传出两种说法:一种是“被黑客攻击了”,另一种是“GPT 有三个工作人员站出来道歉”。

先说结论:OpenAI 在故障后 27 分钟内就排除了外部入侵可能,所以“被黑”基本不成立。

至于“三个 GPT 员工道歉”——我在公开报道中没有找到权威信源支撑这个说法。实际情况是:

  • OpenAI:由一位未具名发言人对外解释是“路由错误”,没有员工公开道歉
  • Anthropic:开发者关系工程师 CJ Avilla 在社交媒体上通报是“基础设施问题”——这是状态更新,不是道歉,而且他属于 Claude 团队,不是 GPT/OpenAI;
  • xAI / Grok:倒是发了一份官方致歉,但对象是孟菲斯计算中心故障,跟 GPT 无关。

所以“三个 GPT 员工道歉”更像是把三家公司不同的公开表态揉在一起、加工出来的误传。

⚠️ 注意:部分自媒体还出现了“量子-光子混合算力底座 QPF 固件更新触发漏洞”之类的技术叙事,目前同样缺乏权威信源佐证,建议谨慎采信。

三、为什么“同时”崩?——真正的关键词是“惊群效应”

三家厂商给出的原因各不相同:路由错误、计算中心故障、基础设施问题。那为何时间凑得这么巧?

英文技术复盘里提到一个关键概念:惊群效应(thundering herd)。简单说:

  1. ChatGPT 一挂,大量用户和自动脚本立刻涌向 Claude;
  2. Claude 被这拨“逃难流量”冲垮,用户又涌向 Grok;
  3. 很多企业部署了“主模型挂了自动切备用模型”的 failover 脚本,能在毫秒级把百万请求从一个平台搬到另一个平台——本意是高可用,结果却成了“把局部故障传染成全局雪崩”的加速器。

再加上 OpenAI、Anthropic、xAI 都以不同方式依赖 Azure、Cloudflare 等共享云基础设施,地基一旦共振,楼上的竞品们也一起晃。

四、对普通人和开发者意味着什么

  • 别把鸡蛋放一个篮子:关键工作流不要只依赖一家模型,重要任务本地备份或准备离线方案;
  • failover 脚本要加“限流”:自动切换本身不可怕,可怕的是无限制地瞬间把全部流量砸向备用方;
  • 理解 AI 服务的“水电煤”属性:当工具深度嵌入日常,宕机就不再是“忍几分钟”的小事,而是生产力停摆;
  • 对网传细节保持警惕:重大故障往往伴随大量合成叙事,看到“精确数字 + 画面感细节”先打问号。

五、写在最后

颇具戏剧性的是,这场“AI 史上最黑暗一天”平息几小时后,OpenAI 就发布了 GPT-6 Astra 并宣称“欢迎来到 AGI 时代”。一边是全球级宕机,一边是模型能力的代际跃升——两件事撞在一起,把 AI 产业的脆弱与激进同时摆上了台面。

技术越是强大,越需要基建冗余和信息透明。下一次再遇到“AI 集体罢工”,我们至少可以冷静地多问一句:这是真被黑了,还是又一次“惊群”?

发表评论

您的电子邮箱地址不会被公开。