OpenAI、Claude、Grok 集体宕机,纯属巧合?
Ask HN: Why are OpenAI, Claude, and Grok simultaneously down? Coincidence?
我注意到 OpenAI、Claude 和 Grok 这几大 AI 服务竟然在同一时间全部无法访问。这真的是纯粹的巧合吗?还是背后隐藏着某种共同的基础设施故障?大家觉得原因可能是什么?
它们可能都从 SpaceXAI 那里租赁了计算资源。
也许是它们依赖的底层基础设施出了问题,比如 AWS 之类的云服务。
我猜是因为其中一个服务先宕机,导致大量工作负载转移到了另一个服务上,加上它们在数据中心层面存在重叠。
看来是‘惊群效应’(Thundering Herd)爆发了。
HN 评论区
511- kibae
Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右都出现了类似的报错激增。我怀疑是 Cloudflare 或其他关键承载服务发生了故障,进而引发了所有主要云服务商的连锁反应。
https://downdetector.com/status/cloudflare/
https://downdetector.com/status/windows-azure/
- juujian
用户觉得这些产品基本可以互换,一旦某个服务挂了,就迅速对其它服务商发起 DDoS。所谓的护城河也就到此为止了。
- Insanity
把它想象成一个巨大的分布式系统。OpenAI 挂了,大家就迁移到 Claude,结果这个也被压垮挂了,以此类推。
所以这不是巧合,先有一个挂了,用户迁移导致了进一步的 DoS。至少这是我的猜测。
- Linello
有没有可能是 OpenAI 的 Astra 被释放后,为了争夺计算资源而主动把其他模型打掉的硬起飞(hard-takeoff)场景?
- steammaho
挂得太彻底了,我的 Claude 桌面应用直接崩溃,连重启都做不到。卸载后甚至再也装不回去了。Vibecoded 应用在这方面的稳定性真是“棒极了”。
- docheinestages
我的直觉告诉我,这事儿跟 Cloudflare 脱不了干系。
和 AWS 一样,它们是此类事件中的两大主要嫌疑对象。
- sebbul
流量经 NSA 重路由时出了点小岔子……
- bojangleslover
我不确定是不是 CF 的问题。Cursor、GCP 和 AWS 都出现了一些错误。据我所知,GCP 完全可以独立于 CF 进行路由。我押注是光纤骨干网提供商(Megaport、Zayo、Lumen)的问题。
- paxys
无聊的答案——这些服务各自经常宕机,停机时间迟早会同步。类似于钟摆同步效应。
- simpetre
Claude 和 Grok 现在也挂了,跟 SpaceX 数据中心的问题有关吗?
要么就是审判日到了……