跳至主要內容
科技 新聞

換一家也沒用:美國頭部 AI 集體中斷 3 小時 40 分

北京時間 9 月 3 日深夜,ChatGPT、Claude、Grok 先後宣布服務異常,Gemini 與 Copilot 湧入大量中斷回報,集體中斷持續約 3 小時 40 分,本文整理事件經過、共同基礎設施脈絡與後續觀察訊號。

Techroomage 編輯部 閱讀約 7 分鐘
換一家也沒用:美國頭部 AI 集體中斷 3 小時 40 分

北京時間 9 月 3 日深夜,ChatGPT、Claude、Grok 先後宣布服務異常,Gemini 與 Copilot 同時湧入大量中斷回報;當每一家都回不了話,「換一家用」這個備援動作第一次整排失效。

北京時間 9 月 3 日深夜,送進 ChatGPT 的問題沒有等到回覆。幾乎同一時間,Anthropic 的 Claude 與 xAI 的 Grok 先後公告服務異常,Google Gemini 與微軟 Copilot 也湧入大量使用者回報中斷。這波集體故障持續約 3 小時 40 分鐘,多家媒體以「有紀錄以來最大規模」形容這次美國頭部 AI 服務的同步失靈,相關詞條連夜登上熱搜。

單一服務當機早就不是新聞。ChatGPT 過去幾年多次長時間中斷,Claude 與 Gemini 也各有故障紀錄,使用者多半養成了應對習慣:一家問不了,換另一家。這次的不同在於,這個習慣第一次派不上用場。當使用量最大的幾個入口同時無回應,平常看不見的問題浮上檯面:這些互相競爭的服務,實際上到底有多獨立?

清單列出此次集體中斷事件中傳出異常的五個頭部 AI 服務,以及各自所屬的 OpenAI、Anthropic、xAI、Google 與微軟五家公司
五個服務分屬五家公司,同一晚同時失靈。

北京的深夜,美洲的上班時間

換算時區,北京時間的深夜對應美國東岸的上午到中午,正好是企業與開發者使用量的高峯。這個時間點解釋了兩件事:中斷回報為何在短時間內大量累積,以及這起事件的實際衝擊,為何比「深夜」兩個字聽起來更重。對亞洲的一般使用者來說,深夜讓消費端感受相對有限,但值夜班的工程師、跨時區的營運團隊與必須即時產出內容的編輯臺,恰好是最離不開這些工具的一羣人。

各服務以狀態頁與官方公告確認異常,第三方中斷追蹤管道同步湧入回報,整波中斷在約 3 小時 40 分鐘後結束,各服務陸續恢復回應。截至本文撰寫,各家尚未提出指向單一共通原因的說明,官方口徑多停留在確認異常與搶修修復的層級。

統計圖卡顯示美國頭部 AI 服務此次集體中斷自北京時間 9 月 3 日深夜起,持續約 3 小時 40 分鐘後陸續恢復
從亞洲的深夜,到美洲的上班日。

同時失靈,先看共同的地基

五家公司在商業上互為對手,技術上卻站在同一批少數的地基。公開的合作關係可以看出輪廓:OpenAI 的算力長期深度綁定微軟 Azure;Anthropic 同時使用 AWS 與 Google Cloud,並持續擴大租賃算力,我們先前分析過的Anthropic 與 Lambda 的算力合約就是一例;Gemini 則直接運行在 Google 自家雲端上。

再往下追一層,雲端之間又共享同樣的上遊:跨國骨幹網路、CDN、DNS、身分驗證服務。故障發生的層級越低,同時倒下的服務就越多。網路時代有現成的先例:2021 年一家主要 CDN 業者的設定錯誤,曾讓全球大批主流網站同時打不開,將近一個小時才恢復。那次留下的教訓很直接,看起來毫不相幹的網站,可能踩在同一個環節上。

同時失靈當然也有另一種解釋:幾個各自獨立的故障,恰好落在同一個時間窗裡。統計上少見,並非不可能。分辨這兩種情境的線索在事後報告。若最終指向同一家雲端或同一段網路,「這些服務彼此獨立」的假設就得重寫;若確認是獨立故障疊在一起,這一晚更接近一次集體提醒,只是規模大到讓每一家都同時上了國際新聞。

圖卡呈現段落主張:頭部 AI 服務在商業上互相競爭,技術上卻共享少數雲端、CDN 與網路上遊,因此同時失靈時應往共同基礎設施追查原因

誰被影響:直接的,和跟著停擺的

第一圈是直接使用者。美國上班時段,開發者的編輯器裡掛著 Copilot 或 Claude,企業把模型 API 嵌進內部流程與客服系統,一般人把聊天機器人當搜尋與寫作的入口。入口同時關上,這些工作流程跟著停擺。

第二圈更大,也更容易被忽略:大量產品並未自建模型,而是包裝這幾家的 API。上遊停擺,下遊一起停,無論產品介面看起來多麼不同。Gemini 的位置尤其值得注意,它除了是聊天網站,也是 Android 手機與 Workspace 辦公場景裡的預設助手;我們先前分析過Flash 模型如何承擔 Gemini 產品線的日常呼叫量,一旦 Gemini 出狀況,影響會沿著這些預設位置往外擴。

還有一層容易被誤判的備援。Copilot 與 OpenAI 模型深度綁定,「ChatGPT 壞了改用 Copilot」未必是真正的備援,兩個產品分屬兩家公司,後端卻可能共用同一組模型與算力。對依賴 AI 的開發與營運團隊來說,有效的備援必須設計得更上遊:不同模型商、不同雲端,甚至不同地區的存取路徑。

後續觀察訊號

第一個訊號是事後報告。各家是否公布根因,以及根因落在哪一層:模型服務本身、雲端基礎設施,還是更上遊的網路。這決定了這一晚該被記成偶發事故,或是供應過度集中的具體證據。

第二個訊號是賠償與服務水準協議。對把 API 嵌入產品的企業客戶,3 小時 40 分鐘是實際的營收與信任損失,接下來的退款處理與 SLA 談判會顯示,這些公司在合約裡把自己定位成公用事業等級的服務,還是一般消費產品。

第三個訊號在監管與採購端。少數幾家服務同時失靈,就能讓跨時區的工作流程停擺,這個畫面對監管者與企業採購主管都夠具體,供應商集中度有機會從簡報裡的抽象詞,變成採購清單上的實際檢核項。

3 小時 40 分鐘不算長。放到兩三年前,這些工具多數人還沒聽過;到了今天,它們同時停止回應就足以成為國際新聞。這中間的變化,正是這次中斷真正量出來的東西:這些服務已經被當成基礎設施在使用,而基礎設施該有的標準,包含透明的事後報告、可驗證的備援設計、說清楚的責任分界,現在才要開始補齊。

#科技#新聞#ai服務中斷