Svmuu訊 Coinbase 發佈 7 月 14 日服務中斷事件覆盤報告,表示此次事故由一次例行配置更新引發的關鍵網絡組件錯誤配置導致,影響持續約 50 分鐘,期間用户資金始終安全。
Coinbase 表示,北京時間 7 月 14 日 12:34(美國東部時間 12:34),公司向承載核心基礎設施服務的共享生產 Kubernetes 集羣部署了一項例行配置變更。該更新原計劃用於遷移至新的服務部署模式,以提升系統性能和可靠性。
然而,由於資源名稱衝突未被預生產環境檢測機制發現,此次配置修改意外影響了集羣中的 Istio 入口網關(Ingress Gateway)相關 Kubernetes 資源,導致該網絡組件不可用。約 3 分鐘後,集羣所有入站流量中斷,使內部服務無法訪問多個基礎設施組件。
Coinbase 指出,由於大量異步工作流依賴這些基礎設施服務,包括交易結算、資金轉賬和銀行卡交易授權等流程,因此多個業務線受到影響。受影響服務包括:
零售用户無法完成鏈外交易、充值和提現,部分處理中交易顯示卡住,並在服務恢復後完成;
Coinbase Card 借記卡交易暫時失敗,信用卡支付未受影響,但部分卡片管理功能不可用;
Coinbase DEX 在 Base 和 Solana 上的鏈上兑換服務暫停;
Coinbase Exchange 和 Prime 機構客户出現轉賬及結算失敗或延遲;
Coinbase Developer Platform 客户無法完成開户、資金轉移及入金服務。
Coinbase 表示,入口網關於美國東部時間 13:20 恢復,事件於 13:23 得到緩解。隨後系統開始處理積壓任務,大部分服務很快恢復正常,剩餘隊列在之後數小時內完成處理。在恢復過程中,Coinbase 遇到了兩項額外挑戰。首先,部署工具本身依賴受影響的入口網關運行,導致常規回滾流程無法執行,形成“故障影響修復工具”的循環依賴。其次,緊急恢復流程(break-glass access)雖然有效,但權限驗證和人工審核流程增加了恢復時間。
Coinbase 表示,此次事件未涉及資產安全風險,但暴露出大型金融基礎設施在自動化部署、系統依賴和災難恢復機制方面仍需持續優化。公司將進一步加強系統韌性建設,以降低類似事件再次發生的概率。