AWS 中斷的長尾效應
廣闊的亞馬遜 週一凌晨開始的網絡服務雲中斷凸顯了互聯網脆弱的相互依賴性,因為世界各地的主要通信、金融、健康、教育和政府平台都遭受了乾擾。隨著時間的推移,AWS 診斷並開始解決這個問題,該問題起源於這家總部位於弗吉尼亞州北部的公司的關鍵 US-EAST-1 區域。但一連串的影響需要時間才能完全消除。
調查人員對這一事件進行了反思,特別強調了中斷的持續時間,該中斷始於美國東部時間 10 月 20 日星期一凌晨 3 點左右。 AWS 在狀態更新中表示,截至下午 6:01。東部時間週一“所有 AWS 服務已恢復正常運行。”此次故障直接源自亞馬遜的 DynamoDB 數據庫 API,該公司表示,“影響”了 141 項其他 AWS 服務。許多網絡工程師和基礎設施專家向《連線》雜誌指出,鑑於 AWS、微軟 Azure 和谷歌云平台等所謂的“超大規模企業”的複雜性和龐大規模,出現故障是可以理解的,也是不可避免的。然而,他們也指出,這一現實不應簡單地免除雲提供商延長停機時間的責任。
“這個詞 事後諸葛亮 是關鍵。事後很容易找出問題所在,但 AWS 的整體可靠性表明,防止每一次故障是多麼困難。 ”可靠性和網絡安全公司 CYE 的首席信息安全官 Ira Winkler 表示。
AWS 沒有回應《連線》雜誌關於客戶恢復長尾的問題。 AWS 發言人表示,該公司計劃發布一份有關該事件的“事後摘要”。
Hunter Strategy 研發副總裁傑克·威廉姆斯 (Jake Williams) 表示:“我不認為這只是‘意外發生’的中斷。我本來預計會更快完全恢復。” “值得讚揚的是,他們在處理級聯故障方面並沒有很多經驗,因為他們不經常出現停機。這是他們的功勞。但人們很容易陷入對這些公司放行的心態,我們不應該忘記,他們正在通過積極嘗試吸引越來越多的客戶使用其基礎設施來創造這種情況。
該事件是由已知的網絡中斷罪魁禍首——“域名系統”解析問題引起的。 DNS 本質上是互聯網的電話簿機制,用於將網絡瀏覽器定向到正確的服務器。因此,DNS 問題是中斷的常見原因,因為它們可能導致請求失敗並阻止內容加載。