Wir haben es alle gemerkt, am Mittwoch den 25.01.23 gab es einen breiten Ausfall von Teams, Office und weiteren Anwendungen.
Nachfolgend erhalten Sie den (übersetzen) Report von Microsoft zur Information zum Ausfall:
Vorläufiger Post Incident Review (PIR) – Azure Networking – Globale WAN-Probleme (Tracking ID VSG1-B90)
Dies ist unser vorläufiger PIR, den wir innerhalb von 3 Tagen nach Behebung des Vorfalls zu veröffentlichen versuchen, um unsere bisherigen Erkenntnisse mitzuteilen.
Nach Abschluss unserer internen Retrospektive (in der Regel innerhalb von 14 Tagen) werden wir einen endgültigen PIR mit zusätzlichen Details/Learnings veröffentlichen.
Was ist passiert?
Zwischen 07:05 UTC und 12:43 UTC am 25. Januar 2023 traten bei Kunden Probleme mit der Netzwerkkonnektivität auf, die sich in Form von langen Netzwerklatenzen und/oder Timeouts äußerten, wenn sie versuchten, eine Verbindung zu Ressourcen herzustellen, die in Azure-Regionen gehostet wurden, sowie zu anderen Microsoft-Diensten wie Microsoft 365 und Power Platform. Während sich die meisten Regionen und Dienste bis 09:00 UTC erholt hatten, waren die zeitweiligen Paketverluste bis 12:43 UTC vollständig behoben. Dieser Vorfall wirkte sich auch auf Azure Government Cloud-Dienste aus, die von der Azure Public Cloud abhängig waren.
Was lief schief und warum?
Wir haben festgestellt, dass eine Änderung am Microsoft Wide Area Network (WAN) die Konnektivität zwischen Clients im Internet und Azure, die Konnektivität zwischen Regionen sowie die standortübergreifende Konnektivität über ExpressRoute beeinträchtigt hat. Im Rahmen einer geplanten Änderung zur Aktualisierung der IP-Adresse auf einem WAN-Router führte ein an den Router gegebener Befehl dazu, dass dieser Nachrichten an alle anderen Router im WAN sendete, was dazu führte, dass alle Router ihre Adjazenz- und Weiterleitungstabellen neu berechneten. Während dieser Neuberechnung waren die Router nicht in der Lage, die sie durchquerenden Pakete korrekt weiterzuleiten. Der Befehl, der das Problem verursachte, verhält sich auf verschiedenen Netzwerkgeräten unterschiedlich, und der Befehl war auf dem Router, auf dem er ausgeführt wurde, nicht mit unserem vollständigen Qualifizierungsprozess überprüft worden.
Wie haben wir reagiert?
Unsere Überwachung ergab zunächst DNS- und WAN-bezogene Probleme ab 07:12 UTC. Wir begannen mit der Untersuchung, indem wir alle kürzlich vorgenommenen Änderungen überprüften. Um 08:10 UTC begann sich das Netz automatisch zu erholen. Um 08:20 UTC, als die automatische Wiederherstellung stattfand, identifizierten wir den problematischen Befehl, der die Probleme auslöste. Die Netzwerk-Telemetrie zeigt, dass bis 09:00 UTC fast alle Netzwerkgeräte wiederhergestellt waren und auch die meisten Regionen und Dienste wiederhergestellt waren. Die letzten Netzwerkgeräte waren um 09:35 Uhr UTC wiederhergestellt.
Aufgrund der Auswirkungen auf das WAN wurden unsere automatisierten Systeme zur Aufrechterhaltung des Zustands des WAN angehalten, einschließlich der Systeme zur Identifizierung und Entfernung ungesunder Geräte und des Traffic-Engineering-Systems zur Optimierung des Datenflusses im Netz. Aufgrund der Unterbrechung dieser Systeme kam es auf einigen Pfaden im Netz ab 09:35 UTC zu erhöhten Paketverlusten, bis diese Systeme manuell neu gestartet wurden und das WAN wieder optimale Betriebsbedingungen aufwies. Diese Wiederherstellung war um 12:43 Uhr UTC abgeschlossen.
Wie sorgen wir dafür, dass Vorfälle wie dieser weniger wahrscheinlich sind oder weniger Auswirkungen haben?
Wir haben verhindert, dass Befehle mit großer Wirkung auf den Geräten ausgeführt werden (abgeschlossen)
Wir werden verlangen, dass alle Befehlsausführungen auf den Geräten den Richtlinien für sichere Änderungen folgen (Voraussichtlicher Abschluss: Februar 2023)
Dies ist unser vorläufiger PIR, den wir innerhalb von 3 Tagen nach der Eindämmung des Vorfalls zu veröffentlichen versuchen, um unsere bisherigen Erkenntnisse mitzuteilen. Nach Abschluss unserer internen Retrospektive (in der Regel innerhalb von 14 Tagen) werden wir einen endgültigen PIR mit zusätzlichen Details/Learnings veröffentlichen.
Hinweis: Übersetzt mit www.DeepL.com/Translator (kostenlose Version)
Quelle: https://status.azure.com/en-gb/status/history