한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Game-Lag-Whitepaper › L5 Netzwerkgeräte im Rechenzentrum

Failover von Netzwerkgeräten Network device failover

Ursachen-ID dc-failover · Hauptzuständig Netzwerk-Infrastruktur (Infrastrukturteam) · Beteiligt Server-Entwicklung (Entwicklungsteam), Client-Entwicklung (Entwicklungsteam)

In der interaktiven Fassung mit Grafiken und Experimenten öffnen →

Fällt ein Router oder eine Firewall aus und wird auf das Ersatzgerät umgeschaltet (Failover), haben alle Spieler einige Sekunden lang einen Freeze.

Warum Umschalten auf das Ersatzgerät wegen Ausfall oder Wartung → Folge Umschalten dauert einige Sekunden, ohne synchronisierte Session-Informationen werden Verbindungen zurückgesetzt → Auf dem Bildschirm Alle Spieler des Servers gleichzeitig im Freeze, massenhaft Verbindungsabbrüche

Symptome
Freeze, Verbindungsabbruch
Faktoren
Paketverlust
Wer ist betroffen
Ganzer Server
Wann
Gelegentlich, zufällig
Zuständigkeit
Hauptzuständig Netzwerk-Infrastruktur (Infrastrukturteam) · Beteiligt Server-Entwicklung (Entwicklungsteam), Client-Entwicklung (Entwicklungsteam)
Aufgaben Entwicklungsteam
Server: Timeouts, die kurze Aussetzer (einige Sekunden) verkraften, nach einem Abbruch die Session beim Reconnect per Session-Token fortsetzen. Client: bei Abbruch automatischer Reconnect (Wiederholungsabstände zufällig streuen, damit nicht alle gleichzeitig kommen).
Aufgaben Infrastrukturteam
Redundanz mit geteiltem Verbindungszustand, Ausfälle per BFD innerhalb von 1 s erkennen, Failover regelmäßig testen.
Größenordnungen
Erkennt das Gerät den Ausfall sofort, dauert es etwa 1–3 s. Ohne schnelle Ausfallerkennung (BFD), allein mit den Standard-Timern von BGP, kann die Route 90–180 s lang unterbrochen sein, bis Nachbargeräte den Ausfall bemerken.
Im Graphen
Verbindungen brechen gleichzeitig ab · Verbindungszahl, Sende- und Empfangsvolumen des ganzen Servers
Wo nachsehen
Event-Logs von Routern und Firewalls (Rollenwechsel bei VRRP, Ausfall von BFD- oder BGP-Sessions, Failover-Einträge) mit Verbindungszahl und Sende- und Empfangsvolumen des ganzen Servers zur selben Zeit vergleichen
Spricht dafür
Zum Failover-Zeitpunkt im Geräte-Log fällt der Traffic aller Server hinter diesem Gerät für einige Sekunden auf 0, oder die Verbindungszahlen brechen gleichzeitig ein
Spricht dagegen
Nur die Verbindungen eines Servers brechen ein: „Serverabsturz“ oder „Probleme mit NIC-Treiber oder -Firmware“. Geräte-Logs sauber und der stehengebliebene Server ist eine einzelne Cloud-VM: „Wartung des Cloud-Hosts und Live-Migration“
Prüfmittel
Mit Infrastruktur-Tools prüfbar (ohne Spielcode)

Quellen

  1. RFC 5880: Bidirectional Forwarding Detection (BFD) IETF
    Hello-Mechanismen von Routing-Protokollen brauchen mindestens 1 s zur Ausfallerkennung, BFD wurde für eine schnellere Erkennung entwickelt
  2. RFC 7938: Use of BGP for Routing in Large-Scale Data Centers IETF
    Wer sich nur auf BGP-Keepalives verlässt, konvergiert langsam. Wird ein Link-Down sofort übernommen und die Session beendet, erfolgen Erkennung und erneute Konvergenz im Millisekundenbereich
  3. RFC 5798: Virtual Router Redundancy Protocol (VRRP) Version 3 for IPv4 and IPv6 IETF
    VRRP-Advertisements standardmäßig alle 1 s, das Ersatzgerät übernimmt, wenn etwa das 3-Fache dieses Intervalls ohne Advertisement verstreicht (mit Standardeinstellungen gut 3 s)

Verwandte Ursachen

Gleiche Schicht: L5 Netzwerkgeräte im Rechenzentrum

Ursachen aus anderen Schichten mit demselben Symptom (Freeze)

Karte in der interaktiven Fassung mit Grafiken und Experimenten ansehen