한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Game-Lag-Whitepaper › L13 Serverarchitektur und Betrieb

Verzögertes Autoscaling Autoscaling lag

Ursachen-ID in-autoscale · Hauptzuständig Server-Infrastruktur (Infrastrukturteam) · Beteiligt Server-Entwicklung (Entwicklungsteam)

In der interaktiven Fassung mit Grafiken und Experimenten öffnen →

Bei großem Andrang werden automatisch weitere Server gestartet, doch die Vorbereitung dauert einige Minuten. In dieser Zeit sind die vorhandenen Server überlastet.

Warum Eventstart, die Verbindungen schnellen hoch → Folge Bis ein neuer Server läuft und bereit ist, vergehen einige Minuten → Auf dem Bildschirm In den ersten Minuten nach Eventbeginn Zeitlupe, kein Login oder Endlos-Laden

Symptome
Zeitlupe, Kein Login / Endlos-Laden
Faktoren
Stillstand
Wer ist betroffen
Ganzer Server
Wann
Bei großem Andrang, Direkt nach Login oder Wartung
Zuständigkeit
Hauptzuständig Server-Infrastruktur (Infrastrukturteam) · Beteiligt Server-Entwicklung (Entwicklungsteam)
Aufgaben Entwicklungsteam
Auf Kanäle verteilen (wer schon in einem vollen Kanal ist, lässt sich nicht auf einen neuen Server verschieben), Start- und Ladezeit neuer Server verkürzen.
Aufgaben Infrastrukturteam
Vor Events vorab skalieren, vorgewärmte Reserveserver bereithalten, beim Herunterskalieren Server erst abschalten, wenn die verbliebenen Spieler gegangen sind.
Größenordnungen
1 bis einige Minuten, bis die Last erkannt wird (weil Metriken über mehrere Minuten gemittelt werden), dann nochmals einige Minuten, um neue Server zu starten, Spieldaten zu laden und Caches zu füllen.
Im Graphen
Ansturm direkt nach Login oder Wartung · Anzahl Instanzen, CPU-Auslastung, wartende Verbindungen
Wo nachsehen
Aktivitätsverlauf des Autoscalings (Zeitpunkt der Skalierungsentscheidung, Zeitpunkt der Inbetriebnahme neuer Instanzen) über die Graphen von CPU-Auslastung und Verbindungen legen. Bei AWS die Metriken der Auto-Scaling-Gruppe (nur sichtbar, wenn aktiviert): GroupDesiredCapacity (Sollanzahl), GroupPendingInstances (in Vorbereitung), GroupInServiceInstances (in Betrieb)
Spricht dafür
Nach dem Anstieg der Verbindungen wachsen einige Minuten lang nur Sollanzahl und Instanzen in Vorbereitung, die CPU der vorhandenen Server klebt am Limit, und erst ab dem Zeitpunkt, an dem die Instanzen in Betrieb zunehmen, entspannt sich die Lage
Spricht dagegen
Auch nach Inbetriebnahme neuer Instanzen langsam: Ursache außerhalb der Serveranzahl (gemeinsame Ressourcen wie die DB, „Kaskadierender Ausfall“)
Prüfmittel
Mit Infrastruktur-Tools prüfbar (ohne Spielcode)
Mehr dazu
Autoscaling wird vor allem dort eingesetzt, wo neue Server einfach neue Spieler aufnehmen können, etwa bei Login, Gateways oder Dungeons. Auch das Herunterskalieren macht Probleme. Werden Server in den frühen Morgenstunden mit wenigen Spielern abgebaut, ohne zu warten, bis die verbliebenen Spieler gegangen sind, verlieren diese die Verbindung.
Reale Fälle
AWS 2021: AWS us-east-1: Überlast im internen Netzwerk
AWS 2025: AWS us-east-1: DNS-Störung bei DynamoDB und langwierige Wiederherstellung

Quellen

  1. Target tracking scaling policies for Amazon EC2 Auto Scaling AWS
    EC2-Basismetriken kommen im 5-Minuten-Intervall (mit Detailed Monitoring 1 Minute). Für schnelle Reaktion werden Metriken mit einem Intervall von 1 Minute oder kürzer empfohlen
  2. Amazon CloudWatch metrics for Amazon EC2 Auto Scaling AWS
    Gruppenmetriken werden erst nach Aktivierung im 1-Minuten-Takt veröffentlicht, GroupDesiredCapacity (Anzahl, die gehalten werden soll), GroupPendingInstances (Instanzen, die noch nicht in Betrieb sind), GroupInServiceInstances (Instanzen in Betrieb)
  3. Scheduled scaling for Amazon EC2 Auto Scaling AWS
    Kapazität zu festgelegten Zeiten vorab erhöhen und senken, passend zu vorhersehbaren Laständerungen
  4. Decrease latency for applications with long boot times using warm pools AWS
    Bei Apps mit langer Startzeit verringert ein Pool vorinitialisierter Instanzen (Warm Pool) die Skalierungsverzögerung

Verwandte Ursachen

Gleiche Schicht: L13 Serverarchitektur und Betrieb

Ursachen aus anderen Schichten mit demselben Symptom (Zeitlupe)

Karte in der interaktiven Fassung mit Grafiken und Experimenten ansehen