Bei großem Andrang werden automatisch weitere Server gestartet, doch die Vorbereitung dauert einige Minuten. In dieser Zeit sind die vorhandenen Server überlastet.
Warum Eventstart, die Verbindungen schnellen hoch → Folge Bis ein neuer Server läuft und bereit ist, vergehen einige Minuten → Auf dem Bildschirm In den ersten Minuten nach Eventbeginn Zeitlupe, kein Login oder Endlos-Laden
Auf Kanäle verteilen (wer schon in einem vollen Kanal ist, lässt sich nicht auf einen neuen Server verschieben), Start- und Ladezeit neuer Server verkürzen.
Aufgaben Infrastrukturteam
Vor Events vorab skalieren, vorgewärmte Reserveserver bereithalten, beim Herunterskalieren Server erst abschalten, wenn die verbliebenen Spieler gegangen sind.
Größenordnungen
1 bis einige Minuten, bis die Last erkannt wird (weil Metriken über mehrere Minuten gemittelt werden), dann nochmals einige Minuten, um neue Server zu starten, Spieldaten zu laden und Caches zu füllen.
Im Graphen
Ansturm direkt nach Login oder Wartung · Anzahl Instanzen, CPU-Auslastung, wartende Verbindungen
Wo nachsehen
Aktivitätsverlauf des Autoscalings (Zeitpunkt der Skalierungsentscheidung, Zeitpunkt der Inbetriebnahme neuer Instanzen) über die Graphen von CPU-Auslastung und Verbindungen legen. Bei AWS die Metriken der Auto-Scaling-Gruppe (nur sichtbar, wenn aktiviert): GroupDesiredCapacity (Sollanzahl), GroupPendingInstances (in Vorbereitung), GroupInServiceInstances (in Betrieb)
Spricht dafür
Nach dem Anstieg der Verbindungen wachsen einige Minuten lang nur Sollanzahl und Instanzen in Vorbereitung, die CPU der vorhandenen Server klebt am Limit, und erst ab dem Zeitpunkt, an dem die Instanzen in Betrieb zunehmen, entspannt sich die Lage
Spricht dagegen
Auch nach Inbetriebnahme neuer Instanzen langsam: Ursache außerhalb der Serveranzahl (gemeinsame Ressourcen wie die DB, „Kaskadierender Ausfall“)
Prüfmittel
Mit Infrastruktur-Tools prüfbar (ohne Spielcode)
Mehr dazu
Autoscaling wird vor allem dort eingesetzt, wo neue Server einfach neue Spieler aufnehmen können, etwa bei Login, Gateways oder Dungeons. Auch das Herunterskalieren macht Probleme. Werden Server in den frühen Morgenstunden mit wenigen Spielern abgebaut, ohne zu warten, bis die verbliebenen Spieler gegangen sind, verlieren diese die Verbindung.
Target tracking scaling policies for Amazon EC2 Auto ScalingAWS EC2-Basismetriken kommen im 5-Minuten-Intervall (mit Detailed Monitoring 1 Minute). Für schnelle Reaktion werden Metriken mit einem Intervall von 1 Minute oder kürzer empfohlen
Amazon CloudWatch metrics for Amazon EC2 Auto ScalingAWS Gruppenmetriken werden erst nach Aktivierung im 1-Minuten-Takt veröffentlicht, GroupDesiredCapacity (Anzahl, die gehalten werden soll), GroupPendingInstances (Instanzen, die noch nicht in Betrieb sind), GroupInServiceInstances (Instanzen in Betrieb)