Stürzt der Serverprozess durch einen unbehandelten Fehler ab, bricht für alle auf diesem Server gleichzeitig die Verbindung ab.
Warum Fatale Fehler wie Verweise auf nicht existierende Objekte (Null-Referenz), fehlerhafte Daten oder Speichermangel → Folge Prozess des Servers (oder der Zone) wird beendet → Auf dem Bildschirm Verbindungsabbruch für alle gleichzeitig, Fortschritt seit dem letzten Speichern wird unter Umständen zurückgesetzt (Rollback)
Ursache anhand von Crash-Dumps finden und beheben, häufig speichern.
Aufgaben Infrastrukturteam
Prozess automatisch neu starten, Umgebung zum Sammeln und Aufbewahren von Crash-Dumps bereitstellen, bei Serverausfall sofort alarmieren.
Im Graphen
Verbindungen brechen gleichzeitig ab · Verbindungen, Prozessneustarts
Wo nachsehen
Core-Dump-Einträge in coredumpctl list (Zeitpunkt, PID, Signal) und Einträge des Dienstmanagers (systemd) zu abnormalen Beendigungen und Neustarts prüfen. Bei Windows-Servern die von WER geschriebenen Dump-Dateien
Spricht dafür
Zum Zeitpunkt, an dem die Verbindungen schlagartig gegen 0 fallen, gibt es eine abnormale Beendigung des Spielserverprozesses und einen Core-Dump
Spricht dagegen
Prozess lief durchgehend weiter, Verbindungen trotzdem abgebrochen: eher Netzwerkgeräte oder Idle-Timeout. Eintrag über einen Watchdog-Neustart nach langem Stillstand: eher Endlosschleife oder Deadlock
Prüfmittel
Mit Infrastruktur-Tools prüfbar (ohne Spielcode)
Quellen
Collecting User-Mode DumpsMicrosoft Windows-Fehlerberichterstattung (WER) so konfigurieren, dass beim Absturz eines User-Mode-Programms vollständige Dumps oder Minidumps lokal gesammelt werden
systemd.service(5) — Linux manual pagesystemd Restart=on-failure startet den Dienst nach abnormaler Beendigung, Beendigung durch ein Signal (einschließlich Core-Dump) oder Watchdog-Timeout automatisch neu, empfohlen für langlaufende Dienste
coredumpctl(1) — Linux manual pagesystemd list zeigt die von systemd-coredump gespeicherten Core-Dumps mit Absturzzeitpunkt, PID und auslösendem Signal