Khi tiến trình server chết vì một lỗi không được xử lý, mọi người trên server đó mất kết nối cùng lúc.
Vì sao Lỗi nghiêm trọng như tham chiếu tới thứ không tồn tại (null reference), dữ liệu sai, hết bộ nhớ → Dẫn đến Tiến trình server (hoặc zone) kết thúc → Trên màn hình Mọi người cùng mất kết nối, tiến độ từ lần lưu cuối có thể bị rollback
Thỉnh thoảng bất chợt, Khi làm một thao tác nhất định
Phụ trách
Phụ trách chính Phát triển server (Đội phát triển game) · Phối hợp Hạ tầng server (Đội hạ tầng)
Việc cần làm (Đội phát triển game)
Phân tích crash dump để sửa nguyên nhân, lưu thường xuyên.
Việc cần làm (Đội hạ tầng)
Tự động khởi động lại tiến trình, dựng môi trường thu thập và lưu trữ crash dump, cảnh báo ngay khi server sập.
Trên đồ thị
Rớt kết nối hàng loạt · Số kết nối, số lần tiến trình khởi động lại
Chỗ cần xem
Bản ghi core dump trong coredumpctl list (thời điểm, PID, tín hiệu kết thúc) và bản ghi kết thúc bất thường, khởi động lại của trình quản lý service (systemd). Với server Windows, xem file dump do WER lưu lại
Đúng nếu
vào lúc số kết nối tụt gần về 0 trong chớp mắt, tiến trình server game kết thúc bất thường và có core dump
Loại trừ nếu
tiến trình vẫn sống mà kết nối bị ngắt → thiết bị mạng hoặc idle timeout. Có bản ghi watchdog khởi động lại sau khi treo lâu → vòng lặp vô hạn hoặc deadlock
Cách kiểm tra
Kiểm tra bằng công cụ hạ tầng (không cần code game)
Nguồn
Collecting User-Mode DumpsMicrosoft Cấu hình Windows Error Reporting (WER) để thu full dump hoặc mini dump về máy cục bộ khi chương trình user mode bị crash
systemd.service(5) — Linux manual pagesystemd Restart=on-failure tự khởi động lại service khi kết thúc bất thường, bị tín hiệu kết thúc (kể cả có core dump) hoặc quá thời gian watchdog; khuyến nghị cho service chạy lâu dài
coredumpctl(1) — Linux manual pagesystemd list truy vấn các core dump do systemd-coredump lưu, hiển thị thời điểm crash, PID và tín hiệu gây crash