ID da causa sp-crash · Responsável principal Desenvolvimento do servidor (Equipe de desenvolvimento) · Também envolvidos Infraestrutura de servidores (Equipe de infraestrutura)
Quando um erro não tratado derruba o processo do servidor, todos que estavam naquele servidor são desconectados ao mesmo tempo.
Por quê Erro fatal, como referência a algo que não existe (referência nula), dados inválidos ou falta de memória → Efeito O processo do servidor (ou da zona) termina → Na tela Desconexão de todos ao mesmo tempo, e o progresso desde o último salvamento pode sofrer rollback
Aleatoriamente, de vez em quando, Ao fazer ações específicas
Responsável
Responsável principal Desenvolvimento do servidor (Equipe de desenvolvimento) · Também envolvidos Infraestrutura de servidores (Equipe de infraestrutura)
O que fazer (Equipe de desenvolvimento)
Analisar os crash dumps e corrigir a causa, salvar com frequência.
O que fazer (Equipe de infraestrutura)
Reiniciar o processo automaticamente, ter um ambiente para coletar e guardar crash dumps, alertar na hora quando o servidor cair.
No gráfico
Queda de conexões em massa · Conexões, número de reinícios do processo
Onde olhar
Registros de core dump no coredumpctl list (horário, PID, sinal de término) e registros de término anormal e reinício no gerenciador de serviços (systemd). Em servidores Windows, os arquivos de dump gerados pelo WER
Confirma se
No momento em que o número de conexões cai de repente para perto de 0, há um término anormal do processo do servidor do jogo e um core dump
Descarta se
O processo continua vivo, mas as conexões caíram: aponta para equipamentos de rede ou timeout de inatividade. Registro de reinício pelo watchdog após uma parada longa: aponta para loop infinito ou deadlock
Como verificar
Ferramentas de infra (sem precisar do código do jogo)
Fontes
Collecting User-Mode DumpsMicrosoft Configura o Relatório de Erros do Windows (WER) para coletar localmente dumps completos ou mini dumps quando um programa em modo de usuário sofre crash
systemd.service(5) — Linux manual pagesystemd Restart=on-failure reinicia o serviço automaticamente em término anormal, término por sinal (incluindo core dump) ou estouro do tempo do watchdog; recomendado para serviços de longa duração
coredumpctl(1) — Linux manual pagesystemd Consulta com list os core dumps salvos pelo systemd-coredump, mostrando horário do crash, PID e o sinal que causou o crash