Failover de equipamento de rede Network device failover
ID da causa dc-failover · Responsável principal Infraestrutura de rede (Equipe de infraestrutura) · Também envolvidos Desenvolvimento do servidor (Equipe de desenvolvimento), Desenvolvimento do cliente (Equipe de desenvolvimento)
Quando um roteador ou firewall falha e o tráfego passa para o equipamento reserva (failover), o jogo trava para todo mundo por alguns segundos.
Por quê Troca para o equipamento reserva por falha ou manutenção → Efeito A troca leva alguns segundos, e as conexões são reiniciadas se as informações de sessão não estiverem sincronizadas → Na tela Travamento para todos os jogadores do servidor ao mesmo tempo, desconexões em massa
Responsável principal Infraestrutura de rede (Equipe de infraestrutura) · Também envolvidos Desenvolvimento do servidor (Equipe de desenvolvimento), Desenvolvimento do cliente (Equipe de desenvolvimento)
O que fazer (Equipe de desenvolvimento)
Servidor: usar timeouts que aguentem quedas curtas (alguns segundos), permitir retomar a sessão com um token de sessão ao reconectar depois de uma queda. Cliente: reconectar automaticamente se cair (espalhando aleatoriamente o intervalo entre tentativas para não voltarem todos de uma vez).
O que fazer (Equipe de infraestrutura)
Usar redundância que compartilhe o estado das conexões, detectar falhas em até 1 segundo com BFD, testar o failover regularmente.
Números de referência
Cerca de 1–3 segundos se o equipamento detecta a falha na hora. Sem detecção rápida de falhas (BFD), dependendo só dos timers padrão do BGP, a rota pode ficar fora por 90–180 segundos até o equipamento vizinho perceber.
No gráfico
Queda de conexões em massa · Conexões, tráfego total de entrada e saída do servidor
Onde olhar
Logs de eventos de roteadores e firewalls (troca de papel no VRRP, queda de sessões BFD e BGP, registros de failover) junto com o total de conexões e o tráfego do servidor no mesmo horário
Confirma se
No horário do failover registrado no log do equipamento, o tráfego de todos os servidores atrás dele cai a 0 por alguns segundos, ou as conexões caem todas juntas
Descarta se
Só as conexões de um servidor caem: “Crash do servidor” ou “Problemas de driver ou firmware da NIC”. Logs dos equipamentos limpos, e o servidor parado é uma única VM na nuvem: “Manutenção do host na nuvem e live migration”
Como verificar
Ferramentas de infra (sem precisar do código do jogo)
Fontes
RFC 5880: Bidirectional Forwarding Detection (BFD)IETF Os mecanismos de Hello dos protocolos de roteamento levam 1 segundo ou mais para detectar uma falha; o BFD foi criado para detectar em menos tempo