한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Guia do Lag em Jogos › L5 Equipamentos de rede do data center

Failover de equipamento de rede Network device failover

ID da causa dc-failover · Responsável principal Infraestrutura de rede (Equipe de infraestrutura) · Também envolvidos Desenvolvimento do servidor (Equipe de desenvolvimento), Desenvolvimento do cliente (Equipe de desenvolvimento)

Abrir o card interativo, com figuras e simulações →

Quando um roteador ou firewall falha e o tráfego passa para o equipamento reserva (failover), o jogo trava para todo mundo por alguns segundos.

Por quê Troca para o equipamento reserva por falha ou manutenção → Efeito A troca leva alguns segundos, e as conexões são reiniciadas se as informações de sessão não estiverem sincronizadas → Na tela Travamento para todos os jogadores do servidor ao mesmo tempo, desconexões em massa

Sintomas
Travamento, Desconexão
Fatores
Perda de pacotes
Quem é afetado
Servidor inteiro
Quando
Aleatoriamente, de vez em quando
Responsável
Responsável principal Infraestrutura de rede (Equipe de infraestrutura) · Também envolvidos Desenvolvimento do servidor (Equipe de desenvolvimento), Desenvolvimento do cliente (Equipe de desenvolvimento)
O que fazer (Equipe de desenvolvimento)
Servidor: usar timeouts que aguentem quedas curtas (alguns segundos), permitir retomar a sessão com um token de sessão ao reconectar depois de uma queda. Cliente: reconectar automaticamente se cair (espalhando aleatoriamente o intervalo entre tentativas para não voltarem todos de uma vez).
O que fazer (Equipe de infraestrutura)
Usar redundância que compartilhe o estado das conexões, detectar falhas em até 1 segundo com BFD, testar o failover regularmente.
Números de referência
Cerca de 1–3 segundos se o equipamento detecta a falha na hora. Sem detecção rápida de falhas (BFD), dependendo só dos timers padrão do BGP, a rota pode ficar fora por 90–180 segundos até o equipamento vizinho perceber.
No gráfico
Queda de conexões em massa · Conexões, tráfego total de entrada e saída do servidor
Onde olhar
Logs de eventos de roteadores e firewalls (troca de papel no VRRP, queda de sessões BFD e BGP, registros de failover) junto com o total de conexões e o tráfego do servidor no mesmo horário
Confirma se
No horário do failover registrado no log do equipamento, o tráfego de todos os servidores atrás dele cai a 0 por alguns segundos, ou as conexões caem todas juntas
Descarta se
Só as conexões de um servidor caem: “Crash do servidor” ou “Problemas de driver ou firmware da NIC”. Logs dos equipamentos limpos, e o servidor parado é uma única VM na nuvem: “Manutenção do host na nuvem e live migration”
Como verificar
Ferramentas de infra (sem precisar do código do jogo)

Fontes

  1. RFC 5880: Bidirectional Forwarding Detection (BFD) IETF
    Os mecanismos de Hello dos protocolos de roteamento levam 1 segundo ou mais para detectar uma falha; o BFD foi criado para detectar em menos tempo
  2. RFC 7938: Use of BGP for Routing in Large-Scale Data Centers IETF
    Contar só com os keepalives do BGP deixa a convergência lenta; encerrar a sessão assim que o link cai detecta a falha em ms e reconverge
  3. RFC 5798: Virtual Router Redundancy Protocol (VRRP) Version 3 for IPv4 and IPv6 IETF
    Anúncios VRRP com padrão de 1 segundo; o equipamento reserva assume o papel quando os anúncios param por mais de cerca de 3 intervalos (pouco mais de 3 segundos na configuração padrão)

Veja também

Mesma camada: L5 Equipamentos de rede do data center

Mesmo sintoma (Travamento) em outras camadas

Ver o card interativo, com figuras e simulações