Com transceptor óptico ou cabo com defeito, uma proporção constante dos pacotes que passam por aquele caminho chega corrompida.
Por quê Erros de bit por transceptor óptico ou cabo com defeito → Efeito O equipamento descarta em silêncio os pacotes corrompidos → Na tela Só alguns servidores ou jogadores que usam aquele caminho têm teleporte ou rubber banding por perda constante
Responsável principal Infraestrutura de rede (Equipe de infraestrutura)
O que fazer (Equipe de infraestrutura)
Monitorar e criar alertas para os contadores de erro de porta (CRC), trocar peças como transceptores ópticos e cabos, tirar o link problemático e desviar o tráfego até a troca.
No gráfico
Alto só em alguns · Erros de CRC por porta, taxa de perda por servidor/caminho
Onde olhar
Ver os contadores de CRC nas duas pontas do link. No switch, os erros de FCS (dot3StatsFCSErrors) e de entrada (ifInErrors) da porta; no servidor, o crc em RX errors do ip -s -s link (estatística do kernel rx_crc_errors)
Confirma se
Os erros de CRC de uma porta crescem de forma constante, independentemente do volume de tráfego e do horário, e só os servidores e jogadores que passam por essa porta têm perda
Descarta se
Sem erros de CRC e só os descartes de saída aumentando: congestionamento (“Microburst no switch”, “Saturação do link do data center”)
Como verificar
Ferramentas de infra (sem precisar do código do jogo)
Fontes
Understanding and Mitigating Packet Corruption in Data Center Networks (SIGCOMM 2017)ACM Análise de 350 mil links de data center: a corrupção vem de transceptores ópticos com defeito, fibra danificada e conectores sujos; a taxa de corrupção é constante, independentemente da utilização; os links problemáticos são retirados para reparo mantendo caminhos suficientes