Quando um bug no driver ou um recurso com mau funcionamento faz a placa parar de responder, todo o tráfego de entrada e saída é interrompido enquanto ela reinicia.
Por quê Bug no driver, recurso de offload com mau funcionamento → Efeito A NIC para de responder e reinicia (alguns segundos) → Na tela Todos naquele servidor travam juntos e depois têm teleporte ou desconexão
Aleatoriamente, de vez em quando, Quanto mais tempo ligado
Responsável
Responsável principal Infraestrutura de servidores (Equipe de infraestrutura)
O que fazer (Equipe de infraestrutura)
Verificar e criar alertas para as mensagens “transmit queue … timed out” e “Link is Down” no log do kernel, atualizar drivers e firmware, desligar o recurso problemático (como um offload).
No gráfico
Lacuna e depois tudo junto · Pacotes enviados e recebidos pelo servidor
Onde olhar
Procurar com dmesg, no log do kernel, “NETDEV WATCHDOG … transmit queue N timed out”, resets do driver e registros “Link is Down” e “Link is Up”, e ver os pacotes enviados e recebidos pelo servidor nesses horários
Confirma se
No horário da parada, o log do kernel tem timeout da fila de transmissão ou registros de link down/up, e os pacotes enviados e recebidos caem a 0 nesses poucos segundos
Descarta se
Log do kernel limpo e a porta do lado do switch normal: parada no processo do servidor do jogo (“Pausa stop-the-world do GC no servidor”, “Deadlock”) ou “Failover de equipamento de rede”
Como verificar
Ferramentas de infra (sem precisar do código do jogo)
Fontes
net/sched/sch_generic.c (Linux v6.12)Linux kernel Quando uma fila de transmissão para, o watchdog do kernel registra “NETDEV WATCHDOG … transmit queue N timed out” e chama a função de reset do driver