Cuando un bug del driver o una función que falla deja colgada la tarjeta, se corta todo el envío y la recepción mientras se reinicia.
Por qué Bug del driver, fallo de una función de offload → Efecto La NIC se cuelga y se reinicia (unos segundos) → En pantalla Todos los jugadores de ese servidor se congelan a la vez y luego hay teletransporte o desconexión
De vez en cuando, al azar, Cuanto más tiempo lleva encendido
Responsable
Responsable principal Infraestructura de servidores (Equipo de infraestructura)
Tareas (Equipo de infraestructura)
Revisar en el log del kernel los registros “transmit queue … timed out” y “Link is Down” y poner alertas, actualizar drivers y firmware, desactivar la función problemática (un offload, por ejemplo).
En el gráfico
Hueco y luego ráfaga · Paquetes enviados/recibidos del servidor
Dónde mirar
Buscar con dmesg en el log del kernel “NETDEV WATCHDOG … transmit queue N timed out”, los reinicios del driver y los registros “Link is Down” y “Link is Up”, y mirar los paquetes enviados y recibidos del servidor a esas horas
Se confirma si
En el momento del corte, el log del kernel tiene un timeout de la cola de transmisión o registros de enlace caído y restablecido (down/up), y durante esos segundos los paquetes enviados y recibidos caen a 0
Se descarta si
Si el log del kernel está limpio y el puerto del lado del switch está bien, apunta a una detención del proceso del servidor del juego (“Pausa stop-the-world del GC en el servidor”, “Deadlock”) o a “Failover de equipos de red”
Se verifica con
Con herramientas de infraestructura (no hace falta código del juego)
Fuentes
net/sched/sch_generic.c (Linux v6.12)Linux kernel Cuando una cola de transmisión se atasca, el watchdog del kernel registra “NETDEV WATCHDOG … transmit queue N timed out” y llama a la función de reinicio del driver