Failover de equipos de red Network device failover
ID de la causa dc-failover · Responsable principal Infraestructura de red (Equipo de infraestructura) · También Desarrollo de servidor (Equipo de desarrollo), Desarrollo de cliente (Equipo de desarrollo)
Cuando falla un router o un firewall y el tráfico pasa al dispositivo de reserva (failover), todos se quedan congelados durante unos segundos.
Por qué Paso al dispositivo de reserva por una avería o un mantenimiento → Efecto El cambio tarda unos segundos, y si la información de sesión no está sincronizada, las conexiones se reinician → En pantalla Congelamiento simultáneo de todos los jugadores del servidor, desconexión masiva
Responsable principal Infraestructura de red (Equipo de infraestructura) · También Desarrollo de servidor (Equipo de desarrollo), Desarrollo de cliente (Equipo de desarrollo)
Tareas (Equipo de desarrollo)
Servidor: usar timeouts que aguanten cortes breves (unos segundos), permitir retomar la sesión con un token de sesión al reconectar tras un corte. Cliente: reconectar automáticamente si se corta (con intervalos de reintento aleatorios para que no se conecten todos a la vez).
Tareas (Equipo de infraestructura)
Usar redundancia que comparta el estado de las conexiones, detectar averías en menos de 1 segundo con BFD, probar el failover con regularidad.
Cifras de referencia
Unos 1–3 segundos si el dispositivo detecta la avería al instante. Sin detección rápida de fallos (BFD), si todo depende de los temporizadores por defecto de BGP, la ruta puede quedar cortada 90–180 segundos hasta que los dispositivos vecinos lo detectan.
En el gráfico
Desconexión masiva · Conexiones, tráfico total del servidor (entrada/salida)
Dónde mirar
Los logs de eventos de routers y firewalls (cambios de rol VRRP, caída de sesiones BFD y BGP, registros de failover) junto al número total de conexiones y el tráfico del servidor a la misma hora
Se confirma si
A la hora del cambio en el log del dispositivo, el tráfico de todos los servidores que hay detrás cae a 0 durante unos segundos o el número de conexiones baja a la vez
Se descarta si
Si solo bajan las conexiones de un servidor, apunta a “Crash del servidor” o “Problemas de driver y firmware de la NIC”. Si los logs de los dispositivos están limpios y el servidor que se detuvo es una sola VM en la nube, a “Mantenimiento del host en la nube y migración en vivo”
Se verifica con
Con herramientas de infraestructura (no hace falta código del juego)