한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Libro blanco del lag en juegos › L5 Equipos de red del centro de datos

Failover de equipos de red Network device failover

ID de la causa dc-failover · Responsable principal Infraestructura de red (Equipo de infraestructura) · También Desarrollo de servidor (Equipo de desarrollo), Desarrollo de cliente (Equipo de desarrollo)

Abrir la ficha interactiva con gráficos y simulaciones →

Cuando falla un router o un firewall y el tráfico pasa al dispositivo de reserva (failover), todos se quedan congelados durante unos segundos.

Por qué Paso al dispositivo de reserva por una avería o un mantenimiento → Efecto El cambio tarda unos segundos, y si la información de sesión no está sincronizada, las conexiones se reinician → En pantalla Congelamiento simultáneo de todos los jugadores del servidor, desconexión masiva

Síntomas
Congelamiento, Desconexión
Factores
Pérdida de paquetes
A quién afecta
Todo el servidor
Cuándo
De vez en cuando, al azar
Responsable
Responsable principal Infraestructura de red (Equipo de infraestructura) · También Desarrollo de servidor (Equipo de desarrollo), Desarrollo de cliente (Equipo de desarrollo)
Tareas (Equipo de desarrollo)
Servidor: usar timeouts que aguanten cortes breves (unos segundos), permitir retomar la sesión con un token de sesión al reconectar tras un corte. Cliente: reconectar automáticamente si se corta (con intervalos de reintento aleatorios para que no se conecten todos a la vez).
Tareas (Equipo de infraestructura)
Usar redundancia que comparta el estado de las conexiones, detectar averías en menos de 1 segundo con BFD, probar el failover con regularidad.
Cifras de referencia
Unos 1–3 segundos si el dispositivo detecta la avería al instante. Sin detección rápida de fallos (BFD), si todo depende de los temporizadores por defecto de BGP, la ruta puede quedar cortada 90–180 segundos hasta que los dispositivos vecinos lo detectan.
En el gráfico
Desconexión masiva · Conexiones, tráfico total del servidor (entrada/salida)
Dónde mirar
Los logs de eventos de routers y firewalls (cambios de rol VRRP, caída de sesiones BFD y BGP, registros de failover) junto al número total de conexiones y el tráfico del servidor a la misma hora
Se confirma si
A la hora del cambio en el log del dispositivo, el tráfico de todos los servidores que hay detrás cae a 0 durante unos segundos o el número de conexiones baja a la vez
Se descarta si
Si solo bajan las conexiones de un servidor, apunta a “Crash del servidor” o “Problemas de driver y firmware de la NIC”. Si los logs de los dispositivos están limpios y el servidor que se detuvo es una sola VM en la nube, a “Mantenimiento del host en la nube y migración en vivo”
Se verifica con
Con herramientas de infraestructura (no hace falta código del juego)

Fuentes

  1. RFC 5880: Bidirectional Forwarding Detection (BFD) IETF
    El mecanismo Hello de los protocolos de enrutamiento tarda 1 segundo o más en detectar un fallo; BFD se creó para detectarlo en menos tiempo
  2. RFC 7938: Use of BGP for Routing in Large-Scale Data Centers IETF
    Si solo se confía en los keepalive de BGP, la convergencia es lenta; si la sesión se corta en cuanto cae el enlace, el fallo se detecta en ms y se vuelve a converger
  3. RFC 5798: Virtual Router Redundancy Protocol (VRRP) Version 3 for IPv4 and IPv6 IETF
    Anuncios VRRP cada 1 s por defecto; el dispositivo de reserva toma el rol si los anuncios se interrumpen durante más de unas 3 veces el intervalo (poco más de 3 s con la configuración por defecto)

Ver también

Misma capa: L5 Equipos de red del centro de datos

Causas de otras capas con el mismo síntoma (Congelamiento)

Ver la ficha interactiva con gráficos y simulaciones