Si un transceptor óptico o un cable está defectuoso, se corrompe una proporción constante de los paquetes que pasan por esa ruta.
Por qué Errores de bits por un transceptor óptico o un cable defectuoso → Efecto El dispositivo descarta en silencio los paquetes corruptos → En pantalla Solo algunos servidores o jugadores que usan esa ruta sufren teletransporte o rubber banding por una pérdida constante
Responsable principal Infraestructura de red (Equipo de infraestructura)
Tareas (Equipo de infraestructura)
Monitorear los contadores de errores de puerto (CRC) y poner alertas, reemplazar piezas como transceptores ópticos y cables, sacar el enlace problemático y desviar el tráfico hasta que se reemplace.
En el gráfico
Alto solo en algunos · Errores CRC por puerto, tasa de pérdida por servidor/ruta
Dónde mirar
Mirar los contadores CRC de los dos extremos del enlace. En los switches, los errores de FCS (dot3StatsFCSErrors) y de entrada (ifInErrors) del puerto; en los servidores, crc dentro de RX errors en ip -s -s link (estadística del kernel rx_crc_errors)
Se confirma si
Los errores CRC de un puerto suben de forma constante, sin relación con el volumen de tráfico ni con la hora, y solo hay pérdida en los servidores y jugadores que pasan por ese puerto
Se descarta si
Si no hay errores CRC y solo suben los descartes de salida, apunta a congestión (“Microrráfagas en el switch”, “Saturación del enlace del centro de datos”)
Se verifica con
Con herramientas de infraestructura (no hace falta código del juego)
Fuentes
Understanding and Mitigating Packet Corruption in Data Center Networks (SIGCOMM 2017)ACM Análisis de 350,000 enlaces de centros de datos: la corrupción viene de transceptores ópticos defectuosos, fibra dañada y conectores sucios; la tasa de corrupción es constante y no depende del uso; los enlaces problemáticos se sacan para repararlos manteniendo suficientes rutas