한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Buku Putih Lag Game › L5 Perangkat jaringan data center

Failover perangkat jaringan Network device failover

ID penyebab dc-failover · Penanggung jawab utama Infrastruktur jaringan (Tim Infrastruktur) · Turut terlibat Pengembangan server (Tim Pengembang Game), Pengembangan klien (Tim Pengembang Game)

Buka kartu interaktif dengan gambar dan simulasi →

Saat satu router atau firewall rusak dan dialihkan ke perangkat cadangan (failover), semua pemain mengalami freeze selama beberapa detik.

Mengapa Dialihkan ke perangkat cadangan karena perangkat rusak atau maintenance → Akibatnya Peralihan memakan waktu beberapa detik, dan jika informasi sesi tidak tersinkronisasi, koneksi di-reset → Di layar Semua pemain di server mengalami freeze bersamaan, disconnect massal

Gejala
Freeze, Disconnect
Faktor
Packet loss
Siapa yang mengalami
Seluruh server
Kapan
Sesekali secara acak
Penanggung jawab
Penanggung jawab utama Infrastruktur jaringan (Tim Infrastruktur) · Turut terlibat Pengembangan server (Tim Pengembang Game), Pengembangan klien (Tim Pengembang Game)
Tugas Tim Pengembang Game
Server: pakai timeout yang tahan terhadap putus singkat (beberapa detik), dan jika terputus lalu reconnect, lanjutkan sesi lewat token sesi. Klien: reconnect otomatis jika terputus (sebar interval percobaan ulang secara acak agar tidak menyerbu bersamaan).
Tugas Tim Infrastruktur
Pakai redundansi yang berbagi status koneksi, deteksi kerusakan dalam 1 detik dengan BFD, uji failover secara berkala.
Kisaran angka
Jika perangkat langsung mendeteksi kerusakan, sekitar 1–3 detik. Jika hanya mengandalkan timer default BGP tanpa deteksi kerusakan cepat (BFD), rute bisa terputus selama 90–180 detik sampai perangkat tetangga mendeteksinya.
Di grafik
Koneksi putus serentak · Jumlah koneksi, volume kirim dan terima seluruh server
Yang diperiksa
Periksa log event router dan firewall (perubahan peran VRRP, sesi BFD atau BGP down, catatan failover) bersama jumlah koneksi dan volume kirim-terima seluruh server pada waktu yang sama
Cocok jika
Pada waktu failover di log perangkat, trafik semua server di belakang perangkat itu menjadi 0 selama beberapa detik atau jumlah koneksi turun bersamaan
Tidak cocok jika
Hanya koneksi satu server yang turun: lebih mungkin “Crash di server” atau “Masalah driver dan firmware NIC”. Log perangkat bersih dan server yang berhenti adalah satu virtual machine di cloud: lebih mungkin “Maintenance host cloud dan live migration”
Sarana pemeriksaan
Tools infrastruktur (tanpa perlu kode game)

Sumber

  1. RFC 5880: Bidirectional Forwarding Detection (BFD) IETF
    Metode Hello pada protokol routing butuh lebih dari 1 detik untuk mendeteksi kerusakan, sehingga dibuat BFD untuk mendeteksinya dalam waktu lebih singkat
  2. RFC 7938: Use of BGP for Routing in Large-Scale Data Centers IETF
    Jika hanya mengandalkan keepalive BGP, konvergensi lambat; jika link down langsung diterima dan sesi diputus, kerusakan terdeteksi dalam skala ms lalu rute konvergen ulang
  3. RFC 5798: Virtual Router Redundancy Protocol (VRRP) Version 3 for IPv4 and IPv6 IETF
    Advertisement VRRP default 1 detik; perangkat cadangan mengambil alih peran jika advertisement berhenti lebih dari sekitar 3 kali intervalnya (dengan pengaturan default, sedikit di atas 3 detik)

Lihat juga

Lapisan yang sama: L5 Perangkat jaringan data center

Penyebab di lapisan lain dengan gejala yang sama (Freeze)

Lihat kartu interaktif dengan gambar dan simulasi