한국어English日本語简体中文繁體中文DeutschไทยTiếng ViệtРусскийPortuguês (Brasil)EspañolBahasa Indonesia

Buku Putih Lag Game › L6 Kartu jaringan server

Maintenance host cloud dan live migration Cloud host maintenance / live migration

ID penyebab nic-host-maintenance · Penanggung jawab utama Infrastruktur server (Tim Infrastruktur) · Turut terlibat Pengembangan server (Tim Pengembang Game), Pihak Eksternal (Pihak Eksternal)

Buka kartu interaktif dengan gambar dan simulasi →

Saat penyedia cloud melakukan maintenance pada server fisik (host), virtual machine dipindahkan ke host lain (live migration) atau dihentikan sementara. Selama itu seluruh server terhenti, dan jika jedanya lama, koneksi terputus.

Mengapa Penyedia memindahkan virtual machine ke host lain atau menjedanya sementara karena maintenance host atau prediksi kerusakan → Akibatnya Selama dipindahkan, CPU, memori, dan jaringan melambat, dan di akhir proses virtual machine berhenti total sesaat (kurang dari 1 detik hingga sekitar 30 detik, tergantung penyedia dan caranya) → Di layar Semua pemain di server mengalami freeze bersamaan lalu fast forward atau teleport; jika jedanya lebih lama dari timeout, terjadi disconnect massal

Gejala
Freeze, Fast forward, Teleport, Disconnect
Faktor
Stall, Packet loss
Siapa yang mengalami
Seluruh server
Kapan
Sesekali secara acak
Penanggung jawab
Penanggung jawab utama Infrastruktur server (Tim Infrastruktur) · Turut terlibat Pengembangan server (Tim Pengembang Game), Pihak Eksternal (Pihak Eksternal)
Tugas Tim Pengembang Game
Pakai timeout yang tahan terhadap jeda beberapa detik, batasi jumlah tick yang dikejar setelah jeda, hitung waktu yang berlalu dengan monotonic clock, siapkan prosedur untuk menyimpan progres dan memindahkan pemain ke server lain saat menerima pemberitahuan maintenance.
Tugas Tim Infrastruktur
Berlangganan pemberitahuan maintenance dan pasang alert (Google Cloud maintenance-event, AWS scheduled event dan AWS Health, Azure Scheduled Events), ganti server lebih awal di jam sepi pemain saat menerima pemberitahuan, atur waktu maintenance jika penyedia mengizinkan (Azure Maintenance Configuration, AWS scheduled event tergantung jenisnya), cocokkan catatan maintenance dengan catatan insiden.
Tugas Pihak Eksternal
Pastikan jadwal dan cakupan dampak maintenance ke penyedia cloud, laporkan jika jeda berulang di instance yang sama.
Kisaran angka
Google Compute Engine menyatakan jeda live migration biasanya jauh lebih singkat dari 1 detik, dan selama jeda, jam sistem bisa melompat maju hingga 5 detik. Nilai maintenance-event di metadata berubah 60 detik sebelum pemindahan (jika nilai ini sudah pernah di-query minimal sekali sebelumnya). Untuk maintenance yang tidak memerlukan reboot, Azure hampir selalu berhenti kurang dari 10 detik dan dalam kasus yang jarang (untuk ukuran umum maksimal sekali dalam 18 bulan) sekitar 30 detik, sedangkan live migration biasanya tidak lebih dari 5 detik. Azure Scheduled Events memberi tahu jeda seperti ini (Freeze) minimal 15 menit sebelumnya. Namun, jika hardware host tiba-tiba rusak, pemulihan langsung dimulai tanpa pemberitahuan.
Di grafik
Kosong lalu datang sekaligus · Jumlah paket kirim dan terima server, interval tick
Yang diperiksa
Cocokkan waktu jeda dengan catatan penyedia. Google Cloud: compute.instances.migrateOnHostMaintenance di audit log; AWS: scheduled event di describe-instance-status dan AWS Health; Azure: Microsoft.Compute/virtualMachines/liveMigration/action di Activity Log dan waktu ketika metrik ketersediaan VM (VmAvailabilityMetric) turun ke 0. Di dalam server, periksa apakah metrik dan log kosong selama jeda dan apakah jam melompat sesudahnya (log sinkronisasi waktu)
Cocok jika
Waktu seluruh server berhenti bertepatan dengan waktu maintenance atau migrasi yang dicatat penyedia, dan selama beberapa detik itu semua metrik dan log di dalam server kosong
Tidak cocok jika
Tidak ada di catatan penyedia dan jeda singkat sering berulang: lebih mungkin “CPU steal (virtual machine)”. Ada catatan reset NIC di log kernel: lebih mungkin “Masalah driver dan firmware NIC”
Sarana pemeriksaan
Tools infrastruktur (tanpa perlu kode game)
Pelajari lebih lanjut
AWS memberi tahu lewat scheduled event. system-reboot berarti instance di-reboot sambil dipindahkan ke host baru, dan system-maintenance berarti instance bisa terdampak sesaat oleh maintenance jaringan atau listrik. Walau jedanya hanya beberapa detik, klien yang tidak menerima ACK untuk paket yang dikirim ke server selama itu menggandakan waktu tunggu retransmisi berulang kali, sehingga koneksi TCP bisa tetap terhenti lebih lama walau server sudah berjalan lagi (“RTO TCP dan exponential backoff”). Setelah bangun dari jeda, jam bisa melompat dan berlanjut ke “Lompatan jam sistem (NTP step)”, dan health check load balancer bisa gagal sehingga server itu dikeluarkan sementara. Instance yang tidak bisa dipindahkan (seperti instance bare metal di Google Cloud) dihentikan atau dijalankan ulang saat maintenance.

Sumber

  1. Live migration process during maintenance events Google Cloud
    Jeda live migration biasanya jauh lebih singkat dari 1 detik; selama jeda, jam sistem melompat maju hingga 5 detik; performa disk, CPU, memori, dan jaringan turun sementara selama pemindahan; VM yang tidak menjalani live migration dimatikan saat maintenance (instance bare metal tidak didukung)
  2. Query metadata server for maintenance event notices Google Cloud
    Nilai metadata maintenance-event berubah 60 detik sebelum live migration (jika VM diatur untuk live migration dan nilai ini sudah di-query minimal sekali sejak maintenance terakhir)
  3. Monitor and plan for a host maintenance event Google Cloud
    Saat maintenance, system event compute.instances.migrateOnHostMaintenance tercatat di audit log
  4. Scheduled events for Amazon EC2 instances AWS
    Jenis scheduled event (system-reboot: di-reboot sambil dipindahkan ke host baru; system-maintenance: terdampak sesaat oleh maintenance jaringan atau listrik), pemberitahuan lewat email dan AWS Health, diperiksa dengan describe-instance-status, waktunya bisa diatur tergantung jenisnya
  5. Maintenance and updates Microsoft Azure
    Maintenance tanpa reboot hampir selalu berhenti kurang dari 10 detik, dalam kasus yang jarang (untuk ukuran umum maksimal sekali dalam 18 bulan) sekitar 30 detik; live migration biasanya maksimal 5 detik; jam disinkronkan otomatis setelah jeda; koneksi TCP yang berumur panjang bisa terputus, atau pihak lawan mengirim ulang data yang ditujukan ke VM yang terhenti dengan exponential backoff sehingga pemulihan makin lambat; health check load balancer menilai tidak sehat dalam sekitar 10 detik; diperiksa lewat Microsoft.Compute/virtualMachines/liveMigration/action di Activity Log dan VmAvailabilityMetric yang menjadi 0 selama jeda; waktu penerapan dipilih dengan Maintenance Configuration
  6. Scheduled Events for Linux VMs in Azure Microsoft Azure
    Freeze (jeda beberapa detik, CPU dan jaringan bisa berhenti) diberitahukan minimal 15 menit sebelumnya; saat hardware host rusak, pemulihan langsung dimulai tanpa masa pemberitahuan

Lihat juga

Lapisan yang sama: L6 Kartu jaringan server

Penyebab di lapisan lain dengan gejala yang sama (Freeze)

Lihat kartu interaktif dengan gambar dan simulasi