Agotamiento de los créditos de ráfaga del disco en la nube Burst credit depletion
ID de la causa dk-burst · Responsable principal Infraestructura de servidores (Equipo de infraestructura) · También Infraestructura de BD (Equipo de infraestructura)
Algunos discos en la nube y las instancias pequeñas tienen créditos de ráfaga para rendir por encima de su nivel base durante un rato; si la actividad intensa se alarga y los créditos se agotan, la velocidad cae de golpe.
Por qué Uso prolongado por encima del rendimiento base → Efecto Se agotan los créditos de ráfaga y el rendimiento cae de golpe al nivel base → En pantalla Cada noche, el lag empieza al cabo de unas horas
Horas pico de la noche, Cuanto más tiempo lleva encendido
Responsable
Responsable principal Infraestructura de servidores (Equipo de infraestructura) · También Infraestructura de BD (Equipo de infraestructura)
Tareas (Equipo de infraestructura)
Servidores/SO: usar discos con rendimiento garantizado (gp3 o con IOPS aprovisionadas), poner alertas sobre el saldo de créditos, revisar también el límite de ráfaga del ancho de banda de disco de la instancia y los créditos de CPU. Servidores de BD: pasar también a rendimiento garantizado los discos de la BD, incluidas las BD gestionadas, y poner alertas sobre el saldo de créditos.
Cifras de referencia
Un disco gp2 de 100 GB de AWS da normalmente 300 IOPS y 3,000 IOPS en ráfaga, y con los créditos llenos aguanta unos 30 minutos. gp3 da siempre 3,000, sin créditos. Los Premium SSD pequeños de Azure también hacen ráfagas de hasta 30 minutos con créditos.
En el gráfico
Topa con el límite · IOPS, saldo de créditos de ráfaga
Dónde mirar
BurstBalance de EBS en CloudWatch (gp2, st1, sc1), EBSIOBalance% y EBSByteBalance% de la instancia (algunas instancias con capacidad de ráfaga) y CPUCreditBalance de las instancias de rendimiento ampliable (burstable). En Azure, métricas de uso de créditos de ráfaga como Data Disk Used Burst IO Credits Percentage
Se confirma si
Desde que el saldo cae cerca de 0, las IOPS (VolumeReadOps, VolumeWriteOps) se quedan planas en el rendimiento base, y VolumeQueueLength y el lag aumentan a la vez. Empieza después de varias horas de pico
Se descarta si
Si todos los saldos están holgados y aun así las IOPS se quedan planas, apunta al límite fijo del volumen o de la instancia (dk-iops)
Se verifica con
Con herramientas de infraestructura (no hace falta código del juego)
Para saber más
Aunque el disco esté bien, las máquinas virtuales pequeñas tienen un límite de ráfaga en el propio ancho de banda de disco de la instancia (por ejemplo, al menos 30 minutos al día), y el gráfico tiene la misma forma. Los servidores económicos que usan créditos de CPU también bajan al rendimiento base cuando se les acaban los créditos.
Fuentes
Amazon EBS General Purpose SSD volumesAWS Rendimiento base de gp2: 3 IOPS por GiB (mínimo 100); ráfagas de hasta 3,000 IOPS con créditos de E/S, con 5.4 millones de créditos para al menos 30 minutos. gp3 da siempre 3,000 IOPS, sin ráfagas
Managed disk burstingMicrosoft Azure Los Premium SSD P20 y menores hacen ráfagas basadas en créditos; con los créditos llenos, 30 minutos a la velocidad máxima de ráfaga
Amazon EBS-optimized instance typesAWS Algunas instancias mantienen el rendimiento máximo de EBS solo 30 minutos una vez cada 24 horas y luego vuelven al rendimiento base
Standard mode for burstable performance instancesAWS En modo estándar, cuando una instancia de rendimiento ampliable se queda sin créditos de CPU, su uso de CPU baja al nivel base (de forma gradual, sin caída brusca)
Amazon CloudWatch metrics for Amazon EBSAWS BurstBalance: saldo (%) de créditos de E/S de gp2 y de créditos de throughput de st1 y sc1; VolumeReadOps, VolumeWriteOps, VolumeQueueLength
CloudWatch metrics that are available for your instancesAWS EBSIOBalance% y EBSByteBalance%: saldo de créditos de EBS de algunas instancias que hacen ráfagas de 30 minutos una vez cada 24 horas; CPUCreditBalance: saldo de créditos de CPU de las instancias de rendimiento ampliable
Disk metricsMicrosoft Azure Porcentaje de uso de créditos de ráfaga de discos y VM, como Data Disk Used Burst IO Credits Percentage (cada 5 minutos)