서버 장비·OS: 전원 보호 기능이 있는 서버용 SSD, 디스크 대기열 길이·fsync 지연 모니터링. DB 장비: 저장이 DB로 가면 DB 로그 디스크도 같은 SSD로, 커밋 지연 모니터링.
수치 감각
한 번에 걸리는 시간은 장비마다 다르지만 대략 서버용 SSD(전원 보호 기능) 0.1ms, 보통 SSD 1~수 ms, 클라우드 디스크 1~2ms, HDD 10ms 이상. 한 스레드가 하나씩 기다리면 HDD는 1초에 100번도 못 합니다.
그래프에서는
일정 주기로 튐 · 디스크 대기열 길이, 플러시·쓰기 지연
확인할 곳
iostat -x 1의 f/s·f_await(디스크가 처리한 플러시 수와 걸린 시간), w/s·aqu-sz·w_await를 정기 저장·로그아웃 시각과 겹쳐 봄. 예전 sysstat은 aqu-sz를 avgqu-sz로 표시함. 클라우드 디스크는 EBS의 VolumeQueueLength·VolumeAvgWriteLatency를 봄
이러면 맞음
저장 시각·로그아웃 러시마다 플러시 수와 대기열 길이가 함께 솟고 w_await·f_await가 평소의 몇 배가 됨. 그때 저장·채널 이동이 늦어짐
이러면 아님
저장·로그아웃과 상관없는 시각에 대기열이 솟으면 백업·압축(dk-backup)이나 IOPS 한도(dk-iops). 플러시 수는 그대로인데 느려지면 버스트 크레딧 소진(dk-burst) 쪽