로드밸런서 헬스체크가 잠깐 느린 서버를 바로 빼지 않도록 실패 횟수·간격에 여유, 한꺼번에 빠지는 서버 수 제한.
그래프에서는
한도에 닿아 평평해짐 · 서비스별 응답 시간·오류율, 스레드·커넥션 사용 수
확인할 곳
서비스별 응답 시간·오류율·재시도 수를 시간축을 맞춰 한 화면에 놓고 가장 먼저 느려진 곳을 찾음. 로드밸런서 뒤라면 대상 응답 시간(AWS ALB는 TargetResponseTime), 대상의 5xx 수(HTTPCode_Target_5XX_Count), 비정상으로 빠진 대상 수(UnHealthyHostCount)
이러면 맞음
한 서비스의 지연이 먼저 오르고 뒤이어 그 서비스를 부르는 쪽의 스레드·커넥션 사용 수가 한도에 붙으며 오류가 다른 서비스로 번지고, 재시도 수와 빠진 대상 수가 함께 늘어남
이러면 아님
여러 서비스가 같은 순간 함께 느려졌다면 공용 자원(DB, 네트워크, 호스트) 장애부터 봄
확인 수단
인프라 도구로 확인(게임 코드 불필요)
더 알아보기
헬스체크(살아 있는지 확인하는 검사)도 연쇄를 키웁니다. 바쁜 서버가 검사에 늦게 답하면 로드밸런서가 멀쩡한 서버를 빼 버리고 그 트래픽이 남은 서버로 몰려 다음 서버도 늦어집니다.