Incidents & Alerts

이상징후 · 알림 규칙 · 알림 정책

Alert Rules

14개 규칙 · 현재 8개 발화 중

분류규칙조건심각도상태
사용자 영향성공률 저하5분 평균 성공률 < 99.0% (SLO 기반)Critical발화 중
API5xx 급증5xx 비율 5% 초과 (최소 요청 수 10 이상)Critical발화 중
API4xx 급증4xx 비율이 전체 대비 15%p 이상 급증Warning정상
ComputeCPU 90%5분 이상 CPU 사용률 90% 초과 지속Warning정상
MemoryMemory 80~90%Working Set 기준 80% 경고, 90% OOM 위험Warning정상
DiskDisk 사용률80% Warning, 90% Critical (증가 속도 반영)Warning정상
PodCrashLoop · Not Ready지정 시간 기준 재시작 반복 감지Critical발화 중
DBSlow Query쿼리 fingerprint별 기준치 초과 또는 timeoutWarning발화 중
DBConnection Pool 포화Pool 사용률 90% 초과 5분 지속Critical발화 중
KafkaConsumer LagLag 임계값 초과 + 처리 지연시간 동시 충족Warning발화 중
NetworkPort · Endpoint Down연속 3회 실패 시 Down 처리Critical발화 중
CapacityHPA 확장 불가필요 replica > 클러스터 여유High정상
APIp95 지연시간 초과p95 800ms 초과 5분 지속 (SLO 기반)Warning발화 중
ObservabilityTelemetry 수집 중단Prometheus 자체 관측 5분 이상 두절Critical정상

Prometheus에 연결할 수 없어 전체 규칙이 시뮬레이션 값으로 표시되고 있습니다.