Alert Rules
14개 규칙 · 현재 8개 발화 중
| 분류 | 규칙 | 조건 | 심각도 | 상태 |
|---|---|---|---|---|
| 사용자 영향 | 성공률 저하 | 5분 평균 성공률 < 99.0% (SLO 기반) | Critical | 발화 중 |
| API | 5xx 급증 | 5xx 비율 5% 초과 (최소 요청 수 10 이상) | Critical | 발화 중 |
| API | 4xx 급증 | 4xx 비율이 전체 대비 15%p 이상 급증 | Warning | 정상 |
| Compute | CPU 90% | 5분 이상 CPU 사용률 90% 초과 지속 | Warning | 정상 |
| Memory | Memory 80~90% | Working Set 기준 80% 경고, 90% OOM 위험 | Warning | 정상 |
| Disk | Disk 사용률 | 80% Warning, 90% Critical (증가 속도 반영) | Warning | 정상 |
| Pod | CrashLoop · Not Ready | 지정 시간 기준 재시작 반복 감지 | Critical | 발화 중 |
| DB | Slow Query | 쿼리 fingerprint별 기준치 초과 또는 timeout | Warning | 발화 중 |
| DB | Connection Pool 포화 | Pool 사용률 90% 초과 5분 지속 | Critical | 발화 중 |
| Kafka | Consumer Lag | Lag 임계값 초과 + 처리 지연시간 동시 충족 | Warning | 발화 중 |
| Network | Port · Endpoint Down | 연속 3회 실패 시 Down 처리 | Critical | 발화 중 |
| Capacity | HPA 확장 불가 | 필요 replica > 클러스터 여유 | High | 정상 |
| API | p95 지연시간 초과 | p95 800ms 초과 5분 지속 (SLO 기반) | Warning | 발화 중 |
| Observability | Telemetry 수집 중단 | Prometheus 자체 관측 5분 이상 두절 | Critical | 정상 |
Prometheus에 연결할 수 없어 전체 규칙이 시뮬레이션 값으로 표시되고 있습니다.