Incidents & Alerts

이상징후 · 알림 규칙 · 알림 정책

Alertmanager 연동 상태

Prometheus에서 Alertmanager를 찾지 못했습니다

Alertmanager 컨테이너 상태와 monitoring/prometheus/prometheus.yml의 alerting.alertmanagers 설정을 확인하세요.

Notification Policy

심각도별 전달 채널과 담당·재알림 주기

심각도조건전달 채널담당재알림
Critical서비스 전체 Down, DB HA 장애, Disk 95% 이상메신저 + 문자온콜 담당자15분마다
High5xx 급증, HPA 확장 불가담당팀 메신저 채널서비스 담당팀30분마다
WarningCPU · Memory 지속 상승, Consumer Lag 증가모니터링 채널당번 엔지니어120분마다
Info배포 완료, ConfigMap · Secret 변경타임라인 기록--

동일 Incident에 대한 중복 알림은 재알림 주기 내에서 하나로 묶여 전달됩니다.