Incidents & Alerts

이상징후 · 알림 규칙 · 알림 정책

3건 진행 중 · Critical 2

inc-20260802-001 · 12분 전 · 담당 Backend Platform팀 · 영향 사용자 ~582

미확인

Marathon Service p95가 270ms에서 3109ms로 증가했습니다. DB connection pool 포화와 요청량 급증이 동시에 감지되었습니다. 최근 배포와의 상관관계는 낮으며, capacity saturation이 1순위 원인입니다.

② 어떤 근거로 탐지했는가

  • 1.요청량이 40분 전 대비 2.8배 증가했습니다.
  • 2.DB Pool 사용률이 99%입니다.
  • 3.p95가 270ms에서 3109ms로 상승했습니다.
  • 4.가장 많은 오류는 Connection acquisition timeout입니다.

④ 무엇을 해야 하는가

  • Marathon Service Pod를 4개에서 6개로 확장
  • Pod당 DB Pool 최댓값 점검
  • 전체 DB Connection 상한 초과 여부 확인

③ AI 신뢰도에 반대되는 근거 (이상 점수 91 · 신뢰도 91%)

  • 동일 시간대 다른 서비스에서도 트래픽 증가가 관측되어 계절성(이벤트성 유입)일 가능성도 있습니다.

예상 회복 효과: Pod를 6개로 확장하면 DB Pool 대기가 해소되며 p95가 SLO(800ms) 이내로 복귀할 것으로 예상됩니다.

RPS 78.1 (예상 27.8)p95 3109ms오류율 0.4%DB Pool 99%Pod 46
주의AI Assistant

inc-20260802-002 · 19분 전 · 담당 AI Platform팀 · 영향 사용자 ~92

조치 중

AI Assistant p95가 614ms에서 1594ms로 증가했습니다. LLM 추론 구간 지연이 동시에 감지되었습니다. 최근 배포와의 상관관계는 낮으며, 모델 응답 지연이 1순위 원인입니다.

② 어떤 근거로 탐지했는가

  • 1.p95 지연시간이 1594ms로 상승했습니다.
  • 2.가장 느린 구간은 POST /api/ai-assistant/chat입니다.
  • 3.이상 점수가 75점입니다.

④ 무엇을 해야 하는가

  • LLM Provider 응답시간 확인
  • Tool Calling 단계 타임아웃 조정 검토
  • 요청 큐잉/재시도 정책 점검

③ AI 신뢰도에 반대되는 근거 (이상 점수 75 · 신뢰도 90%)

  • 동일 모델을 사용하는 다른 서비스에서는 지연 증가가 관측되지 않아 이 서비스 고유 요인일 수 있습니다.

예상 회복 효과: Provider 응답시간이 정상화되면 p95가 자동으로 회복될 것으로 예상되며, Pod 확장 효과는 제한적입니다.

RPS 10.1 (예상 10.2)p95 1594ms오류율 0.3%DB Pool 23%Pod 34
심각Crew Service

inc-20260802-003 · 26분 전 · 담당 Backend Platform팀 · 영향 사용자 ~135

조치 중

Crew Service 오류율이 11.4%로 상승했습니다. 최근 배포(4분 전) 직후 발생했으며, 상관관계가 높습니다. 코드 회귀가 1순위 원인입니다.

② 어떤 근거로 탐지했는가

  • 1.배포 4분 후 오류율이 상승했습니다.
  • 2.가장 많은 오류는 NullPointerException in RequestValidator입니다.
  • 3.Pod 재시작이 2회 발생했습니다.

④ 무엇을 해야 하는가

  • 최근 배포 rollback 가능 여부 확인
  • 오류 fingerprint 기준 관련 로그 조회
  • 카나리 트래픽 비율 축소 검토

③ AI 신뢰도에 반대되는 근거 (이상 점수 89 · 신뢰도 85%)

  • 동일 배포로 함께 나간 다른 서비스는 정상이라 배포 자체보다 이 서비스 코드 경로 문제일 가능성이 높습니다.

예상 회복 효과: 이전 배포 버전으로 rollback하면 오류율이 즉시 정상 범위로 복귀할 것으로 예상됩니다.

RPS 17.4 (예상 14.5)p95 130ms오류율 11.4%DB Pool 21%Pod 23