Overview

사용자 영향 중심 Command Center · 17개 서비스

사용자 영향

전체 요청 성공률

98.26%

SLO 위반

p95 응답시간

676ms

SLO 이내

활성 사용자

Mock

RUM 연동 예정 · Planned

프론트엔드 에러율

Mock

RUM 연동 예정 · Planned

영향받은 사용자(추정)

809

Incident 3건 기준

SLO 위반 서비스

3/ 8

확인 필요

Marathon Service p95가 270ms에서 3109ms로 증가했습니다. DB connection pool 포화와 요청량 급증이 동시에 감지되었습니다. 최근 배포와의 상관관계는 낮으며, capacity saturation이 1순위 원인입니다.

영향 사용자 ~582담당 Backend Platform팀신뢰도 91%

AI Assistant p95가 614ms에서 1594ms로 증가했습니다. LLM 추론 구간 지연이 동시에 감지되었습니다. 최근 배포와의 상관관계는 낮으며, 모델 응답 지연이 1순위 원인입니다.

영향 사용자 ~92담당 AI Platform팀신뢰도 90%

Crew Service 오류율이 11.4%로 상승했습니다. 최근 배포(4분 전) 직후 발생했으며, 상관관계가 높습니다. 코드 회귀가 1순위 원인입니다.

영향 사용자 ~135담당 Backend Platform팀신뢰도 85%

10분 후 트래픽 예측 (시뮬레이션)

현재 RPS

192

예측 RPS (+10m)

226

서비스별 상세 예측은 Predictive Autoscaling 페이지에서 확인할 수 있습니다.

Pod 확장 상태 (시뮬레이션)

현재 replica vs AI 권장 replica

현재
AI 권장
Marathon Service46Running Record Service55AI Assistant34Course Recommendation AI22Crew Service23Notification Consumer22Community Feed33Payment Gateway22

클러스터 여유도 (시뮬레이션)

CPU 사용률정상 · 58%
Memory 사용률정상 · 64%
Pod 배치 가능도주의 · 71%

24 / 34 pod 사용 중

10분 뒤 Marathon Service는 2개 replica가 추가로 필요하며, 클러스터 여유(2개)로 충분히 대응 가능합니다.

Predictive Autoscaling에서 Capacity Guard 자세히 보기 →

서비스 건강 지표

전체 서비스 MELT 요약 (시뮬레이션)

서비스상태RPSp95오류율이상 점수Pod추이
Marathon Service심각78.13109ms0.40%9146
Running Record Service정상35.2122ms0.30%155
AI Assistant주의10.11594ms0.30%7534
Course Recommendation AI정상12.6126ms0.30%82
Crew Service심각17.4130ms11.40%8923
Notification Consumer정상11.1109ms0.40%92
Community Feed정상20.3113ms0.40%103
Payment Gateway정상6.8108ms0.40%92

최근 Kubernetes 이벤트 (시뮬레이션)

  • FailedScheduling · Marathon Service

    0/5 nodes are available: insufficient cpu

    3분 전
  • OOMKilled · Crew Service

    Container was OOMKilled, restarting

    11분 전
  • OOMKilled · Crew Service

    Container was OOMKilled, restarting

    21분 전
  • OOMKilled · Marathon Service

    Container was OOMKilled, restarting

    24분 전
  • ScaleDown · Notification Consumer

    Scaled down replica set (cooldown elapsed)

    26분 전
  • ScalingReplicaSet · Crew Service

    Scaled up replica set to 6

    27분 전

최근 변경 이벤트 (시뮬레이션)

배포 · 설정 변경과 장애 상관관계

전체 이력 →
  • [배포] Crew Service · Argo CD Sync — Deployment rollout 완료⚠ Incident 연관
    4분 전
  • [Scale 설정] Community Feed · minReplicas 2 → 3 조정
    34분 전
  • [배포] Running Record Service · Argo CD Sync — Deployment rollout 완료
    50분 전
  • [설정 변경] Running Record Service · 캐시 TTL 값 변경 (30s → 60s)
    52분 전
  • [NetworkPolicy] Payment Gateway · 외부 PG사 IP 대역 추가
    1시간 11분 전