Marathon ServiceRunning Record ServiceAI AssistantCourse Recommendation AICrew ServiceNotification ConsumerCommunity FeedPayment Gateway
AI 진단 초안 (생성형 LLM)
Loki 실측 신호를 근거로 Bedrock LLM이 그 자리에서 작성 — 학습된 이상탐지 모델이 아닌 초안입니다
"초안 생성"을 누르면 이 서비스의 최근 로그를 모아 LLM에게 진단을 요청합니다. 결과는 다시 분석하기 전까지 계속 보입니다.
inc-20260802-002 · 19분 전 · 담당 AI Platform팀 · 영향 사용자 ~92명
AI Assistant p95가 614ms에서 1594ms로 증가했습니다. LLM 추론 구간 지연이 동시에 감지되었습니다. 최근 배포와의 상관관계는 낮으며, 모델 응답 지연이 1순위 원인입니다.
② 어떤 근거로 탐지했는가
- 1.p95 지연시간이 1594ms로 상승했습니다.
- 2.가장 느린 구간은 POST /api/ai-assistant/chat입니다.
- 3.이상 점수가 75점입니다.
④ 무엇을 해야 하는가
- LLM Provider 응답시간 확인
- Tool Calling 단계 타임아웃 조정 검토
- 요청 큐잉/재시도 정책 점검
③ AI 신뢰도에 반대되는 근거 (이상 점수 75 · 신뢰도 90%)
- 동일 모델을 사용하는 다른 서비스에서는 지연 증가가 관측되지 않아 이 서비스 고유 요인일 수 있습니다.
예상 회복 효과: Provider 응답시간이 정상화되면 p95가 자동으로 회복될 것으로 예상되며, Pod 확장 효과는 제한적입니다.
RPS 10.1 (예상 10.2)p95 1594ms오류율 0.3%DB Pool 23%Pod 3 → 4