새로운 팀에 기여하기, 그리고 기여의 확장 (feat. 전시개발팀 옵저버빌리티 향상 시키기)
두줄요약
전시 서비스의 장애 대응 흐름에 맞춰 OpenTelemetry·Grafana 기반 관측 가능성 대시보드를 구축했습니다. 기존 파이프라인을 활용하고 AI 에이전트로 반복 작업을 줄이며 팀 단위 개선을 확장했습니다.
문제 상황
- 게이트웨이 이후 대량 트래픽을 처리하는 전시 서비스의 성능·가용성·연계 장애 대응 요구
- 기존 Pinpoint 중심 환경에서 문제 요점과 장애 원인의 직관적 확인 필요
해결 방법
- OpenTelemetry와 Grafana 기반의 Metrics·Traces·Logs 연계 관측 가능성 대시보드 구성
- 요청·성공·실패·TPS, Incoming·Outgoing 지표, 레이턴시·에러별 트레이스 이동, Loki 로그 탐색 제공
- Claude Code와 Yapp MCP를 통한 메트릭 탐색·쿼리 조정·Grafana 패널 구성 보조
성능/운영 포인트
- 신규 에이전트·전용 데몬 없이 기존 메트릭·로그 파이프라인 활용
- 마이크로서비스 이상 위치 탐색 보드와 상세 보드 연결, 이벤트 트래픽 대비 리소스 모니터링 보드 추가
- 장애 감지부터 로그·트레이스 확인까지의 컨텍스트 전환 축소
적용해볼 점
- 관측 가능성 개선 시작 전 MTTD·MTTR·원인 식별 경로 기준선 기록 필요
- 메트릭·트레이스·로그 기반 AI 에이전트 RCA 지원 과제

