이루다 서버의 모니터링 스택을 소개합니다
두줄요약
Kubernetes 기반 Spring Boot 서버에 Prometheus·Grafana·BigQuery를 결합한 모니터링 구성을 소개했습니다.\nActuator와 Micrometer로 핵심 지표를 수집하고 장애 대응에 활용하는 방법을 설명합니다.
구조와 흐름
- Kubernetes에 배포된 Spring Boot·FastAPI 서버와 클러스터 metric을 Prometheus로 수집하고 Grafana에서 통합 시각화
- Prometheus metric을 BigQuery에 적재해 장기 보관하고, Grafana Alerting으로 외부 알림 연동
- Spring Boot Actuator와 Micrometer로
/actuator/prometheus엔드포인트 및 사용자 지정 metric 노출
선택 이유
- Prometheus의 pull 방식과 counter·rate 함수 기반의 유연한 시계열 수집
- Kubernetes 컨테이너·인스턴스 자원 관찰 및 Prometheus Operator 기반 설정 관리
- 서비스 언어·프레임워크와 무관한 단일 모니터링 지점 구성
성능/운영 포인트
- 핵심 서비스 지표인 대화량과 연관된 요청 수·메시지 수 중심의 알람 관리
- HTTP 요청·클라이언트 연결, DB 커넥션 풀·쿼리, JVM 스레드·GC·메모리의 병목 관찰
- Prometheus 보존 기간·용량 제한과 remote storage 기반 과거 metric 보관
주의할 점
- 스크래핑 주기와 맞지 않는 구간 집계 metric의 정보 손실 가능성
- Actuator metric API의 외부 접근 제한 필요
- metric·알람 확대보다 장애 영향도 기반 대응 우선순위와 프로세스 정립 필요

