
딜리버리 프로덕트 개발팀의 개발문화 - 로그 & 알람편
두줄요약
로그 레벨을 ERROR와 WARN으로 재정의하고, 상황별 임계치 기반 알람을 구성했습니다.\n알람 피로를 줄이면서 운영 문제를 빠르게 인지하도록 로그를 지속 관리했습니다.
문제 상황
- 시스템 증가에 따른 복잡도 상승과 운영 안정성 저하
- 기준 없는 ERROR 로그와 불필요한 알람으로 인한 알람 피로
해결 방법
- 즉각 대응 대상은 ERROR 로그와 발생 즉시 알람으로 분류
- 빈도 누적 시 문제 가능성이 있는 대상은 WARN 로그와 기간별 임계치 알람으로 분류
- 공통 WARN 알람 기준 설정 후 도메인별 별도 알람 분리
성능/운영 포인트
- 외부 시스템 타임아웃은 재처리 여부와 지속 발생 빈도에 따른 모니터링
- Kafka·Redis·DB 등 애플리케이션 제어 밖 로그의 패턴 분석과 알람 예외 처리
- 운영 중 알람 빈도와 장애 미감지 사례를 바탕으로 임계치 지속 조정
적용해볼 점
- 신규 에러 발생 시 기준에 따른 티켓·핫픽스·일시적 알람 제외 절차
- 개발 환경부터 예외의 대응 가능성 및 로그 필요성 검토 습관화
- 코드와 동일한 수준의 지속적 로그 관리
