목록 보기
우아한형제들이 장애를 놓치지 않고 탐지하는 방법
데브옵스

우아한형제들이 장애를 놓치지 않고 탐지하는 방법

우아한 형제들
우아한 형제들
2025년 12월 2일

두줄요약

기존 시스템 지표 모니터링의 한계를 보완하기 위해 서비스 이상 탐지 시스템을 도입했습니다. 중앙값 기반 탐지와 대응 자동화로 정밀도와 탐지율을 높이고 전파 시간을 크게 줄였습니다.

문제 상황

  • 배달 서비스 특성상 고객 주문 시점의 장애가 곧바로 사용자 피해로 이어지는 상황
  • 기존 시스템 지표 중심 모니터링은 모든 이상 징후를 빠짐없이 잡기 어려운 한계

원인 분석

  • 서비스 변화와 운영 실수로 인한 장애 발생이 불가피한 구조
  • CPU, 메모리 같은 시스템 지표만으로는 사용자 영향까지 충분히 반영하기 어려움
  • 오탐 가능성과 원인 파악 어려움 때문에 단순 임계치 경보만으로는 대응 한계

해결 방법

  • 실시간에 가까운 서비스 이상 탐지 시스템 도입
  • 주문 수, 결제 성공률 같은 서비스 지표를 과거 패턴과 비교해 이상 여부 판단
  • 중앙값 기반 예측과 임계 도달 횟수 관리로 정확도와 탐지 속도 균형 조정
  • Slack 경보, Opsgenie 호출, 장애 채널 자동 생성까지 대응 프로세스 자동화

성능/운영 포인트

  • 경보 정밀도 약 11배 향상
  • 장애 탐지율 약 70% 향상
  • 장애 전파 시간 약 74% 단축
  • 여러 서비스팀의 지표 모니터링을 SRE 관점에서 통합 관리

다음 읽기

#SRE 주제를 이어서 읽기

장애 대응의 성패를 가르는 First Action: 우아한형제들의 장애 관리 라이프사이클

장애 대응에서 가장 중요한 초동 조치와 이를 관리하는 라이프사이클을 정리했습니다. 시간 기반 메트릭으로 병목을 찾고 운영 개선으로 연결하는 방식을 소개했습니다.

우아한 형제들
우아한 형제들
아키텍처

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...