목록 보기
신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례
데브옵스

신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례

라인
라인
2025년 2월 28일

두줄요약

OBS 플랫폼에 SLI/SLO를 도입해 공용 미디어 플랫폼의 신뢰성을 측정하고 운영에 활용한 사례를 공유했습니다. 로그 기반 메트릭 수집과 Recording Rules로 대시보드 성능을 개선하고 알람 체계를 구성했습니다.

문제 상황

  • 서비스가 아닌 플랫폼 OBS에 신뢰성 지표를 별도로 정의할 필요
  • 다양한 서비스에서 공용으로 쓰여 문제 영향 범위가 넓은 구조
  • API 사용 방식이 제각각이라 CUJ 설정과 메트릭 수집이 까다로운 상황

원인 분석

  • 미디어 유형과 크기 편차로 처리량 기준의 일관성 확보 어려움
  • 엔드포인트에서 직접 메트릭 수집이 어려워 로그 기반 수집 필요
  • 높은 카디널리티와 복잡한 PromQL로 대시보드 조회 성능 저하

해결 방법

  • 주요 API를 CUJ로 정의하고 DOWNLOAD, UPLOAD, OBJECT_INFO별 SLI 선정
  • Kafka, Vector, Prometheus, Grafana로 로그 기반 메트릭 수집 파이프라인 구성
  • Recording Rules로 자주 쓰는 SLO 계산식을 사전 집계해 쿼리 성능 개선

성능/운영 포인트

  • 하루 약 350TB 로그 처리를 위해 Vector 클러스터 증설 및 역할 분리
  • Slack 연동 알람과 패널 캡처로 장애 상황을 빠르게 공유
  • 오류 예산 상태를 기준으로 대응 우선순위와 운영 피로도 조절

다음 읽기

#SRE 주제를 이어서 읽기

신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기

SLI/SLO 도입 과정을 공통 프레임워크로 정리하고 사내 템플릿으로 확산한 사례를 소개했습니다. 또한 웹훅과 DB 기반으로 자동 갱신되는 서비스 상태 확인 도구 LINE Status를 만든 과정을 공유했습니다.

라인
라인
백엔드

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...