목록 보기
왓챠 추천 서비스 MLOps 적용기 Part2
AI

왓챠 추천 서비스 MLOps 적용기 Part2

watcha
watcha
2024년 3월 6일

두줄요약

왓챠는 추천 서비스의 Monolithic 추론 구조를 분리된 TorchServe 기반 서버로 개선했습니다. CPU 최적화와 모델 경량화, Datadog 모니터링으로 성능과 안정성을 함께 높였습니다.

핵심 내용

  • 왓챠 추천 서비스의 기존 Monolithic 추론 구조 문제와 독립적인 추론 서버 도입 배경 정리
  • TorchServe를 후보 비교 끝에 선택하고, CPU 최적화·동적 배치·캐싱·직렬화·모델 경량화로 성능과 안정성 개선
  • Datadog과 Looker Studio로 서버 지표와 온라인 추천 지표를 함께 모니터링하는 체계 구축
  • 추론 서버 분리로 JNI 의존성 제거, 모델 문제의 서비스 전이 방지, 전후처리 핸들러의 획일화

적용해볼 점

  • 모델 서빙과 API 서비스를 분리해 장애 전파 범위 축소
  • CPU 추론 환경에서 워커 수, 배치 크기, 캐싱, 경량화 기법을 함께 튜닝
  • 서버 메트릭과 추천 품질 지표를 분리해 지속적으로 관찰

다음 읽기

#MLOps 주제를 이어서 읽기

왓챠 추천 서비스 MLOps 적용기 Part1

왓챠 추천 서비스에 MLOps를 적용한 배경과 기존 EC2 기반 파이프라인의 문제를 정리했습니다. 도커·쿠버네티스, 온프레미스 GPU, S2S VPN으로 학습 환경과 운영 안정성을 개선했습니다.

watcha
watcha
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...