목록 보기
생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙
AI

생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙

네이버 D2
네이버 D2
2024년 9월 24일

두줄요약

대규모 검색 재순위화를 위해 LLM 서빙 프레임워크와 최적화 방법을 비교하고, TRT-LLM과 Triton 조합을 채택했습니다. 양자화, 배치 조절, OpenTelemetry와 대시보드로 성능과 운영 가시성을 함께 확보했습니다.

문제 상황

  • 대규모 트래픽의 통합검색에서 재순위화용 LLM을 안정적으로 서빙해야 하는 요구
  • 제한된 GPU 리소스 안에서 품질, 응답 속도, 처리량, SLO를 함께 만족해야 하는 상황

원인 분석

  • 기존 일반 서빙 프레임워크만으로는 GPU 추론 최적화와 운영 안정성 확보가 어려움
  • 모델 자체 성능뿐 아니라 서빙 프레임워크, 배치 방식, 관측성까지 함께 맞춰야 하는 구조

해결 방법

  • GPU 서빙에 최적화된 프레임워크를 비교한 뒤 TRT-LLM과 Triton 조합을 채택
  • 양자화와 배치 크기 조절로 처리량 개선, 동적 배치는 초기 성능 저하 가능성 때문에 제외
  • 처리량, p99 응답 속도, GPU 사용률을 중심으로 모니터링하고 OpenTelemetry와 대시보드를 구성

성능/운영 포인트

  • Triton의 배치 관련 지표와 pod 단위 관측으로 이상 동작 탐지
  • GPU 사용률을 최대 가용량 기준으로 관리하고 Too Many Requests로 과부하를 제한
  • 반복 작업 자동화를 위한 Kubeflow 파이프라인과 LLM 기반 자동 평가 도입 검토

다음 읽기

#LLM 주제를 이어서 읽기

생성형 AI 기반 실시간 검색 결과 재순위화 1편 - 서빙 시스템 아키텍처

네이버 통합검색의 LLM 기반 실시간 재순위화 서빙 아키텍처와 고부하 대응 방법을 정리했습니다. 원격 캐시, 비동기 호출, 스로틀링으로 검색 서버 보호와 응답 시간 최적화를 다뤘습니다.

네이버 D2
네이버 D2
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...