목록 보기
새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법
AI

새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 8월 16일

두줄요약

LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.

구조와 흐름

  • Kernel Fusion, Early Stopping, Key/Value Caching, FlashAttention을 통한 추론 연산·메모리 I/O 절감
  • Dynamic Batching의 GPU 활용률 향상과 패딩·대기시간 문제, Iteration Batching의 요청 단위 보완 방식
  • CPU·GPU·IPU 기반 서빙과 FastAPI, Triton, FasterTransformer, Inferentia 활용 경로

선택 이유

  • 모델 크기 증가에 따른 GPU 서버 비용과 지속 서빙 비용 부담
  • 요구 지연시간, 처리량, GPU 메모리, 클라우드 환경을 기준으로 한 하드웨어·프레임워크 실험 필요

성능/운영 포인트

  • Latency와 Throughput을 저지연·저비용 서빙의 핵심 평가 지표로 활용
  • 단일 서버 Latency-RPS 그래프 기반의 필요 인스턴스 수와 시간당 비용 산정
  • 지수분포 요청 생성 또는 Locust 기반 부하 테스트와 P90·P95 지연시간 측정

주의할 점

  • Dynamic Batching의 배치 크기·대기시간 설정에 따른 지연시간 증가 가능성
  • Early Stopping과 고정 추론 그래프 기반 Kernel Fusion의 분기 처리 상충
  • Inferentia2의 대형 모델·생성 옵션 지원 성숙도 검증 필요

다음 읽기

#GPU 주제를 이어서 읽기

AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄

AWS Inferentia로 TensorFlow RoBERTa 모델을 컴파일하고 GPU 인스턴스와 비용·성능을 비교했습니다. 1000RPS 기준 Inferentia의 높은 비용 효율과 동적 그래프 제약을 함께 정리했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...