새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법
두줄요약
LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.
구조와 흐름
- Kernel Fusion, Early Stopping, Key/Value Caching, FlashAttention을 통한 추론 연산·메모리 I/O 절감
- Dynamic Batching의 GPU 활용률 향상과 패딩·대기시간 문제, Iteration Batching의 요청 단위 보완 방식
- CPU·GPU·IPU 기반 서빙과 FastAPI, Triton, FasterTransformer, Inferentia 활용 경로
선택 이유
- 모델 크기 증가에 따른 GPU 서버 비용과 지속 서빙 비용 부담
- 요구 지연시간, 처리량, GPU 메모리, 클라우드 환경을 기준으로 한 하드웨어·프레임워크 실험 필요
성능/운영 포인트
- Latency와 Throughput을 저지연·저비용 서빙의 핵심 평가 지표로 활용
- 단일 서버 Latency-RPS 그래프 기반의 필요 인스턴스 수와 시간당 비용 산정
- 지수분포 요청 생성 또는 Locust 기반 부하 테스트와 P90·P95 지연시간 측정
주의할 점
- Dynamic Batching의 배치 크기·대기시간 설정에 따른 지연시간 증가 가능성
- Early Stopping과 고정 추론 그래프 기반 Kernel Fusion의 분기 처리 상충
- Inferentia2의 대형 모델·생성 옵션 지원 성숙도 검증 필요


