AI
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
두줄요약
Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때의 처리량과 지연 SLO 최적화 결과를 정리했습니다. NVFP4, prefix caching, speculative decoding, priority 스케줄링의 효과와 서빙 풀 분리 기준을 제시했습니다.
핵심 내용
- Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때 처리량과 지연 SLO를 함께 최적화한 실험 결과 정리
- 정밀도, speculative decoding, prefix caching, 스케줄러 파라미터를 하나씩 바꿔 측정하며 서빙 풀 구성 원칙 도출
- NVFP4가 BF16 대비 SLO 하 처리량에서 크게 유리하고, 대화형 트래픽과 배치성 트래픽은 분리하는 구성이 적합
- 캐시 적중률과 워크로드 특성이 GPU당 처리량을 크게 좌우하며, 텍스트 전용 풀과 priority 스케줄링도 운영에 유효
적용해볼 점
- 대화형 풀에는 NVFP4와 prefix caching 위주, 배치 풀에는 speculative decoding과 낮은 priority 적용
- 텍스트 전용 워크로드는 image encoder 예약을 줄이고 KV 캐시 여유를 늘리는 설정 검토
- max-num-seqs와 gpu-memory-utilization은 상한선 관점으로, 피크 동시성과 캐시 축출 여부를 기준으로 조정

