목록 보기
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
AI

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]

AWS
AWS
2026년 9월 10일

두줄요약

Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때의 처리량과 지연 SLO 최적화 결과를 정리했습니다. NVFP4, prefix caching, speculative decoding, priority 스케줄링의 효과와 서빙 풀 분리 기준을 제시했습니다.

핵심 내용

  • Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때 처리량과 지연 SLO를 함께 최적화한 실험 결과 정리
  • 정밀도, speculative decoding, prefix caching, 스케줄러 파라미터를 하나씩 바꿔 측정하며 서빙 풀 구성 원칙 도출
  • NVFP4가 BF16 대비 SLO 하 처리량에서 크게 유리하고, 대화형 트래픽과 배치성 트래픽은 분리하는 구성이 적합
  • 캐시 적중률과 워크로드 특성이 GPU당 처리량을 크게 좌우하며, 텍스트 전용 풀과 priority 스케줄링도 운영에 유효

적용해볼 점

  • 대화형 풀에는 NVFP4와 prefix caching 위주, 배치 풀에는 speculative decoding과 낮은 priority 적용
  • 텍스트 전용 워크로드는 image encoder 예약을 줄이고 KV 캐시 여유를 늘리는 설정 검토
  • max-num-seqs와 gpu-memory-utilization은 상한선 관점으로, 피크 동시성과 캐시 축출 여부를 기준으로 조정

다음 읽기

#Amazon EKS 주제를 이어서 읽기

Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]

Amazon EKS에서 vLLM으로 Gemma 4 31B 서빙의 콜드 스타트를 단계별로 최적화한 사례입니다. S3 직결 로더, 캐시 영속화, sleep mode로 시작 시간과 GPU 비용을 줄였습니다.

AWS
AWS
데브옵스

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...