데브옵스
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]
두줄요약
Amazon EKS에서 vLLM으로 Gemma 4 31B 서빙의 콜드 스타트를 단계별로 최적화한 사례입니다. S3 직결 로더, 캐시 영속화, sleep mode로 시작 시간과 GPU 비용을 줄였습니다.
핵심 내용
- Amazon EKS에서 vLLM으로 Gemma 4 31B를 서빙할 때 콜드 스타트가 7분 이상 걸리는 문제를 4단계로 분해해 분석
- 가중치 로드는 스트리밍 로더로 S3 직접 연결, 엔진 초기화는 hostPath 캐시와 S3 사전 로드로 단축
- sleep mode와 이미지 사전 pull, warm pool 같은 조건부 기법도 함께 비교
- 최종적으로 콜드 스타트와 웜 재시작 시간을 줄이고, 시작 속도와 GPU 비용을 함께 개선한 구성 정리
적용해볼 점
- 시작 시간을 단계별로 나눠 병목 구간부터 최적화
- 캐시 수명과 노드 수명을 분리해 재시작 비용을 줄이는 매니페스트 구성 검토
- 유휴 구간은 sleep/wake와 scale-to-zero를 수요 패턴에 맞춰 계층화
