Karpenter와 Spot으로 저렴하고 유연하게 노드 프로비저닝하기
두줄요약
EKS의 GPU 서버 비용을 줄이기 위해 Karpenter와 EC2 Spot을 도입했습니다. NTH와 FIS로 Spot 중단 대응과 동작 검증을 구성했습니다.
문제 상황
- GPU 머신 중심 EKS 운영의 높은 서버 비용
- Spot 중단 상황에서 느린 Cluster Autoscaler 기반 노드 프로비저닝
- 다양한 AI 모델별 GPU 인스턴스 타입 추가의 높은 운영 부담
해결 방법
- EC2 Spot과 Karpenter 마이그레이션으로 빠른 직접 EC2 노드 생성
- Helm subchart·Git·ArgoCD 기반 Karpenter 배포 및 설정 관리
- AWSNodeTemplate과 Provisioner CRD 기반 서브넷·보안 그룹·인스턴스 타입·Spot/On-Demand 구성
구조와 흐름
- 모든 AZ의 서브넷 지정으로 Spot Capacity 확보 범위 확대
- Spot Fleet의 priceCapacityOptimized 전략과 다양한 인스턴스 타입 활용
- Rebalance Recommendation 수신 시 Node Termination Handler의 cordon·draining 기반 사전 Pod 이동
성능/운영 포인트
- Karpenter 전용 Managed Node Group과 taint/toleration 격리
- AWS FIS 기반 Spot Interrupt 주입으로 중단 대응 동작 검증
- 안정성 확보 후 저렴한 서버 운영


