쿠버네티스로 여는 AI 추론 인프라
쿠버네티스와 AWS EKS를 활용해 LLM 추론 인프라를 안정적으로 운영하는 방법을 설명했습니다. 특히 KV 캐시를 고려한 라우팅과 prefill/decode 분리를 통해 성능과 비용을 함께 개선하는 흐름을 다뤘습니다.

Karpenter 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
17개 표시
쿠버네티스와 AWS EKS를 활용해 LLM 추론 인프라를 안정적으로 운영하는 방법을 설명했습니다. 특히 KV 캐시를 고려한 라우팅과 prefill/decode 분리를 통해 성능과 비용을 함께 개선하는 흐름을 다뤘습니다.

Amazon EKS에서 vLLM으로 Gemma 4 31B 서빙의 콜드 스타트를 단계별로 최적화한 사례입니다. S3 직결 로더, 캐시 영속화, sleep mode로 시작 시간과 GPU 비용을 줄였습니다.
EKS 11개 클러스터를 서비스 중단 없이 v1.35로 통일한 업그레이드 사례입니다. AI 에이전트를 오퍼레이터로 써 8일 만에 PR 109건을 처리하고 안전하게 전환했습니다.

EKS 11개 클러스터를 단계적 절차와 안전판으로 8일 만에 v1.35로 통일했습니다. AI 에이전트와 사람의 승인 분리를 통해 서비스 중단 없이 업그레이드를 마쳤습니다.

Ambient mode에서 Pod은 Ready인데 mesh 트래픽이 실패하는 partially enrolled 문제를 다뤘습니다. istio-cni 준비 전에는 일반 Pod이 스케줄되지 않도록 startup taint와 untaint-controller를 활용했습니다.
Job 워크로드는 중단에 취약해 EKS 노드그룹 오토스케일링이 어려웠습니다. 이를 해결하기 위해 PodAffinity로 bin-packing을 유도하고, 애노테이션으로 축소 중 종료를 막았습니다.
EKS와 Spot, RabbitMQ, KEDA, Karpenter를 결합해 대규모 데이터 전처리 파이프라인을 구축했습니다. 단일 큐 병목을 없애 비용을 크게 줄이고 처리 시간도 수 일에서 수 시간으로 단축했습니다.

SageMaker HyperPod에 Karpenter 기반 관리형 노드 오토스케일링이 추가되었습니다. KEDA와 함께 사용해 추론·학습 워크로드를 메트릭 기반으로 탄력적으로 확장할 수 있습니다.

Amazon ECS 기반 인프라를 Amazon EKS로 전환해 운영 유연성을 높이고 GitOps 체계를 구축했습니다. Binpacking과 Spot 전략으로 자원 활용률과 비용 효율도 크게 개선했습니다.

Amazon EKS Auto Mode의 내부 구성과 동작 방식을 소개했습니다. 데이터 플레인 운영, 보안 패치, 노드 최적화를 AWS가 자동 처리하는 흐름을 설명했습니다.

Karpenter 도입 과정에서 마주한 스케줄링 정합성, AMI 운영, Node Churn 문제를 정리했습니다. 적절한 budget과 리소스 보정으로 비용을 줄이고 안정성을 개선했습니다.

AWS re:Invent 2023 연사 참여와 EKS 기반 비용 최적화 사례를 소개했습니다. 발표 준비 과정과 현장 경험, 향후 발표자 팁도 함께 정리했습니다.

Karpenter로 Cluster Autoscaler를 교체해 스파크성 트래픽에서 노드 증설 속도를 개선했습니다. 또한 노드 병합과 스팟 운영을 통해 비용 절감과 운영 안정성을 함께 확보했습니다.

Karpenter를 도입해 EKS 노드 확장 속도를 높이고 비용 최적화를 시도했습니다. 스파크성 트래픽과 Spot 운영 이슈를 보완하며 안정성과 효율을 함께 개선했습니다.
EKS의 GPU 서버 비용을 줄이기 위해 Karpenter와 EC2 Spot을 도입했습니다. NTH와 FIS로 Spot 중단 대응과 동작 검증을 구성했습니다.
Kubernetes 기반 MLOps 환경에서 GPU 자원 운영 부담을 줄이기 위한 기반을 설계했습니다. Karpenter와 NVDP로 GPU 노드의 자동 생성·회수 흐름을 구성했습니다.

컬리의 MLOps 구축 초기에 GPU 노드 자동화와 Karpenter 도입 과정을 소개했습니다. NVDP, affinity, consolidation 이슈까지 포함해 운영 포인트를 정리했습니다.
