월 150만 유저가 사용하는 LLM Inference 인프라 안정적으로 운영하기
두줄요약
멀티 리전 AKS, Karmada, Istio로 대규모 LLM 추론 인프라를 중앙 관리했습니다.\n스토리지·이미지 배포를 통합해 비용과 운영 리소스를 절감했습니다.
문제 상황
- 초당 3~4천 RPS와 수백 개 동시 서빙 모델을 처리하는 LLM 추론 환경
- Neo Cloud의 고사양 GPU 수급·인프라 안정성·멀티 리전 스토리지·장애 복구 한계
해결 방법
- 8개 이상 리전의 AKS 클러스터 분산 운영과 Terraform 기반 인프라 구성 자동화
- Istio Multi-primary Mesh 기반 멀티클러스터 서비스 디스커버리와 부하분산
- Karmada PropagationPolicy·FederatedHPA 기반 중앙 워크로드 배치와 오토스케일링
성능/운영 포인트
- Blob Storage와 azcopy 기반 모델 체크포인트 로딩, ACR Geo-replication 기반 리전별 이미지 배포
- 단일 Control Plane 기반 수십 개 클러스터 모니터링과 워크로드 관리
- 서빙 비용 20% 이상, 운영 리소스 절반 이상 절감
적용해볼 점
- Azure Fleet Manager 전환 검토를 통한 AKS 네이티브 멀티클러스터 관리
- Azure Managed Lustre 기반 KV Cache 공유로 처리량 향상과 지연시간 절감 검토

