목록 보기
월 150만 유저가 사용하는 LLM Inference 인프라 안정적으로 운영하기
데브옵스

월 150만 유저가 사용하는 LLM Inference 인프라 안정적으로 운영하기

스캐터랩 핑퐁
스캐터랩 핑퐁
2026년 3월 11일

두줄요약

멀티 리전 AKS, Karmada, Istio로 대규모 LLM 추론 인프라를 중앙 관리했습니다.\n스토리지·이미지 배포를 통합해 비용과 운영 리소스를 절감했습니다.

문제 상황

  • 초당 3~4천 RPS와 수백 개 동시 서빙 모델을 처리하는 LLM 추론 환경
  • Neo Cloud의 고사양 GPU 수급·인프라 안정성·멀티 리전 스토리지·장애 복구 한계

해결 방법

  • 8개 이상 리전의 AKS 클러스터 분산 운영과 Terraform 기반 인프라 구성 자동화
  • Istio Multi-primary Mesh 기반 멀티클러스터 서비스 디스커버리와 부하분산
  • Karmada PropagationPolicy·FederatedHPA 기반 중앙 워크로드 배치와 오토스케일링

성능/운영 포인트

  • Blob Storage와 azcopy 기반 모델 체크포인트 로딩, ACR Geo-replication 기반 리전별 이미지 배포
  • 단일 Control Plane 기반 수십 개 클러스터 모니터링과 워크로드 관리
  • 서빙 비용 20% 이상, 운영 리소스 절반 이상 절감

적용해볼 점

  • Azure Fleet Manager 전환 검토를 통한 AKS 네이티브 멀티클러스터 관리
  • Azure Managed Lustre 기반 KV Cache 공유로 처리량 향상과 지연시간 절감 검토

다음 읽기

#LLM 주제를 이어서 읽기

새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법

LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...