
새로운 루다를 지탱하는 모델 서빙 아키텍처 — 3편: 안정적인 LLM 서비스를 위한 서빙 최적화 기법
LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.
새로운 기술 블로그가 추가되었어요

LLM 서빙 비용을 줄이기 위한 추론 최적화 기법과 CPU·GPU·IPU 서빙 방식을 정리했습니다. Latency-RPS 부하 테스트로 지연시간·처리량·인스턴스 비용을 평가하는 방법을 제시합니다.

OpenAI 서울 라운드테이블에서 API 플랫폼 전략과 LLM 제품화 과제를 공유했습니다.\nGPU, 환각, 비용, 데이터, 경쟁력 관점의 실무적 논의를 정리했습니다.


Kubernetes 기반 MLOps 환경에서 GPU 자원 운영 부담을 줄이기 위한 기반을 설계했습니다. Karpenter와 NVDP로 GPU 노드의 자동 생성·회수 흐름을 구성했습니다.


컬리의 MLOps 구축 초기에 GPU 노드 자동화와 Karpenter 도입 과정을 소개했습니다. NVDP, affinity, consolidation 이슈까지 포함해 운영 포인트를 정리했습니다.
.png)

온프레미스 쿠버네티스에서 NAS와 GPU를 함께 쓰는 구성을 다뤘습니다. RKE2, NFS, gpu-operator를 활용한 클러스터 구축 맥락을 소개했습니다.

AWS Inferentia로 TensorFlow RoBERTa 모델을 컴파일하고 GPU 인스턴스와 비용·성능을 비교했습니다. 1000RPS 기준 Inferentia의 높은 비용 효율과 동적 그래프 제약을 함께 정리했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
.png)

RKE2 기반 온프레미스 Kubernetes 클러스터의 고가용성 설계와 10개월 운영 경험을 공유했습니다.\n노드 역할 분배, NAS·Cloud SQL 스토리지 분리, Route53 장애 대응의 한계도 정리했습니다.