새로운 루다를 지탱하는 모델 서빙 아키텍처 — 2편: ArgoCD와 모델 서빙
두줄요약
ArgoCD와 Helm Chart로 모델 서빙 인프라 및 A/B 테스트 환경을 배포하는 구조를 소개했습니다.\n파이프라인 추상화, SyncWave 종료 순서, 블루/그린 배포와 RPS 기반 확장 전략을 설명합니다.
구조와 흐름
- 서비스 백엔드에서 A/B Proxy를 거쳐 실험군별 모델 파이프라인 서버로 요청을 전달하는 모델 서빙 구조
- 모델 파이프라인 서버의 추론 작업 추상화와 모델 서버·Faiss 등 외부 추론 서비스 연동
- Components·Infrastructures·Applications 계층의 Helm Chart와 ArgoCD App of Apps 기반 배포 구성
선택 이유
- 파이프라인 코드와 설정 변경만으로 변화하는 모델 아키텍처 및 A/B/n 실험 준비 단순화
- 컴포넌트 독립 배포·공유를 통한 부하 테스트 지원과 실험군 간 재사용성 확보
- 추론 구조 변경 시 롤링 업데이트 호환성 위험을 피하기 위한 블루/그린 배포 선택
성능/운영 포인트
- Development·Stage·Production 클러스터 순차 배포와 E2E 테스트
- SyncWave로 모델 파이프라인 서버부터 종료하는 계층형 Graceful Shutdown 순서 제어
- RPS·지연시간·실험군 트래픽 비율 기반 HPA 확장과 모니터링을 통한 비용 절감
주의할 점
- 환경별 차트에서 컴포넌트 환경 설정 변경 시 테스트·실배포 환경 괴리 위험
- App of Apps 배포 순서 지원 한계 보완을 위한 리소스 상태 기반 커스터마이징과 Health Check 적용
- Out of Sync·Degraded 상태가 후속 리소스 배포를 막는 상황 고려

