
AWS 인프라를 활용한 무븐트의 music-to-dance AI 학습·서빙 인프라 구축기
두줄요약
무븐트는 AWS 이벤트 기반 파이프라인으로 댄스 영상을 구조화된 학습 데이터로 변환했습니다.\nGPU 추론과 API를 분리한 다중 계층 서빙으로 성능과 확장성을 개선했습니다.
문제 상황
- 음악·리듬·신체 구조·장르 문법이 결합된 안무 도메인 특화 데이터와 안정적 모델 서빙 필요
- 단일 EC2에서 API와 디퓨전 추론을 함께 처리한 PoC 구조의 트래픽 급증·GPU 부족·장애 전파 위험
구조와 흐름
- 모션 캡처와 영상 분석을 결합하고 댄서 라벨링으로 동작 설명·감정·질감·장르 맥락을 구조화
- S3 업로드 이벤트를 SQS로 버퍼링하고 GPU EC2 워커가 HMR 작업을 비동기로 처리
- WAF·Cognito·API Gateway·Lambda 기반 접근 제어와 SNS·Lambda·DynamoDB 기반 실패 기록
- 웹 CPU EC2, 프라이빗 GPU EC2 Auto Scaling, Aurora 읽기 복제본으로 서빙 계층 분리
선택 이유
- 긴 영상과 GPU 의존 추론을 API 요청에서 분리해 업로드 피크와 처리 시간 변동 대응
- 웹·앱·데이터 계층의 독립 확장과 로드밸런싱으로 글로벌 사용자 및 외부 API 연동 대비
성능/운영 포인트
- g5에서 g7e.2xlarge 전환 후 20초 오디오 약 35초, 30초 약 62초, 40초 약 98초 생성
- 첫 결과물 수신 시간 약 2분에서 51초로 단축, 생성 완료율 약 10% 향상
- 입력 손상·긴 영상·사람 미검출·리소스 제한 실패를 기록해 재처리·전처리 조정·샘플 제외 판단 지원
