AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄
두줄요약
AWS Inferentia로 TensorFlow RoBERTa 모델을 컴파일하고 GPU 인스턴스와 비용·성능을 비교했습니다. 1000RPS 기준 Inferentia의 높은 비용 효율과 동적 그래프 제약을 함께 정리했습니다.
문제 상황
- RoBERTa-Base 규모 실시간 추론의 낮은 지연 시간과 서버 비용 확보 필요
- 기존 g4dn GPU 기반 모델 서빙의 하드웨어 비용 최적화 검토
해결 방법
- TensorFlow 모델을 Neuron SDK의
tfn.trace로 고정 추론 그래프화하고 SavedModel로 저장 - Inferentia 전용 inf1 인스턴스에서 컴파일 모델 로딩 및 추론 수행
- 입력 길이별 별도 컴파일과 배치 크기별 성능 측정
성능/운영 포인트
- inf1.xlarge, T4 기반 g4dn.xlarge, A10 기반 g5.xlarge의 지연 시간·RPS·시간당 비용 비교
- 1000RPS 가정에서 Inferentia의 비용 효율 확인, 조건별 1.5~5.7배 비용 절감 결과
- 초기 1~5회 추론 warmup 고려와 컴파일 시 대용량 호스트 메모리 필요
주의할 점
- 동적 그래프, 가변 입출력 shape, Beam Search 기반 생성 모델 적용 제약
- 대형 모델의 지연 시간과 Neuron 지원 Graph Ops 호환성 사전 검토 필요
