목록 보기
AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄
AI

AWS Inferentia 를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 1탄

스캐터랩 핑퐁
스캐터랩 핑퐁
2022년 7월 13일

두줄요약

AWS Inferentia로 TensorFlow RoBERTa 모델을 컴파일하고 GPU 인스턴스와 비용·성능을 비교했습니다. 1000RPS 기준 Inferentia의 높은 비용 효율과 동적 그래프 제약을 함께 정리했습니다.

문제 상황

  • RoBERTa-Base 규모 실시간 추론의 낮은 지연 시간과 서버 비용 확보 필요
  • 기존 g4dn GPU 기반 모델 서빙의 하드웨어 비용 최적화 검토

해결 방법

  • TensorFlow 모델을 Neuron SDK의 tfn.trace로 고정 추론 그래프화하고 SavedModel로 저장
  • Inferentia 전용 inf1 인스턴스에서 컴파일 모델 로딩 및 추론 수행
  • 입력 길이별 별도 컴파일과 배치 크기별 성능 측정

성능/운영 포인트

  • inf1.xlarge, T4 기반 g4dn.xlarge, A10 기반 g5.xlarge의 지연 시간·RPS·시간당 비용 비교
  • 1000RPS 가정에서 Inferentia의 비용 효율 확인, 조건별 1.5~5.7배 비용 절감 결과
  • 초기 1~5회 추론 warmup 고려와 컴파일 시 대용량 호스트 메모리 필요

주의할 점

  • 동적 그래프, 가변 입출력 shape, Beam Search 기반 생성 모델 적용 제약
  • 대형 모델의 지연 시간과 Neuron 지원 Graph Ops 호환성 사전 검토 필요

다음 읽기

#TensorFlow 주제를 이어서 읽기

AWS Inferentia를 이용한 모델 서빙 비용 최적화: 모델 서버 비용 2배 줄이기 2탄

AWS Inferentia 기반 TensorFlow 모델 서빙의 정합성 검증과 EKS 배포 과정을 소개했습니다. 토크나이저 분리와 동적 배치로 처리량을 높이고 비용 절감 가능성을 확인했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...