딥러닝 모델 서비스 A-Z 1편 - 연산 최적화 및 모델 경량화
두줄요약
딥러닝 추론 서비스를 위한 CPU·GPU 선택과 라이브러리, 서빙 환경 최적화 방안을 정리했습니다.\n병렬처리 설정과 클라우드 전용 칩, Pruning·Quantization·Distillation 기반 경량화를 소개했습니다.
구조와 흐름
- 딥러닝 추론 서비스의 핵심 과제로 빠른 연산과 연산량 절감 제시
- CPU의 비용·확장성·배포 유연성과 GPU의 단일 추론 속도 간 특성 비교
- 라이브러리, 서빙 환경, 병렬처리 설정, 클라우드 추론 인스턴스, 모델 경량화 관점의 최적화 구성
선택 이유
- CPU 추론용 MKL-DNN과 GPU 추론용 TensorRT 기반 행렬 연산 최적화
- Python GIL·GC 병목 완화를 위한 TensorFlow Serving, TorchScript·libTorch 기반 서빙 언급
- AWS Inferentia와 Neuron SDK를 통한 전용 칩 기반 추론 검토
성능/운영 포인트
- OpenMP·TBB 환경변수 조정으로 코드 변경 없이 병렬처리 성능 개선 가능성
- 핑퐁팀 환경에서 OpenMP 설정으로 10~15% 성능 향상 확인
- Inf1 리전 지원 및 프레임워크 최신 버전 지원 여부를 도입 제약으로 검토
주의할 점
- 모델·환경별 최적 병렬처리 옵션 차이에 따른 실험 필요
- APEX 사용 시 PyTorch·CUDA·Pip 버전 호환성 제약
- Pruning·Quantization·Distillation별 상이한 경량화 접근과 학습 단계 고려


