딥러닝 모델 서비스 A-Z 2편 - Knowledge Distillation
두줄요약
대형 BERT 기반 대화 모델을 Knowledge Distillation으로 경량화한 사례를 소개했습니다. 임베딩·로짓 증류로 약 3배 추론 속도와 높은 정확도를 확보했습니다.
문제 상황
- 대형 언어 모델의 높은 연산량과 메모리 요구로 인한 서비스 적용 제약
- 대화 문맥과 답변의 적합도를 빠르게 판별할 경량 모델 필요
구조와 흐름
- 두 BERT 인코더의 문맥·답변 임베딩과 코사인 유사도 기반 답변 적합도 산출
- Projection 레이어와 ANN 검색을 고려한 고정 차원 임베딩 구성
- Teacher 임베딩 증류 후 예측 로짓 증류와 파인튜닝을 순차 적용
선택 이유
- Prediction Logit Distillation으로 Teacher의 클래스 간 관계 전이
- Embedding Distillation으로 Metric Learning 핵심인 인코더 임베딩 품질 전이
- Teacher 레이어 활용 초기화와 Student 사전학습을 리소스·성능 조건에 따라 선택
성능/운영 포인트
- BERT large의 일부 레이어를 사용한 8레이어 Student로 약 3배 추론 속도 향상
- Teacher 학습 데이터의 1/40 사용 후 Top 1 96.2%, Top 5 99.3%, Top 10 99.9% 정확도 유지
- 추가 경량화 후보로 Sparse Transformer, TensorFlow Serving Quantization, 트랜스포머 블록 축소 제시


