목록 보기
딥러닝 모델 서비스 A-Z 2편 - Knowledge Distillation
AI

딥러닝 모델 서비스 A-Z 2편 - Knowledge Distillation

스캐터랩 핑퐁
스캐터랩 핑퐁
2020년 11월 18일

두줄요약

대형 BERT 기반 대화 모델을 Knowledge Distillation으로 경량화한 사례를 소개했습니다. 임베딩·로짓 증류로 약 3배 추론 속도와 높은 정확도를 확보했습니다.

문제 상황

  • 대형 언어 모델의 높은 연산량과 메모리 요구로 인한 서비스 적용 제약
  • 대화 문맥과 답변의 적합도를 빠르게 판별할 경량 모델 필요

구조와 흐름

  • 두 BERT 인코더의 문맥·답변 임베딩과 코사인 유사도 기반 답변 적합도 산출
  • Projection 레이어와 ANN 검색을 고려한 고정 차원 임베딩 구성
  • Teacher 임베딩 증류 후 예측 로짓 증류와 파인튜닝을 순차 적용

선택 이유

  • Prediction Logit Distillation으로 Teacher의 클래스 간 관계 전이
  • Embedding Distillation으로 Metric Learning 핵심인 인코더 임베딩 품질 전이
  • Teacher 레이어 활용 초기화와 Student 사전학습을 리소스·성능 조건에 따라 선택

성능/운영 포인트

  • BERT large의 일부 레이어를 사용한 8레이어 Student로 약 3배 추론 속도 향상
  • Teacher 학습 데이터의 1/40 사용 후 Top 1 96.2%, Top 5 99.3%, Top 10 99.9% 정확도 유지
  • 추가 경량화 후보로 Sparse Transformer, TensorFlow Serving Quantization, 트랜스포머 블록 축소 제시

다음 읽기

같은 회사의 연관 글

딥러닝 모델 서비스 A-Z 1편 - 연산 최적화 및 모델 경량화

딥러닝 추론 서비스를 위한 CPU·GPU 선택과 라이브러리, 서빙 환경 최적화 방안을 정리했습니다.\n병렬처리 설정과 클라우드 전용 칩, Pruning·Quantization·Distillation 기반 경량화를 소개했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...