Transformer - Harder, Better, Faster, Stronger
두줄요약
Transformer의 Attention 구조와 GPT·BERT의 차이를 설명했습니다. 성능 향상과 경량화를 위한 후속 모델·압축 기법을 비교했습니다.
구조와 흐름
- RNN의 장기 의존성·기울기 소실 문제를 보완하는 Attention 기반 Transformer
- Query·Key·Value의 Scaled Dot-Product Attention과 다중 헤드 구성
- 잠재 표현을 만드는 Encoder와 단어 출현 확률을 출력하는 마스킹 Decoder
선택 이유
- GPT의 단방향 Decoder Attention 기반 문장 생성
- BERT의 양방향 Encoder Attention 기반 풍부한 문맥 반영
- XLNet의 순열 기반 관계 학습, RoBERTa의 사전학습 최적화, MT-DNN의 다중 작업 학습, T5의 text-to-text 문제 통합
트레이드오프
- 대규모 파라미터·학습 데이터·학습 시간 요구
- BERT의 높은 추론 지연으로 인터페이스 제품 적용 제약
- 성능 향상을 위한 복잡한 구조·대용량 데이터와 경량화 요구의 상충
성능/운영 포인트
- 양자화·가지치기로 가중치 압축과 추론 경량화
- DistilBERT의 지식 증류를 통한 레이어 축소와 성능 보존
- ALBERT의 임베딩 재구성·레이어 파라미터 공유·문장 순서 예측 기반 효율화


