목록 보기
Transformer - Harder, Better, Faster, Stronger
AI

Transformer - Harder, Better, Faster, Stronger

스캐터랩 핑퐁
스캐터랩 핑퐁
2020년 1월 3일

두줄요약

Transformer의 Attention 구조와 GPT·BERT의 차이를 설명했습니다. 성능 향상과 경량화를 위한 후속 모델·압축 기법을 비교했습니다.

구조와 흐름

  • RNN의 장기 의존성·기울기 소실 문제를 보완하는 Attention 기반 Transformer
  • Query·Key·Value의 Scaled Dot-Product Attention과 다중 헤드 구성
  • 잠재 표현을 만드는 Encoder와 단어 출현 확률을 출력하는 마스킹 Decoder

선택 이유

  • GPT의 단방향 Decoder Attention 기반 문장 생성
  • BERT의 양방향 Encoder Attention 기반 풍부한 문맥 반영
  • XLNet의 순열 기반 관계 학습, RoBERTa의 사전학습 최적화, MT-DNN의 다중 작업 학습, T5의 text-to-text 문제 통합

트레이드오프

  • 대규모 파라미터·학습 데이터·학습 시간 요구
  • BERT의 높은 추론 지연으로 인터페이스 제품 적용 제약
  • 성능 향상을 위한 복잡한 구조·대용량 데이터와 경량화 요구의 상충

성능/운영 포인트

  • 양자화·가지치기로 가중치 압축과 추론 경량화
  • DistilBERT의 지식 증류를 통한 레이어 축소와 성능 보존
  • ALBERT의 임베딩 재구성·레이어 파라미터 공유·문장 순서 예측 기반 효율화

다음 읽기

#Transformer 주제를 다룬 다른 회사 글

Transformer를 이용해 대량의 게임 데이터를 임베딩 해보자!

게임 행동 로그를 Transformer-Autoencoder로 임베딩해 긴 시퀀스 처리와 GPU 학습 효율을 개선했습니다. 부정사용자 탐지에서 LSTM 기반 임베딩보다 높은 F1 Score를 확인했습니다.

NC소프트 DANBI
NC소프트 DANBI
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...