목록 보기
꼼꼼하고 이해하기 쉬운 ELECTRA 논문 리뷰
AI

꼼꼼하고 이해하기 쉬운 ELECTRA 논문 리뷰

스캐터랩 핑퐁
스캐터랩 핑퐁
2020년 5월 8일

두줄요약

ELECTRA의 RTD 사전학습 구조와 MLM·GAN 대비 차이를 정리했습니다. 모든 토큰을 분류해 적은 계산량으로 높은 성능을 낸 실험 결과를 살펴봤습니다.

구조와 흐름

  • MLM 기반 사전학습의 15% 토큰 손실, 높은 계산 비용, 학습·추론 간 [MASK] 불일치 문제
  • Generator의 마스크 토큰 예측·샘플링과 Discriminator의 원본·치환 토큰 이진 분류를 결합한 RTD 구조
  • 사전학습 후 Generator를 버리고 Discriminator만 다운스트림 태스크에 파인튜닝

선택 이유

  • 모든 입력 토큰에 대한 Discriminator 손실로 MLM보다 높은 학습 효율성
  • Generator와 적대적으로 경쟁하지 않고 maximum likelihood로 학습하는 GAN과의 차이
  • Discriminator 대비 1/4~1/2 크기의 작은 Generator와 임베딩 가중치 공유의 효과

성능/운영 포인트

  • 동일 모델 크기·데이터·계산량 조건에서 BERT 대비 높은 GLUE 성능
  • ELECTRA-Small의 빠른 수렴과 단일 GPU 기반 학습 가능성
  • ELECTRA-Large의 RoBERTa·XLNet 대비 약 1/4 계산량 수준 성능과 SQuAD 성과

적용해볼 점

  • 제한된 컴퓨팅 환경에서 RTD 기반 사전학습과 작은 Generator 구성 검토
  • 절대 성능뿐 아니라 FLOPs·파라미터 수·수렴 속도를 함께 평가하는 기준

다음 읽기

#NLP 주제를 이어서 읽기

꼼꼼하고 이해하기 쉬운 XLNet 논문 리뷰

XLNet의 순열 언어 모델링과 two-stream attention으로 AR·AE의 한계를 보완한 방식을 리뷰했습니다.\nTransformer-XL 기반 긴 문맥 처리와 주요 NLP 과제의 성능 실험도 분석했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...