꼼꼼하고 이해하기 쉬운 ELECTRA 논문 리뷰
두줄요약
ELECTRA의 RTD 사전학습 구조와 MLM·GAN 대비 차이를 정리했습니다. 모든 토큰을 분류해 적은 계산량으로 높은 성능을 낸 실험 결과를 살펴봤습니다.
구조와 흐름
- MLM 기반 사전학습의 15% 토큰 손실, 높은 계산 비용, 학습·추론 간
[MASK]불일치 문제 - Generator의 마스크 토큰 예측·샘플링과 Discriminator의 원본·치환 토큰 이진 분류를 결합한 RTD 구조
- 사전학습 후 Generator를 버리고 Discriminator만 다운스트림 태스크에 파인튜닝
선택 이유
- 모든 입력 토큰에 대한 Discriminator 손실로 MLM보다 높은 학습 효율성
- Generator와 적대적으로 경쟁하지 않고 maximum likelihood로 학습하는 GAN과의 차이
- Discriminator 대비 1/4~1/2 크기의 작은 Generator와 임베딩 가중치 공유의 효과
성능/운영 포인트
- 동일 모델 크기·데이터·계산량 조건에서 BERT 대비 높은 GLUE 성능
- ELECTRA-Small의 빠른 수렴과 단일 GPU 기반 학습 가능성
- ELECTRA-Large의 RoBERTa·XLNet 대비 약 1/4 계산량 수준 성능과 SQuAD 성과
적용해볼 점
- 제한된 컴퓨팅 환경에서 RTD 기반 사전학습과 작은 Generator 구성 검토
- 절대 성능뿐 아니라 FLOPs·파라미터 수·수렴 속도를 함께 평가하는 기준


