꼼꼼하고 이해하기 쉬운 XLNet 논문 리뷰
두줄요약
XLNet의 순열 언어 모델링과 two-stream attention으로 AR·AE의 한계를 보완한 방식을 리뷰했습니다.\nTransformer-XL 기반 긴 문맥 처리와 주요 NLP 과제의 성능 실험도 분석했습니다.
구조와 흐름
- AR의 단방향 문맥 한계와 AE의 마스크 토큰 간 독립 가정·사전학습/미세조정 불일치 분석
- 모든 토큰 순열에 대한 자기회귀 예측으로 양방향 문맥과 토큰 간 의존성을 함께 학습하는 permutation language modeling
- 대상 위치와 문맥 정보를 분리하는 query stream·content stream 기반 two-stream self-attention
선택 이유
- [MASK] 없이 자기회귀 학습을 수행해 BERT 계열의 입력 불일치 완화
- 순열별 조건부 확률 계산으로 기존 AR 모델보다 풍부한 양방향 문맥 활용
- Transformer-XL의 상대 위치 인코딩과 segment recurrence로 긴 문장 처리 보강
성능/운영 포인트
- RACE, SQuAD, 텍스트 분류, GLUE, 문서 재순위화에서 기존 모델 대비 높은 성능 보고
- 긴 시퀀스에서 Transformer-XL 메모리 캐싱의 중요성 확인
- partial prediction으로 순열 기반 학습의 느린 수렴 완화, next sentence prediction의 제한적 효용 관찰
트레이드오프
- 모든 순열을 고려하는 학습 목표의 최적화 난이도
- 짧은 문장 과제에서 긴 문맥 처리 이점의 제한 가능성
- 대형 모델 확대 시 미세조정 실용성 저하 가능성

