목록 보기
꼼꼼하고 이해하기 쉬운 XLNet 논문 리뷰
AI

꼼꼼하고 이해하기 쉬운 XLNet 논문 리뷰

스캐터랩 핑퐁
스캐터랩 핑퐁
2019년 7월 1일

두줄요약

XLNet의 순열 언어 모델링과 two-stream attention으로 AR·AE의 한계를 보완한 방식을 리뷰했습니다.\nTransformer-XL 기반 긴 문맥 처리와 주요 NLP 과제의 성능 실험도 분석했습니다.

구조와 흐름

  • AR의 단방향 문맥 한계와 AE의 마스크 토큰 간 독립 가정·사전학습/미세조정 불일치 분석
  • 모든 토큰 순열에 대한 자기회귀 예측으로 양방향 문맥과 토큰 간 의존성을 함께 학습하는 permutation language modeling
  • 대상 위치와 문맥 정보를 분리하는 query stream·content stream 기반 two-stream self-attention

선택 이유

  • [MASK] 없이 자기회귀 학습을 수행해 BERT 계열의 입력 불일치 완화
  • 순열별 조건부 확률 계산으로 기존 AR 모델보다 풍부한 양방향 문맥 활용
  • Transformer-XL의 상대 위치 인코딩과 segment recurrence로 긴 문장 처리 보강

성능/운영 포인트

  • RACE, SQuAD, 텍스트 분류, GLUE, 문서 재순위화에서 기존 모델 대비 높은 성능 보고
  • 긴 시퀀스에서 Transformer-XL 메모리 캐싱의 중요성 확인
  • partial prediction으로 순열 기반 학습의 느린 수렴 완화, next sentence prediction의 제한적 효용 관찰

트레이드오프

  • 모든 순열을 고려하는 학습 목표의 최적화 난이도
  • 짧은 문장 과제에서 긴 문맥 처리 이점의 제한 가능성
  • 대형 모델 확대 시 미세조정 실용성 저하 가능성

다음 읽기

#NLP 주제를 이어서 읽기

꼼꼼하고 이해하기 쉬운 ELECTRA 논문 리뷰

ELECTRA의 RTD 사전학습 구조와 MLM·GAN 대비 차이를 정리했습니다. 모든 토큰을 분류해 적은 계산량으로 높은 성능을 낸 실험 결과를 살펴봤습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...