AI
꼼꼼하고 이해하기 쉬운 Reformer 리뷰
두줄요약
Reformer는 LSH Attention, Reversible Network, 청크 처리로 Transformer의 긴 입력 메모리 문제를 완화했습니다.\n실험을 통해 성능 저하를 작게 유지하며 Attention 복잡도를 선형 수준으로 개선했음을 살펴봤습니다.
문제 상황
- Transformer의 전체 토큰 쌍 Attention으로 인한 입력 길이 제곱 수준의 시간·메모리 복잡도
- 큰 차원의 Feed Forward Layer와 N개 Residual 블록 중간 결과 저장에 따른 추가 메모리 부담
구조와 흐름
- Angular LSH로 유사한 Query·Key를 동일 해시 버킷에 묶고, 같은 또는 인접 청크 내 쌍만 Attention 계산
- Query와 Key 행렬 공유를 전제로 LSH Attention 적용
- Attention·Feed Forward 블록을 Reversible Network로 구성하고, Feed Forward 연산을 청크 단위로 순차 처리
선택 이유
- 가까운 임베딩 쌍만 Attention해 전체 쌍 계산을 축소하는 LSH 특성 활용
- 출력에서 입력 복원이 가능한 Reversible Layer로 중간 활성값 저장 감소
- 위치 독립적인 Feed Forward Layer의 청크 처리 가능성
성능/운영 포인트
- LSH Attention으로 Attention 복잡도를 입력 길이에 선형적으로 근사
- Q=K 공유와 Reversible 구조 적용 시 성능 차이 미미한 실험 결과
- 해시 수 증가에 따른 Full Attention 수준 성능 접근 및 정확도·계산량 조절 가능성

