
Transformer를 이용해 대량의 게임 데이터를 임베딩 해보자!
두줄요약
게임 행동 로그를 Transformer-Autoencoder로 임베딩해 긴 시퀀스 처리와 GPU 학습 효율을 개선했습니다. 부정사용자 탐지에서 LSTM 기반 임베딩보다 높은 F1 Score를 확인했습니다.
구조와 흐름
- 게임 유저 행동 로그의 Action·Context·Zone Code 결합 시퀀스와 사전 구축
- 입력과 동일한 시퀀스 복원을 목표로 한 Transformer Encoder-Decoder Autoencoder
- 인코더 임베딩 벡터를 사용자·캐릭터별 행동 특성 표현으로 활용
선택 이유
- LSTM Seq2Seq-Autoencoder의 낮은 GPU 병렬화 효율과 긴 학습·추론 시간
- 고정 길이 Context Vector의 정보 손실과 긴 시퀀스 Long-Term-Dependency 문제
- BERT의 과적합 가능성, 반복적 게임 로그와 NSP의 낮은 적합성
성능/운영 포인트
- GPU 사용 시 Epoch당 학습 시간 40분에서 10분으로 감소
- 테스트 데이터 90% 이상에서 입력 시퀀스와 동일한 출력 복원
- Decoder layer별 attention score의 계단형 패턴을 통한 시퀀스 참조 확인
적용해볼 점
- 부정사용자 탐지 이진 분류 입력으로 임베딩 벡터 적용
- LSTM 임베딩 대비 F1 Score 0.807에서 0.924로 향상
- 반복 행동 및 일반 사용자와 다른 행동 패턴의 구분 가능성 확인

