
개인화 추천 시스템 1편 - 유저의 행동은 “언어”일까? : Collaborative Embedding 구축기 (feat. Knowledge Distillation)
두줄요약
상품 텍스트와 행동 시퀀스를 결합한 Collaborative Embedding 추천 모델을 구축했습니다.\n지식 증류로 검색 성능을 높이고 A/B·CRM 테스트의 지표 개선을 확인했습니다.
문제 상황
- 상품 속성만으로 실제 유저의 취향과 구매 맥락을 예측하기 어려운 개인화 추천 과제
- 협업 필터링의 실시간 업데이트·콜드 스타트 한계와 생성형 순차 추천의 높은 추론 비용
구조와 흐름
- 상품 텍스트를 RQ-VAE와 카테고리 예측 보조 헤드로 압축한 Semantic ID 및 Content Embedding
- Transformer 인코더로 행동 시퀀스를 해석하고 유저·상품을 Collaborative Space에 투영하는 Dual-Head 구조
- Generative Head의 Semantic ID 순차 생성과 Retrieval Head의 ANN 후보 검색 분리
해결 방법
- KL Divergence와 Listwise Loss 기반 Knowledge Distillation으로 생성형 헤드의 확률 분포·순위 정보를 검색 헤드에 전달
- 주문 단위 위치 인코딩, 빈도 역비례 타겟 샘플링, 동일 카테고리·과거 구매 상품 기반 Hard Negative Mining
성능/운영 포인트
- 증류 적용 Retrieval Head의 HR@10 기준 베이스라인 대비 약 66% 향상 및 Teacher 성능의 약 80% 수준 도달
- 앱 지면 A/B 테스트에서 장바구니 전환율·유저당 매출 상승, CRM 클릭률 약 55.6% 증가
- 벡터 유사도 기반 실시간 후보 검색과 텍스트 기반 신규 상품 콜드 스타트 대응

