
상품 추천 알고리즘 Item-CF의 최적화 여정
두줄요약
Item-CF를 희소 벡터와 Ray 분산 처리로 최적화해 추천 테이블 생성 시간을 크게 줄였습니다. 메타데이터 품질 편차가 큰 다수 이커머스 환경에서 견고성을 선택한 사례를 소개합니다.
구조와 흐름
- 사용자·상품 상호작용 행렬에서 상품 간 유사도를 계산하는 Item-CF 기반 추천
- 구매 이력으로 Item Similarities 테이블을 구축하고, 기존 구매 상품과 유사한 상품 추천
성능/운영 포인트
- 희소 벡터 포맷과 라이브러리의 cosine similarity 활용으로 유사도 계산 평균 6배 가속
- 상품별 계산 독립성을 활용한 Ray 분산 처리와 48코어 EC2 적용으로 50일 예상 런타임을 4시간으로 단축
- 분산 처리 이전 단일 코어 수준 최적화 우선 접근의 개발·디버깅 비용 절감
선택 이유
- 30개 이커머스 카탈로그에 공통 적용 가능한 상호작용 데이터 중심 모델
- 이커머스별 품질 편차가 큰 사용자·상품 메타데이터 의존성 최소화
트레이드오프
- 메타데이터 활용 모델 대비 최고 성능보다 다양한 광고주의 데이터 품질을 견디는 견고성 중시
- 분산 알고리즘의 높은 개발·디버깅 난이도와 추가 개발 시간


