스캐터랩이 가장 재밌는 LLM을 찾는 방법
두줄요약
실제 유저 반응으로 LLM의 재미를 평가하기 위해 A/B 테스트, MAB, 리더보드를 활용했습니다. 세 방식의 편향과 리스크를 보완하며 모델 탐색부터 최종 배포 검증까지 설계했습니다.
문제 상황
- 벤치마크·LLM-as-a-judge 점수와 실제 제품 사용성 사이의 불일치
- 유저별·상황별로 변하는 ‘재미’와 내부 정성 평가만으로 예측하기 어려운 선호
- 매주 다수의 학습 모델 후보를 제품 지표 훼손 없이 빠르게 평가해야 하는 과제
구조와 흐름
- A/B 테스트로 유저 단위 모델을 고정 배정하고 리텐션 등 실제 제품 지표 비교
- MAB로 플레이 단위 모델 할당 비중을 조정하며 탐색과 활용의 균형 유지
- 답변 쌍 선택 기반 리더보드로 직접 선호를 수집하고 BT score로 모델 순위 산정
트레이드오프
- A/B 테스트의 높은 신뢰도와 고정 배정에 따른 나쁜 모델 경험·큰 표본 요구
- MAB의 빠른 관측 확보·위험 후보 축소와 보상 지표 정의·지연 보상 대응 과제
- 리더보드의 빠른 선호 수집과 위치·길이·무의미한 선택 등 편향 및 제품 지표 불일치
성능/운영 포인트
- 리더보드로 최소 선호 확인, MAB로 다수 후보 탐색, A/B 테스트로 최종 제품 지표 검증
- A/A 테스트, 위험 발화 비중·이탈 비율 가드레일 모니터링, 실험·배포 파이프라인 고도화
- 유저 만족도와 연결된 보상 지표 설계 및 UI/UX 기반 평가 데이터 수집


