목록 보기
스캐터랩이 가장 재밌는 LLM을 찾는 방법
AI

스캐터랩이 가장 재밌는 LLM을 찾는 방법

스캐터랩 핑퐁
스캐터랩 핑퐁
2026년 2월 12일

두줄요약

실제 유저 반응으로 LLM의 재미를 평가하기 위해 A/B 테스트, MAB, 리더보드를 활용했습니다. 세 방식의 편향과 리스크를 보완하며 모델 탐색부터 최종 배포 검증까지 설계했습니다.

문제 상황

  • 벤치마크·LLM-as-a-judge 점수와 실제 제품 사용성 사이의 불일치
  • 유저별·상황별로 변하는 ‘재미’와 내부 정성 평가만으로 예측하기 어려운 선호
  • 매주 다수의 학습 모델 후보를 제품 지표 훼손 없이 빠르게 평가해야 하는 과제

구조와 흐름

  • A/B 테스트로 유저 단위 모델을 고정 배정하고 리텐션 등 실제 제품 지표 비교
  • MAB로 플레이 단위 모델 할당 비중을 조정하며 탐색과 활용의 균형 유지
  • 답변 쌍 선택 기반 리더보드로 직접 선호를 수집하고 BT score로 모델 순위 산정

트레이드오프

  • A/B 테스트의 높은 신뢰도와 고정 배정에 따른 나쁜 모델 경험·큰 표본 요구
  • MAB의 빠른 관측 확보·위험 후보 축소와 보상 지표 정의·지연 보상 대응 과제
  • 리더보드의 빠른 선호 수집과 위치·길이·무의미한 선택 등 편향 및 제품 지표 불일치

성능/운영 포인트

  • 리더보드로 최소 선호 확인, MAB로 다수 후보 탐색, A/B 테스트로 최종 제품 지표 검증
  • A/A 테스트, 위험 발화 비중·이탈 비율 가드레일 모니터링, 실험·배포 파이프라인 고도화
  • 유저 만족도와 연결된 보상 지표 설계 및 UI/UX 기반 평가 데이터 수집

다음 읽기

#LLM 주제를 이어서 읽기

유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기

답변 재생성 시그널을 정제해 DPO 학습용 선호 페어를 구성했습니다. 강한 거부 신호와 분포 조정으로 이용 시간·리텐션을 개선했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...