목록 보기
유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기
AI

유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기

스캐터랩 핑퐁
스캐터랩 핑퐁
2026년 5월 6일

두줄요약

답변 재생성 시그널을 정제해 DPO 학습용 선호 페어를 구성했습니다. 강한 거부 신호와 분포 조정으로 이용 시간·리텐션을 개선했습니다.

문제 상황

  • 엔터테인먼트 LLM의 ‘재미’를 반영할 고품질 선호 데이터 확보 난점
  • 답변 재생성을 그대로 chosen·rejected 페어로 사용한 DPO 학습의 개선 부재

원인 분석

  • 재생성 행동에 불만, 변주 탐색, 더 나은 답변 기대 등 복합 의도 혼재
  • 길이와 안전성 측면에서 chosen 값이 높은 페어의 편향
  • 1차 개선 모델에서 chosen·rejected 간 차이 축소에 따른 선호 신호 약화

해결 방법

  • 습관적 재생성, 초기 유저, 특정 방향 답변 반복 탐색 유저 페어 제외
  • 토큰 길이와 safety 모델 위험도 기준으로 chosen > rejected 페어 비율 조정
  • 동일 턴 3회 이상 재생성된 강한 거부 신호 페어로 2차 DPO 학습

성능/운영 포인트

  • 1차 DPO 모델의 주간 평균 이용 시간 약 8.1% 및 Week 1 리텐션 약 1.19%p 상승
  • 분포 조정으로 답변 길이와 부적절 발화 비율의 베이스 모델 수준 안정화
  • 2차 DPO 모델의 주간 평균 이용 시간 약 3.27%, Week 1 리텐션 약 0.28%p 추가 상승

다음 읽기

#LLM 주제를 이어서 읽기

스캐터랩이 가장 재밌는 LLM을 찾는 방법

실제 유저 반응으로 LLM의 재미를 평가하기 위해 A/B 테스트, MAB, 리더보드를 활용했습니다. 세 방식의 편향과 리스크를 보완하며 모델 탐색부터 최종 배포 검증까지 설계했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...