유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기
두줄요약
답변 재생성 시그널을 정제해 DPO 학습용 선호 페어를 구성했습니다. 강한 거부 신호와 분포 조정으로 이용 시간·리텐션을 개선했습니다.
문제 상황
- 엔터테인먼트 LLM의 ‘재미’를 반영할 고품질 선호 데이터 확보 난점
- 답변 재생성을 그대로 chosen·rejected 페어로 사용한 DPO 학습의 개선 부재
원인 분석
- 재생성 행동에 불만, 변주 탐색, 더 나은 답변 기대 등 복합 의도 혼재
- 길이와 안전성 측면에서 chosen 값이 높은 페어의 편향
- 1차 개선 모델에서 chosen·rejected 간 차이 축소에 따른 선호 신호 약화
해결 방법
- 습관적 재생성, 초기 유저, 특정 방향 답변 반복 탐색 유저 페어 제외
- 토큰 길이와 safety 모델 위험도 기준으로 chosen > rejected 페어 비율 조정
- 동일 턴 3회 이상 재생성된 강한 거부 신호 페어로 2차 DPO 학습
성능/운영 포인트
- 1차 DPO 모델의 주간 평균 이용 시간 약 8.1% 및 Week 1 리텐션 약 1.19%p 상승
- 분포 조정으로 답변 길이와 부적절 발화 비율의 베이스 모델 수준 안정화
- 2차 DPO 모델의 주간 평균 이용 시간 약 3.27%, Week 1 리텐션 약 0.28%p 추가 상승



