스캐터랩 핑퐁2026년 5월 6일AI유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기답변 재생성 시그널을 정제해 DPO 학습용 선호 페어를 구성했습니다. 강한 거부 신호와 분포 조정으로 이용 시간·리텐션을 개선했습니다.#LLM#DPO000