스캐터랩 핑퐁2023년 11월 17일AIRLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?RLHF의 복잡성과 불안정성을 줄이기 위한 RRHF·SLiC-HF·DPO·Rejection Sampling을 비교했습니다. 실험에서는 Rejection Sampling과 DPO가 유용성·응답 안정성 측면에서 두드러졌습니다.#LLM#RLHF#DPO000