RLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?
두줄요약
RLHF의 복잡성과 불안정성을 줄이기 위한 RRHF·SLiC-HF·DPO·Rejection Sampling을 비교했습니다. 실험에서는 Rejection Sampling과 DPO가 유용성·응답 안정성 측면에서 두드러졌습니다.
문제 상황
- PPO 기반 RLHF의 Actor·Reward·Critic·Reference 4개 모델 운영 부담과 높은 GPU 메모리 요구량
- 하이퍼파라미터 민감도, 보상 모델 강건성 부족, mode collapse 가능성에 따른 학습 불안정성
구조와 흐름
- 오프라인 후보 응답의 순위 손실을 활용하는 RRHF와 SLiC-HF
- 선호·비선호 응답 쌍과 기준 모델 확률비를 직접 최적화하는 DPO
- 고보상 후보를 선별해 SFT로 학습하는 Rejection Sampling과 Best-of-N 방식
성능/운영 포인트
- Vicuna-v1.5 7B와 Anthropic HH 데이터셋 기반 4개 대체 방법론 구현·비교
- RLHF 실험의 A100 80GiB 8대 대비 부가 모델 축소로 A100 80GiB 4대 학습 가능
- 리워드 점수와 GPT-4 상대평가에서 Rejection Sampling 우세, DPO의 안정적 응답 품질
트레이드오프
- Rejection Sampling의 간단한 학습 구조와 높은 정렬 성능, 네거티브 신호 활용 한계
- DPO의 별도 리워드 모델·후보 샘플링 불필요성, 학습 중 Reference 모델 필요
- RRHF의 큰 KL Divergence와 다수의 부자연스러운 응답을 통한 mode collapse 추정




