더 나은 생성모델을 위해 RLHF로 피드백 학습시키기
두줄요약
사람의 선호도를 보상으로 학습하는 RLHF의 SFT·리워드 모델·PPO 과정을 설명했습니다. 루다 적용 실험과 학습 불안정성, FSDP·DPO 등 최적화 및 대안을 소개했습니다.
문제 상황
- 사전 학습 LLM의 부적절한 응답, 편향, 환각과 사용자 의도 불일치
- 정답 모사 중심 SFT만으로 반영하기 어려운 부정적·선호도 기반 피드백
구조와 흐름
- SFT 모델의 답변 후보 생성, 사람의 선호도 순위 레이블링, Bradley-Terry 기반 리워드 모델 학습
- 리워드 최대화와 레퍼런스 모델 이탈 억제를 위한 KL penalty를 결합한 PPO 기반 RLHF
- 루다의 기존 랭킹 모델 점수를 리워드로 활용한 생성 모델 파인튜닝 실험
성능/운영 포인트
- 평가용 예제에서 평균 리워드 점수 1.23점에서 1.36점으로 상승
- Policy·Reward·Reference·Critic 4개 모델 운용에 따른 GPU 메모리와 추론 속도 최적화 필요
- FSDP 샤딩, 저정밀 연산, PEFT, Flash Attention, key-value caching 활용 가능성
주의할 점
- 리워드 모델의 취약점 악용에 따른 리워드 해킹·mode collapse 위험
- 하이퍼파라미터 민감도와 과적합 문제, 강건한 리워드 모델 및 KL 제약의 중요성
- 구현 복잡성과 불안정성을 보완하는 Best of N, RRHF, DPO 등의 대안 검토



