스캐터랩 핑퐁2023년 8월 30일AI더 나은 생성모델을 위해 RLHF로 피드백 학습시키기사람의 선호도를 보상으로 학습하는 RLHF의 SFT·리워드 모델·PPO 과정을 설명했습니다. 루다 적용 실험과 학습 불안정성, FSDP·DPO 등 최적화 및 대안을 소개했습니다.#RLHF#LLM#PPO000