목록 보기
RLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?
AI

RLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 11월 17일

두줄요약

RLHF의 복잡성과 불안정성을 줄이기 위한 RRHF·SLiC-HF·DPO·Rejection Sampling을 비교했습니다. 실험에서는 Rejection Sampling과 DPO가 유용성·응답 안정성 측면에서 두드러졌습니다.

문제 상황

  • PPO 기반 RLHF의 Actor·Reward·Critic·Reference 4개 모델 운영 부담과 높은 GPU 메모리 요구량
  • 하이퍼파라미터 민감도, 보상 모델 강건성 부족, mode collapse 가능성에 따른 학습 불안정성

구조와 흐름

  • 오프라인 후보 응답의 순위 손실을 활용하는 RRHF와 SLiC-HF
  • 선호·비선호 응답 쌍과 기준 모델 확률비를 직접 최적화하는 DPO
  • 고보상 후보를 선별해 SFT로 학습하는 Rejection Sampling과 Best-of-N 방식

성능/운영 포인트

  • Vicuna-v1.5 7B와 Anthropic HH 데이터셋 기반 4개 대체 방법론 구현·비교
  • RLHF 실험의 A100 80GiB 8대 대비 부가 모델 축소로 A100 80GiB 4대 학습 가능
  • 리워드 점수와 GPT-4 상대평가에서 Rejection Sampling 우세, DPO의 안정적 응답 품질

트레이드오프

  • Rejection Sampling의 간단한 학습 구조와 높은 정렬 성능, 네거티브 신호 활용 한계
  • DPO의 별도 리워드 모델·후보 샘플링 불필요성, 학습 중 Reference 모델 필요
  • RRHF의 큰 KL Divergence와 다수의 부자연스러운 응답을 통한 mode collapse 추정

다음 읽기

#RLHF 주제를 이어서 읽기

더 나은 생성모델을 위해 RLHF로 피드백 학습시키기

사람의 선호도를 보상으로 학습하는 RLHF의 SFT·리워드 모델·PPO 과정을 설명했습니다. 루다 적용 실험과 학습 불안정성, FSDP·DPO 등 최적화 및 대안을 소개했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...