목록 보기
더 나은 생성모델을 위해 RLHF로 피드백 학습시키기
AI

더 나은 생성모델을 위해 RLHF로 피드백 학습시키기

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 8월 30일

두줄요약

사람의 선호도를 보상으로 학습하는 RLHF의 SFT·리워드 모델·PPO 과정을 설명했습니다. 루다 적용 실험과 학습 불안정성, FSDP·DPO 등 최적화 및 대안을 소개했습니다.

문제 상황

  • 사전 학습 LLM의 부적절한 응답, 편향, 환각과 사용자 의도 불일치
  • 정답 모사 중심 SFT만으로 반영하기 어려운 부정적·선호도 기반 피드백

구조와 흐름

  • SFT 모델의 답변 후보 생성, 사람의 선호도 순위 레이블링, Bradley-Terry 기반 리워드 모델 학습
  • 리워드 최대화와 레퍼런스 모델 이탈 억제를 위한 KL penalty를 결합한 PPO 기반 RLHF
  • 루다의 기존 랭킹 모델 점수를 리워드로 활용한 생성 모델 파인튜닝 실험

성능/운영 포인트

  • 평가용 예제에서 평균 리워드 점수 1.23점에서 1.36점으로 상승
  • Policy·Reward·Reference·Critic 4개 모델 운용에 따른 GPU 메모리와 추론 속도 최적화 필요
  • FSDP 샤딩, 저정밀 연산, PEFT, Flash Attention, key-value caching 활용 가능성

주의할 점

  • 리워드 모델의 취약점 악용에 따른 리워드 해킹·mode collapse 위험
  • 하이퍼파라미터 민감도와 과적합 문제, 강건한 리워드 모델 및 KL 제약의 중요성
  • 구현 복잡성과 불안정성을 보완하는 Best of N, RRHF, DPO 등의 대안 검토

다음 읽기

#LLM 주제를 이어서 읽기

RLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?

RLHF의 복잡성과 불안정성을 줄이기 위한 RRHF·SLiC-HF·DPO·Rejection Sampling을 비교했습니다. 실험에서는 Rejection Sampling과 DPO가 유용성·응답 안정성 측면에서 두드러졌습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...