목록 보기
VPT: 다이아몬드 곡괭이를 만들기 위한 여정
AI

VPT: 다이아몬드 곡괭이를 만들기 위한 여정

스캐터랩 핑퐁
스캐터랩 핑퐁
2022년 8월 17일

두줄요약

OpenAI VPT의 마인크래프트 다이아몬드 곡괭이 제작 학습 과정을 리뷰했습니다. 영상에서 추정한 행동 데이터와 사전학습·미세조정·강화학습의 결합을 설명합니다.

문제 상황

  • 마인크래프트에서 다이아몬드 곡괭이 제작을 위한 긴 선행 작업과 희소한 목표 보상
  • 입력 기록 없는 온라인 영상, 플레이 방식의 다양성, 순차 작업 학습 중 Catastrophic Forgetting

해결 방법

  • 2천 시간의 화면·입력 리플레이로 미래 화면까지 참조하는 Inverse Dynamic Model 학습
  • CLIP 기반 SVM 필터링과 IDM 추론으로 7만 시간 규모의 영상 기반 리플레이 구축
  • 대규모 행동 모방 사전학습 뒤 Behavioral Cloning과 보상 설계 기반 강화 학습 적용

구조와 흐름

  • VPT 사전학습으로 채집·제작·전투·기둥 점프 등 게임 기본기 습득
  • 초기 게임 데이터셋 미세조정으로 나무·돌 도구 제작 능력 강화
  • 상위 아이템 중심 보상과 KL-divergence 손실로 기존 행동 보존 및 제작 단계 학습

성능/운영 포인트

  • 720개 V100에서 9일간 VPT 사전학습, 약 130만 에피소드의 강화 학습
  • 248M 모델의 10분 내 다이아몬드 곡괭이 제작 성공 확률 2.5%
  • 자동 구축 데이터셋의 대량·저비용 확보와 고품질 데이터셋 병행 활용

다음 읽기

같은 회사의 연관 글

ACL 2022 Review

ACL 2022의 NLP 연구 12편을 프롬프트, 문장 표현, 대화, 멀티모달 평가 관점에서 리뷰했습니다. 대조 학습과 평가 체계 개선 등 주요 제안과 실험 결과를 정리했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...