VPT: 다이아몬드 곡괭이를 만들기 위한 여정
두줄요약
OpenAI VPT의 마인크래프트 다이아몬드 곡괭이 제작 학습 과정을 리뷰했습니다. 영상에서 추정한 행동 데이터와 사전학습·미세조정·강화학습의 결합을 설명합니다.
문제 상황
- 마인크래프트에서 다이아몬드 곡괭이 제작을 위한 긴 선행 작업과 희소한 목표 보상
- 입력 기록 없는 온라인 영상, 플레이 방식의 다양성, 순차 작업 학습 중 Catastrophic Forgetting
해결 방법
- 2천 시간의 화면·입력 리플레이로 미래 화면까지 참조하는 Inverse Dynamic Model 학습
- CLIP 기반 SVM 필터링과 IDM 추론으로 7만 시간 규모의 영상 기반 리플레이 구축
- 대규모 행동 모방 사전학습 뒤 Behavioral Cloning과 보상 설계 기반 강화 학습 적용
구조와 흐름
- VPT 사전학습으로 채집·제작·전투·기둥 점프 등 게임 기본기 습득
- 초기 게임 데이터셋 미세조정으로 나무·돌 도구 제작 능력 강화
- 상위 아이템 중심 보상과 KL-divergence 손실로 기존 행동 보존 및 제작 단계 학습
성능/운영 포인트
- 720개 V100에서 9일간 VPT 사전학습, 약 130만 에피소드의 강화 학습
- 248M 모델의 10분 내 다이아몬드 곡괭이 제작 성공 확률 2.5%
- 자동 구축 데이터셋의 대량·저비용 확보와 고품질 데이터셋 병행 활용

