
AI
강화학습으로 더 재미있는 게임 만들기
두줄요약
강화학습 퍼즐 봇으로 대규모 3매치 게임의 밸런싱 작업을 자동화했습니다.\nMock 환경과 PPO 모델을 활용해 업데이트 영향과 캐릭터 성능을 사전 정량화했습니다.
문제 상황
- 1,500여 개 맵과 쿠키·버프·강화 조합의 수동 플레이 기반 밸런싱 부담
- 랜덤 요소와 다양한 게임 모드로 맵 난이도·필요 턴수 예측의 어려움
해결 방법
- 시행착오 기반 강화학습으로 3매치 퍼즐 플레이와 밸런싱 자동화
- 고차원 행동 공간에 PPO 기반 Policy-Gradient 적용
- ResNet 기반 시각 정보와 목표·쿠키·남은 턴 정보의 결합
구조와 흐름
- Agent의 행동에 따라 Environment가 게임 상태와 보상을 갱신하는 학습 구조
- 빠른 모델 실험용 Cython Mock 환경과 실제 밸런싱용 Unity 환경의 분리
- 색상 순열 불변 특성과 행동별 변화 예상 위치 제공으로 탐색 공간 축소
성능/운영 포인트
- Mock 환경에서 행동당 0.01초 이내 처리로 반나절 수준의 빠른 실험
- 쿠키 성능, 강화 도입 후 난이도 변화, 재화 사용량·매출 영향의 사전 정량화
- 잦은 후속 패치와 감각적 의사결정 감소를 위한 봇 플레이 결과 활용


