목록 보기
강화학습으로 더 재미있는 게임 만들기
AI

강화학습으로 더 재미있는 게임 만들기

데브시스터즈
데브시스터즈
2021년 1월 18일

두줄요약

강화학습 퍼즐 봇으로 대규모 3매치 게임의 밸런싱 작업을 자동화했습니다.\nMock 환경과 PPO 모델을 활용해 업데이트 영향과 캐릭터 성능을 사전 정량화했습니다.

문제 상황

  • 1,500여 개 맵과 쿠키·버프·강화 조합의 수동 플레이 기반 밸런싱 부담
  • 랜덤 요소와 다양한 게임 모드로 맵 난이도·필요 턴수 예측의 어려움

해결 방법

  • 시행착오 기반 강화학습으로 3매치 퍼즐 플레이와 밸런싱 자동화
  • 고차원 행동 공간에 PPO 기반 Policy-Gradient 적용
  • ResNet 기반 시각 정보와 목표·쿠키·남은 턴 정보의 결합

구조와 흐름

  • Agent의 행동에 따라 Environment가 게임 상태와 보상을 갱신하는 학습 구조
  • 빠른 모델 실험용 Cython Mock 환경과 실제 밸런싱용 Unity 환경의 분리
  • 색상 순열 불변 특성과 행동별 변화 예상 위치 제공으로 탐색 공간 축소

성능/운영 포인트

  • Mock 환경에서 행동당 0.01초 이내 처리로 반나절 수준의 빠른 실험
  • 쿠키 성능, 강화 도입 후 난이도 변화, 재화 사용량·매출 영향의 사전 정량화
  • 잦은 후속 패치와 감각적 의사결정 감소를 위한 봇 플레이 결과 활용

다음 읽기

#강화학습 주제를 이어서 읽기

머신러닝 엔지니어가 퍼즐 게임을 더 재미있게 만드는 방법

퍼즐봇과 유저 행동 데이터를 바탕으로 퍼즐 스테이지의 품질을 수치화하는 지표를 설계했습니다.\n폴리싱 효율을 높이기 위해 총 미션 수 구간별 기준을 달리 적용하고 사내 테스트로 검증했습니다.

데브시스터즈
데브시스터즈
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...