오프라인 강화학습 기반 모바일 게임 동적 난이도 조절 연구
Dynamic Difficulty Adjustment in Mobile Games based on Offline Reinforcement Learning
- 주제(키워드) 오프라인 강화학습 , 동적 난이도 조절 , 모바일 게임 , 이중 강건 평가 , 암묵적 Q-러닝 , Offline Reinforcement Learning , Dynamic Difficulty Adjustment , Mobile Games , Doubly Robust Evaluation , Implicit Q-Learning
- 발행기관 서강대학교 AI.SW대학원
- 지도교수 김승욱
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 AI.SW대학원 데이터사이언스 · 인공지능
- 세부분야 디지털-AI
- 실제URI http://www.dcollection.net/handler/sogang/000000083440
- UCI I804:11029-000000083440
- 본문언어 한국어
- 저작권 논문은 저작권에 의해 보호받습니다.
목차
제 1 장 서론 1
제 1 절 연구 배경 1
제 2 절 연구 목적 4
제 3 절 논문 구성 5
제 2 장 이론적 배경 및 선행연구 6
제 1 절 강화학습의 이론적 기초 6
제 2 절 강화학습 방법론 유형 8
제 3 절 온라인 강화학습과 오프라인 강화학습 9
제 4 절 온폴리시 및 오프폴리시 정책 평가 10
제 5 절 기존 연구의 한계 및 본 논문의 차별성 11
제 3 장 연구 설계 및 방법론 14
제 1 절 게임 구조·데이터 구성 및 밸런스 파라미터 분석 14
(1) 게임 구조 14
(2) 분석 데이터 구성 15
(3) 주요 밸런스 파라미터 및 분석 대상 선정 17
(4) 조절 간격 변수와 클리어율 간의 관계 분석 18
(5) 스테이지 그룹별 난이도 조정 효과 산출 21
제 2 절 마르코프 결정 과정(MDP) 정의 23
(1) 상태 공간 (State Space, S) 23
(2) 행동 공간 (Action Space, A) 24
(3) 보상 함수 (Reward Function, R) 26
제 3 절 오프라인 강화학습 기반 정책 학습 27
(1) 알고리즘 개요 27
(2) 심층 신경망 구조 28
(3) 학습 과정 및 하이퍼파라미터 29
제 4 절 정책 평가 방법론 31
(1) 몬테카를로 시뮬레이션 기반 정책 평가 32
(2) 이중 강건 추정량 기반 오프폴리시 정책 평가 33
(3) 통합 평가 구조 33
제 4 장 실험 분석 결과 35
제 1 절 탐색적 데이터 분석 35
(1) 데이터 개요 35
(2) 상태 공간 탐색 35
(3) 보상 함수 구성 37
제 2 절 강화학습 모델 학습 결과 37
(1) 오프라인 데이터셋 구성 37
(2) 학습 결과 38
제 3 절 정책 평가 및 비교 39
(1) 몬테카를로 시뮬레이션 39
(2) Off-Policy Evaluation (Doubly Robust) 42
(3) 사후 검증 44
제 5 장 결론 47
참고 문헌 49

