📄️ 강화학습
Reinforcement Learning
📄️ 여러대의 슬롯머신
Multi-armed Bandits
📄️ 마르코프 결정 과정
Markov Decision Process
📄️ 다이나믹 프로그래밍
Dynamic Programming
📄️ 몬테 카를로 방법
Monte Carlo Methods
📄️ 시간차 학습
Temporal-Difference Learning
📄️ n-단계 부트스트래핑
n-step Bootstrapping
📄️ 테이블 방법을 통한 계획과 학습
Planning and Learning with Tabular Methods
📄️ 근사를 통한 on-policy 예측
On-policy Prediction with Approximation
📄️ 근사를 통한 on-policy 제어
On-policy Control with Approximation
📄️ 적격자 추적
Eligibility Traces
📄️ 정책 기울기 방법들
Policy Gradient Methods