여러대의 슬롯머신
MAB
이 챕터에서는 하나 이상의 상황에서 행동하는 학습을 포함하지 않는 간단한 설정에서 강화학습의 평가적 면을 공부할 것입니다.
이 nonassociative 설정은 평가 피드백을 포함하는 선구적인 일로, 전체 강화학습의 복잡성을 피해 이루어집니다. 특정한 nonassociative 평가 피드백 문제인, 간단한 k-armed bandit 문제 버전으로 탐색합니다.
슬롯머신을 one-armed bandit(외팔도둑)이라고 표현합니다. 왜 슬롯머신을 외팔도둑이라고 부를까요? 슬롯 머신 게임은 사용자의 주머니와 지갑을 도둑처럼 비울 수 있는 능력을 지녔음을 암시합니다.(옥스퍼드 영단어사전)
k개의 슬롯머신 문제
아래 학습하는 문제를 고려합시다.
당신 은 반복적으로 k개의 다른 옵션이나 행동을 고르는 일을 마주했습니다. 당신은 각 선택마다 당신이 선택한 행동에 따라 정해진 확률분포로부터 선택된 숫자 보상을 받습니다. 당신의 목표는 일정 기간(1000번 행동 선택 또는 시간 단계)동안 전체 보상을 최대화 하는 것입니다.
이것이 k개의 슬롯머신 문제의 기본 형태입니다.
표기법 정리
$k$ 동작의 횟수(arms)
$t$ 이산적인 시간 단계 또는 수행 횟수
$q_(a)$ 동작 a를 했을때, 참 가치 (예상하는 보상)
$Q_t(a)$ 시간 t일때 예상 $q_(a)$
$\pi_t(a)$ 시간 t에서 동작 a를 선책할 확률
$\bar{R_t}$ 시간 t에서 주어진 $\pi_t$일때 예상 보상
번역 표
평가적: evaluative 행동: action 가치: value 지침: instruct 분류: classification 식별: identification 시간단계: time steps
