#bandits
노트 3개
- Contextual Bandits Contextual Bandits는 맥락(context)에 따라 최적의 행동(arm)이 달라지는 다중 슬롯머신 문제다. 즉 매 라운드 관측되는 맥락에 맞춰 행동을 고르고, 그 행동의 보상(reward)만 피드백으로 받으며 정책을 학습한다.
- Multi-Armed Bandits multi-armed bandit은 $K$개의 arm 중 매 라운드 $t$에 하나의 arm $At$를 당겨 보상(reward)을 관측하는 순차적 의사결정 문제다. 목표는 누적 후회(cumulative regret)를 최소화하는 것이다.
- Thompson Sampling Thompson sampling은 보상에 대한 베이지안 사후 분포에서 표본을 뽑아 탐색(exploration)과 활용(exploitation)의 균형을 맞추는 bandit 알고리즘이다.