Tae Hyun Kim (Lowell)

Decision-Making Overview

1분 읽기 #decision-making

불확실성하 (순차) 의사결정 방법론을 모은 허브 노트다. bandit·RL·오프폴리시 평가(OPE)·DTR/OTR을 다루며, 기존 4개 노트(Contextual Bandits·MDP·Thompson Sampling·Policy Trees)를 Roadmap Track 2/3로 확장한다.

개요

불확실성하 (순차) 의사결정은 bandit 후회(regret)부터 RL, 오프폴리시 평가(OPE), 동적·최적 처치 요법(DTR/OTR)까지를 아우르는 방법론이다. 임상(DTR/OTR)과 산업(타겟팅·bidding) 개인화(personalization)를 모두 받친다.

목표 atomic 노트

생성됨 ✓ (bandits/RL): Contextual Bandits · MDP · Thompson Sampling · Policy Trees · Policy Learning · Multi-Armed Bandits · UCB · Regret · Offline RL 생성됨 ✓ (OPE): Off-Policy Evaluation · Doubly Robust OPE · Empirical Welfare Maximization 생성됨 ✓ (DTR/OTR): Dynamic Treatment Regimes · Q-learning · A-learning · G-estimation · Outcome-Weighted Learning

참고

  • Study Roadmap §Track 2 (Lattimore & Szepesvári) · §Track 3 (OPE 계보)
  • MOC-DecisionMaking

연결 그래프