Off-Policy Evaluation (OPE)
정의
오프폴리시 평가(OPE)는 다른 행동 정책(behavior policy) 로 수집한 로그만으로 목표 정책(target policy) 의 가치 를 추정하는 문제다.
- Direct Method (DM): 모델 기반 plug-in 추정량으로, 편향과 분산이 모두 작지만 모델을 잘못 설정하면 취약하다.
- IPS/IS: 로, 무편향이지만 분산이 크다.
- Doubly Robust (DR): DM에 IPS 보정을 더해 두 모델 중 하나만 맞아도 일치성을 갖는다 (Dudík et al.).
- 분산 제어에는 SWITCH·clipping을, RL 확장에는 per-decision IS·MAGIC·DRL을 쓴다.
직관적 이해
“옛 정책 로그만으로 새 정책이 벌었을 값은?”이라는 질문에 답하는 셈이다. 정책 중첩(policy overlap, positivity)이 편향과 분산의 균형을 좌우한다.
관련 개념
- Policy Learning · Doubly Robust Estimator · IPW · Multi-Armed Bandits · Contextual Bandits
- e-process — anytime-valid OPE
참고 논문
- Dudík, Erhan, Langford & Li, “Doubly Robust Policy Evaluation and Optimization”, Statistical Science 29(4):485–511, 2014
- Uehara, Shi & Kallus, “A Review of Off-Policy Evaluation in RL”, Statistical Science (in press), 2025