#ope
노트 6개
- Anytime-Valid OPE Anytime-valid OPE는 임의의 정지 시점에서도 유효한(time-uniform) 오프폴리시 가치 신뢰 수열(confidence sequence)을 e-process 기반으로 제공하는 오프폴리시 평가(OPE) 방법이다.
- MDP (Markov Decision Process) 마르코프 결정 과정(Markov Decision Process, MDP)은 순차적 의사결정 문제를 다루는 수학적 프레임워크다. 어떤 상태(state)에서 행동(action)을 선택하면 다음 상태와 보상(reward)이 확률적으로 결정되며, 이런 상호작용이 시간에 걸쳐 반복되는 구조를 기술한다.
- Off-Policy Evaluation (OPE) 오프폴리시 평가(OPE)는 다른 행동 정책(behavior policy) $\pib$로 수집한 로그만으로 목표 정책(target policy) $\pie$의 가치 $V(\pie)=E{\pie}[\sum r]$를 추정하는 문제다.
- OPE 배포 게이트 플레이북 — 참값 없이 "믿는다/못 믿는다/A/B"를 판정하기 참값 V(π_e) 를 아무도 모르는 실무 조건에서, 추천 로그만으로 배포를 판정하는 OPE 게이트의 운영 규칙 — 진단 3종의 3-way 게이트, validity battery(필요조건 검사), Λ-감도 증명서, 비교형 우선 원칙, 그리고 관측 동등성이라는 원리적 한계까지. ope-to-decision 벤치마크의 플레이북 큐레이션.
- Policy Trees 정책 트리(policy tree)는 Athey & Wager (2021)가 제안한 해석 가능한 정책 학습(policy learning) 방법이다. 개인 수준의 처치효과(treatment effect) 추정값(estimate)을 입력으로 받아, 결정 트리 형태의 명시적 정책 규칙을 학습한다.
- RTB Bidding Strategy via Causal ML — From Prediction to Optimization A five-stage case study on the public iPinYou RTB dataset that moves from pCTR/pCVR prediction through causal effect estimation (CATE, SCM) to budget-constrained optimal bidding and off-policy policy evaluation.