Tae Hyun Kim (Lowell)
← 모든 프로젝트
Decision-Making under UncertaintyCausal Inference

OPE → Decision — 참값 없이 배포를 판정하는 게이트

참값 $V(\pi_e)$ 를 아무도 모르는 실무 조건에서, 추천 로그만으로 "믿는다/못 믿는다/A/B로 보낸다"를 판정하는 OPE 배포 게이트를 만들고 — 그 신호의 예보력과 원리적 맹점까지 참값 보유 백스테이지에서 채점한 벤치마크.

2026 · 단독 · 엔드투엔드 (estimator 구현 → 21개 실험 축 → 배포 게이트 플레이북)
PythonNumPyscikit-learnobp (교차검증)Open Bandit Dataset

⏱️ TL;DR (30초)


validity battery detection matrix — 잡는 실패와 못 보는 빈칸 battery 가 잡는 것(misrecording·support 결핍 — 발화율 1.0)과 원리적으로 못 보는 빈칸(calibrated confounding — 검출 arm 발화 0 인데 실제 대오차율 0.55). 빈칸을 숨기지 않고 그대로 전시한다.

ZOZO 실로그 1-page decision card — reveal 없는 판정 실전 한 판: ZOZO OBD 실로그 위의 판정 카드. 추정+CI·진단·battery·Λ\Lambda-부채꼴·판정 — 전부 로그와 후보 분포만으로. 이 축에는 채점표(reveal)가 존재하지 않는다.

🎯 핵심 결과 한눈에

핵심 지표비고
실험 축21개 (합성 12 + 실데이터 3 + 감도 1 + GT-미상 본편 5)축 13은 probe NO-GO로 정직 drop
estimator 교차검증7종 × 2트랙 rel_diff ≤ 1e-8obp(py3.9)·sb-obp(py3.12) 적대 대조
게이트 예보력 (백스테이지)trust 대오차율 4.6% vs A/B 회귀 44.4%사전등록 임계·무튜닝 평가
결정 가치 (오염 로그)naive false-go 0.9 → 프로토콜 0.0나쁜 후보 포함 사다리·regret 0.21
관측 동등성 경계battery 발화 0/240 · bias −0.073 성장못 보는 것의 구성적 전시
실데이터 replicationnoised·support 검출 재현 + 예상 반증 1건c2b 4종 주입 — 반증도 그대로 등재
ZOZO 실로그 판정AB-FALLBACK · fragile (Λ\Lambda^* 1.34)harmonic 발화(기록 비정합 신호)
테스트100 greenblindness·oracle-ban·checksum 배리어 포함

수치 지위 — 이 페이지의 모든 수치는 repo 의 정본 수치 원장(docs/LEDGER.md)에 등재된 값의 축약 전사다. 원값·정밀도·생성 실험의 정본은 repo(figure ↔ CSV 1:1)이며, 게이트·battery 규칙은 본 레포의 제안(folklore 관행의 체계화 시도)이지 문헌 표준이 아니다.

🧩 두 무대 프레임워크 — frontstage / backstage

본편(frontstage)과 백스테이지(backstage) 구조도

실무자는 왼쪽(본편)만 가진다: 로그 층 → 게이트 + battery + Λ\Lambda^* → 판정·결정 — 참값 불필요. 왼쪽을 믿을 근거는 오른쪽(백스테이지)이 만든다: 참값 보유 무대(합성 DGP·전 라벨 c2b·근사 GT ZOZO)에서 본편 신호를 blind-then-reveal 로 채점했다. 그리고 둘을 가르는 선 — 관측 동등성 경계 — 이 본편의 모든 “통과” 판정에 면책으로 붙는다.

💡 핵심 발견 — 반직관 3건

1. 진단이 못 보는 실패는 실재하고, 실무에선 그 실패 자체가 보이지 않는다.

confounding blind spot — 진단은 평평, bias만 성장 confounding 강도가 커져도 기록-propensity 기반 ESS 는 평평(0.823→0.822)한데 bias 만 자란다 (0→−0.057). 실무에서 당신이 보는 것은 평평한 위 패널뿐이다 — 아래 패널(bias)은 참값을 아는 백스테이지에서만 보인다. 이 그림이 GT-미상 프로토콜 전체의 동기다.

2. battery 는 blind spot 을 줄이지만 없애지 못한다 — 그리고 그것은 증명 가능한 경계다. 기록 pscore 가 참 marginal 인 confounded 세계는 관측 분포가 무결한 세계와 완전히 동일하다 (관측 동등성). 실측: 이 세계에서 battery 전 arm 발화 0/240, bias 는 단조 성장. 유일하게 움직이는 로그-계산 신호는 Λ\Lambda^* 의 수축(1.31→1.05) — confounding 검출이 아니라 “결론이 이유를 모른 채 취약해진다” 는 보고다.

3. 사전등록 예상이 실데이터에서 반증됐다 — 그리고 그것이 replication 축의 존재 이유다. 합성에서 in-sample 추정 propensity 는 준-null(자동 보정 함정 — 비발화)이었지만, 실데이터(c2b)의 이중-softmax 정책 기하는 in-sample LR 로 복원되지 않아 전 데이터셋에서 E[w] 가 발화했다. 사전등록된 예상의 반증을 그대로 등재했다 — 예상 반증도 발견이다.

📊 결과 요약

본편(GT-미상) 트랙 — 로그만으로 계산·판정:

발견
실로그 게이트ZOZO 실로그 DISTRUST(ESS/n 0.034·max weight 278) — 근사 GT(±32% CI)가 판정을 뒷받침
감도 증명서순위 단정이 무너지는 breakdown Λ\Lambda^* 중앙값 ≈1.07/≈1.04 — 계산은 로그만 필요, Λ\Lambda 는 식별 불가 가정
detection matrixmisrecording·support 결핍 검출(전역 신호가 전멸한 곳까지 per-action harmonic 이 회수) · 소표본 오경보 0.275 정직 기록
경계 전시발화 0/240 · bias −0.073 · Λ\Lambda^* 수축 — “양쪽 다 비발화, bias 만 성장”
결정 가치naive false-go 0.9 vs 프로토콜 0.0 · 건강 로그에선 go 0.95/no-go 0.9 로 결정적(오류 0)
실전 카드AB-FALLBACK·fragile — reveal 파일이 없다는 사실 자체가 전시물
replicationc2b 4종 주입 — 검출 재현 + 예상 반증 1건 + over-caution(무해 주입에도 발화 — 유예 비용)

백스테이지 — 신호를 믿을 근거: 참값 보유 합성 12축에서 estimator regime 지도(DR-계열 교대 지배·소표본 진단 검정력 실종 — trust 인데 IPS MSE 가 승자의 70.6×인 셀), 게이트 예보력 4.6%/44.4%, DR 오지정 강건성 실데이터 4/4 재현, bootstrap CI 가 구조적 bias 를 못 잡는다는 실증(9/28 미커버)까지 — 전 수치가 단일 원장(LEDGER)을 경유한다.

⚠️ 한계와 교훈

한계내용
battery = 필요조건 검사통과는 무결의 증명이 아니다 — calibrated confounding 에 원리적 blind(관측 동등성). 모든 battery 주장에 이 면책이 붙는다
임계값은 제안·무튜닝게이트·battery 임계는 사전등록 후 평가만 했다 — 다른 도메인 이식은 재교정 없이 무근거
소표본 함정게이트 검정력은 소표본에서 실종되고, harmonic 은 소표본에서 오경보(0.275) — 양방향 함정
over-caution무해한 주입에도 battery 가 발화해 A/B 유예를 낳는다 — 안전의 비용은 유예로 지불된다
범위 밖confounding 교정 본류(proximal 등)·OPL·slate/RL OPE 는 다루지 않는다 — 경계에서 의도적으로 멈춘다

교훈

“참값 없는 세계에서 정직한 답은 세 가지뿐이다 — 잡을 수 있는 실패를 잡는 필요조건 검사, 잡을 수 없는 실패에 대한 감도 구간, 그리고 ‘모른다’(A/B 유예)를 출력할 용기.”


산출물