Causal Inference
CATE · counterfactual · causal discovery · SCM · semiparametric · partial ID
무엇이 무엇을 일으키는가 — heterogeneous treatment effects와 counterfactual을, structural causal models·semiparametric estimation·unobserved confounding 하 sensitivity/partial identification으로 식별한다.
노트 51개
-
Dunnhumby — Track 2: Causal Targeting via Heterogeneous Treatment Effects
심각한 positivity violation(PS AUC 0.989) 아래에서 Meta-learner·Causal Forest로 CATE를 추정한다. 최적 정책은 고객의 약 31%를 타겟팅하고, 반직관적인 음의 CATE 세그먼트를 드러낸다. 공개 데이터 기반의 가설 생성용 분석이다.
-
Applied Causal Inference for Pricing — CATE & SCM Across Public Datasets
An applied case study using only public datasets (LendingClub, iPinYou) that combines CATE estimation for price-sensitivity heterogeneity with SCM-based moderator analysis to design individual-level, risk-based pricing and RTB bidding policies — all findings illustrative and projected, not proprietary.
-
Causal Inference Under Partial Identification — Sensitivity and Evidence Hierarchies
When real-world data fail strong ignorability, point identification gives way to bounds, proxies, and sensitivity analysis — an honest hierarchy of evidence that connects credible causal claims to semiparametric efficiency.
-
From Estimation to Action — How HTE Drives Personalized Policy Across Domains
One methodological spine — estimate heterogeneous treatment effects and turn them into individual-level policies — powers both clinical sequential treatment decisions and industrial targeting, pricing, and recommendation.
-
Marketing Attribution at Scale — From Simulation to Causal Inference
A case study comparing 10+ multi-touch attribution methods against a known-ground-truth simulator, then scaling them on the public Criteo dataset, closing the loop with budget off-policy evaluation for channel allocation.
-
Anytime-Valid Inference Overview
Anytime-valid 추론은 고정 표본 가설검정의 "peeking" 문제를 푸는 game-theoretic statistics다. 식별-타당성 drift를 실시간으로 모니터링하는 안전 추론의 수학적 기초를 제공한다.
-
Efficient Influence Function
효율적 영향함수(EIF)는 (준)모수 모형의 regular asymptotically linear(RAL) 추정량(estimator)이 갖는 영향함수(influence function, IF) 가운데 분산(variance)이 가장 작은 것이다. 그 분산은 모든 parametric submodel의…
-
Influence Function
함수형 모수 $\psi:\mathcal{P}\to\mathbb{R}$의 추정량 $\hat\psi$이 점근적으로 선형(asymptotically linear)이면, 다음을 만족하는 영향함수(influence function, IF) $\phi$가 존재한다.
-
Negative Control Outcome (NCO)
NCO는 처치(treatment)의 인과적 영향을 받지 않는다고 사전에 보장되지만 같은 교란(confounding) $U$의 그림자를 받는 결과변수다. 이와 대조적으로 NCE(negative control exposure)는 결과에 인과효과가 없는 노출이다. NCO의 "겉보기 효과"가 0이 아니면 비관측 교란이…
-
One-step Estimator
일단계 추정량(one-step estimator)은 플러그-인(plug-in) 추정값 $\psi(\hat P)$에 추정된 EIF의 경험평균을 더해 1차 편향(bias)을 교정한 추정량이다.
-
Partial Identification
부분식별(partial identification)은 가정이 부족해 점식별(point identification)이 불가능할 때, 모수가 데이터와 가정에 양립하는 identified set $\ThetaI$(흔히 구간 $[\thetaL,\thetaU]$)에만 속한다는 사실을 활용하는 접근이다. 출발점은…
-
Proximal Causal Inference
Proximal causal inference는 비관측 교란(unmeasured confounding) $U$가 있을 때 두 종류의 대리변수(proxy)를 써서 인과효과를 식별하는 방법이다. 두 proxy는 다음과 같다.
-
TMLE (Targeted Maximum Likelihood Estimation)
TMLE는 plug-in 추정량을 표적 모수 방향으로 보정(targeting) 하는 절차다. 단계는 다음과 같다.
-
ESCM² (Entire Space Counterfactual Multi-Task Model)
ESCM²는 ESMM의 두 가지 이론적 한계 — Inherent Estimation Bias (IEB)와 Potential Independence Priority (PIP) — 를 해결하려고, Inverse Propensity Score (IPS)와 Doubly Robust Estimator 기반의 반사실 위험…
-
AIPW (Augmented Inverse Probability Weighting)
AIPW는 결과회귀(outcome regression)와 역성향 가중(IPW)을 결합해 평균 처치효과(ATE)를 추정하는 이중 강건(doubly robust) 추정량이다.
-
ATT (Average Treatment Effect on the Treated)
ATT는 실제로 처치(treatment)를 받은 집단에 한정한 평균 처치효과(treatment effect)다.
-
Back-door Criterion
back-door 기준(back-door criterion, Pearl 1993)은 관찰 데이터(observational data)에서 인과효과(causal effect)를 식별(identification)할 수 있는지 판단하는 그래프 기준이다. 즉 변수 집합 $Z$가 $X \rightarrow Y$의 인과효과를…
-
BART (Bayesian Additive Regression Trees)
BART는 여러 트리의 합으로 결과를 모델링하는 Bayesian 앙상블 방법이다.
-
CATE (Conditional Average Treatment Effect)
CATE는 공변량(covariate) $X=x$가 주어졌을 때의 평균 처치효과(treatment effect)를 가리킨다.
-
Causal Forest
Causal Forest는 Athey, Tibshirani, Wager (2019)가 제안한 일반화 랜덤 포레스트(GRF)를 인과추론에 응용한 방법으로, 처치효과(treatment effect)의 이질성이 최대가 되도록 데이터를 분할한다.
-
CEVAE (Causal Effect Variational Autoencoder)
CEVAE는 변분 오토인코더(VAE)로 잠재 교란변수(latent confounder)를 추론한 뒤, 그 잠재변수를 조건으로 인과 효과(causal effect)를 추정하는 방법이다. Louizos et al. (2017)이 제안했다.
-
CFR (Counterfactual Regression)
CFR은 IPM(Integral Probability Metric) 정규화로 처치군과 대조군의 표현(representation) 분포를 맞춰, 균형 잡힌 표현을 학습하는 딥러닝 방법이다.
-
Collider
collider는 처치(treatment) X와 결과(outcome) Y 양쪽 모두로부터 영향을 받는 변수, 즉 공통 효과(common effect)다. X → C ← Y 구조에서 C가 collider에 해당한다.
-
Confounder
교란변수(confounder)는 처치(treatment) $X$와 결과(outcome) $Y$ 양쪽 모두에 영향을 주는 공통 원인(common cause)이며, 이 때문에 $X$와 $Y$ 사이에 인과가 아닌 허위 연관(spurious association)이 생긴다.
-
Constraint-Based Methods Overview
Constraint-based methods는 데이터에서 조건부 독립(conditional independence, CI) 관계를 검정해 인과 그래프를 복원하는 방법이다. Faithfulness 가정이 성립할 때 CI 관계와 d-separation이 일대일로 대응한다는 성질을 활용한다.
-
d-separation
d-separation(directional separation)은 DAG에서 두 변수 집합이 세 번째 집합으로 조건부 독립인지를 그래프 구조만으로 판정하는 기준(graphical criterion)이다.
-
DAG (Directed Acyclic Graph)
DAG는 변수 사이의 인과 관계(causal relationship)를 화살표로 표현하는 비순환 방향 그래프다. 인과추론(causal inference)에서 교란(confounding) 구조를 파악하고 식별 전략(identification strategy)을 결정하는 핵심 도구다.
-
do-operator
do-연산자(do-operator)는 개입(intervention)을 형식화하려고 Pearl이 제안한 연산자다.
-
Double/Debiased Machine Learning (DML)
DML은 고차원(high-dimensional) nuisance parameter $\eta0$가 있을 때도 저차원 관심 모수 $\theta0$를 유효하게 추정·추론하는 방법이다.
-
Doubly Robust Estimator
Doubly Robust (DR) Estimator는 결과 회귀(outcome regression)와 성향점수(propensity score) 모델을 결합한 추정량(estimator)으로, 두 모델 중 하나만 올바르게 설정(specified)되어도 일치성(consistency)을 갖는다.
-
DR-Learner
DR-Learner는 의사결과(pseudo-outcome)를 공변량(covariate)에 회귀시켜 CATE를 추정하는 2단계 이중 강건(doubly robust) 추정량(estimator)이다.
-
Endogeneity
내생성(endogeneity)은 설명 변수가 오차항과 상관될 때 발생하는 문제다.
-
Fundamental Problem of Causal Inference
인과추론의 근본 문제는 같은 개인에서 처치(treatment, $W=1$)를 받은 결과와 받지 않은 결과($W=0$)를 동시에 관측할 수 없다는 것이다.
-
HTE (Heterogeneous Treatment Effects)
이질적 처치효과(HTE)는 처치효과(treatment effect)가 개인의 특성에 따라 달라지는 현상을 가리킨다.
-
Instrumental Variables
도구변수(Instrumental Variables, IV)는 내생성(endogeneity) 문제를 풀기 위해 끌어오는 외생 변수다. 처치를 직접 무작위화할 수 없을 때, 처치에는 영향을 주되 결과에는 직접 영향을 주지 않는 외부 변동을 이용해 인과효과를 식별(identification)한다.
-
IPW (Inverse Propensity Weighting)
IPW는 성향점수(propensity score)의 역수를 가중치로 써서 처치효과(treatment effect)를 추정하는 방법이다.
-
ITE (Individual Treatment Effect)
ITE는 개인 한 명에게 처치가 미치는 인과 효과로, 그 개인의 처치 시 결과와 미처치 시 결과의 차이로 정의한다. 두 잠재결과 중 하나만 관측되는 근본 문제 때문에 직접 측정할 수 없어, 보통 CATE 추정·대치·딥러닝으로 근사한다.
-
Mediator
매개변수(mediator) M은 처치(treatment) X가 결과(outcome) Y에 영향을 주는 인과 경로(causal pathway) 위에 놓인 중간 변수다. 즉 X → M → Y 구조에서 M이 매개변수다.
-
Meta-learners
Meta-learner는 임의의 지도학습(supervised learning) 회귀기, 즉 기저 학습기(base learner)를 조합해 CATE를 추정하는 알고리즘을 통칭한다.
-
Positivity (Overlap)
Positivity(중첩, overlap)는 모든 공변량(covariate) 값에서 각 처치(treatment)를 받을 확률이 0과 1 사이에 있어야 한다는 가정이다.
-
Propensity Score Matching (PSM)
성향점수 매칭(propensity score matching, PSM)은 성향점수(propensity score)가 비슷한 처치군과 대조군 개인을 짝지어 처치효과(treatment effect)를 추정하는 매칭(matching) 방법이다.
-
R-Learner
R-Learner(Residualized Learner)는 Robinson Transformation을 토대로, 결과와 처치(treatment)에서 각각 공변량(covariate)의 영향을 걷어낸 잔차(residual)를 써서 CATE를 추정하는 메타러너(meta-learner)다.
-
Representation Learning Overview
표현 학습(representation learning)은 처치(treatment)와 독립적이면서도 결과 예측에 유용한 표현을 학습하는 방법이다.
-
S-Learner
S-Learner(Single Learner)는 처치 지시변수(treatment indicator)를 하나의 특성(feature)으로 포함한 단일 모델로 반응함수(response function)를 추정한 뒤 CATE를 계산하는 Meta-learners다.
-
SCM (Structural Causal Model)
SCM은 변수 사이의 인과 관계를 수학적으로 표현하는 틀(framework)이다. Pearl의 인과추론(causal inference) 체계에서 핵심을 이룬다.
-
Score-Based Methods Overview
점수 기반 방법(score-based methods)은 각 그래프에 점수 함수(score function)를 부여하고, 데이터에 가장 잘 맞는 그래프를 탐색하는 인과 발견 접근법이다. 제약 기반 방법(constraint-based)이 조건부 독립성 검정(CI test)을 반복하는 것과 달리, 점수 기반 방법은 모델…
-
Strong Ignorability
강한 무시가능성(strong ignorability)은 Ignorability와 Positivity 두 가정을 함께 묶은 조건이다.
-
SUTVA (Stable Unit Treatment Value Assumption)
SUTVA는 한 단위의 잠재결과(potential outcome)가 다른 단위의 처치(treatment) 할당에 영향받지 않고, 각 처치 수준마다 단일한 버전만 존재한다고 요구하는 가정이다.
-
T-Learner
T-Learner(Two Learner)는 처치군(treatment group)과 대조군(control group)에 대해 별도의 모델을 따로 학습해 CATE를 추정하는 Meta-learners다.
-
Treatment Effects Overview
잠재결과(potential outcome) 프레임워크에서 추정 대상(estimand)이 되는 처치효과(treatment effect)를 체계적으로 정리한다. 처치효과는 정의되는 수준에 따라 개인(ITE)·모집단(ATE·ATT·ATC)·조건부(CATE·HTE)로 나뉜다.
-
X-Learner
X-Learner는 대치된 처치효과(imputed treatment effect)를 활용하는 3단계 알고리즘으로, 그룹 간 불균형과 CATE의 구조적 특성을 효과적으로 이용하는 Meta-learners의 한 방법이다.