Tae Hyun Kim (Lowell)

Doubly Robust Estimator

정의

Doubly Robust (DR) Estimator는 결과 회귀(outcome regression)와 성향점수(propensity score) 모델을 결합한 추정량(estimator)으로, 두 모델 중 하나만 올바르게 설정(specified)되어도 일치성(consistency)을 갖는다.

ATE에 대한 DR Estimator: τ^DR=1ni=1nφ^(Zi)\hat{\tau}_{DR} = \frac{1}{n}\sum_{i=1}^n \hat{\varphi}(Z_i)

여기서 pseudo-outcome은 효율적 영향함수(EIF)다: φ^(Z)=μ^1(X)μ^0(X)outcome regression+A(Yμ^1(X))π^(X)(1A)(Yμ^0(X))1π^(X)IPW augmentation\hat{\varphi}(Z) = \underbrace{\hat{\mu}_1(X) - \hat{\mu}_0(X)}_{\text{outcome regression}} + \underbrace{\frac{A(Y - \hat{\mu}_1(X))}{\hat{\pi}(X)} - \frac{(1-A)(Y - \hat{\mu}_0(X))}{1-\hat{\pi}(X)}}_{\text{IPW augmentation}}

또는 동치 형태로도 쓸 수 있다: φ^(Z)=μ^1(X)μ^0(X)+Aπ^(X)π^(X)(1π^(X))(YAμ^1(X)(1A)μ^0(X))\hat{\varphi}(Z) = \hat{\mu}_1(X) - \hat{\mu}_0(X) + \frac{A - \hat{\pi}(X)}{\hat{\pi}(X)(1-\hat{\pi}(X))}(Y - A\hat{\mu}_1(X) - (1-A)\hat{\mu}_0(X))

직관적 이해

세 가지 추정 전략의 결합:

  1. 결과 회귀 (OR): τ^OR=1ni[μ^1(Xi)μ^0(Xi)]\hat{\tau}_{OR} = \frac{1}{n}\sum_i [\hat{\mu}_1(X_i) - \hat{\mu}_0(X_i)]
  2. 역성향 가중 (IPW): τ^IPW=1niAiYiπ^(Xi)(1Ai)Yi1π^(Xi)\hat{\tau}_{IPW} = \frac{1}{n}\sum_i \frac{A_i Y_i}{\hat{\pi}(X_i)} - \frac{(1-A_i)Y_i}{1-\hat{\pi}(X_i)}
  3. 이중 강건 (DR): OR에 IPW 보정항(correction term)을 더한 형태
OR만 사용:      μ̂ 틀리면 biased
IPW만 사용:     π̂ 틀리면 biased
DR 사용:        μ̂ OR π̂ 중 하나만 맞아도 consistent!

왜 “Doubly Robust”인가?

  • μ^=μ0\hat{\mu} = \mu_0 (결과 모델이 맞을 때): augmentation 항의 기댓값이 0이 된다.
  • π^=π0\hat{\pi} = \pi_0 (성향 모델이 맞을 때): 가중이 정확해 편향(bias)이 상쇄된다.
  • 둘 다 틀려도 편향이 두 오차의 곱에 비례한다: O(μ^μ0π^π0)O(||\hat{\mu} - \mu_0|| \cdot ||\hat{\pi} - \pi_0||)

핵심 성질

이중 강건성 (Double Robustness)

정리: 다음 두 조건 중 하나만 성립해도 τ^DR\hat{\tau}_{DR}는 일치성을 갖는다.

  1. 결과 모델이 올바르게 설정된 경우: μ^a(x)pE[YX=x,A=a]\hat{\mu}_a(x) \xrightarrow{p} E[Y|X=x, A=a]
  2. 성향 모델이 올바르게 설정된 경우: π^(x)pP(A=1X=x)\hat{\pi}(x) \xrightarrow{p} P(A=1|X=x)

준모수 효율성 (Semiparametric Efficiency)

DR 추정량은 **준모수적으로 효율적(semiparametrically efficient)**이다. 효율적 영향함수를 기반으로 구성되어 준모수 효율성 한계(semiparametric efficiency bound)를 달성하며, 가장 낮은 점근 분산(asymptotic variance)을 갖는다.

Var(τ^DR)=1nE[φ(Z;τ0,η0)2]+o(n1)\text{Var}(\hat{\tau}_{DR}) = \frac{1}{n}E[\varphi(Z; \tau_0, \eta_0)^2] + o(n^{-1})

속도 이중 강건성 (Rate Double Robustness)

곱 속도 조건(product rate condition)에서 n\sqrt{n}-일치성을 갖는다: μ^μ0π^π0=oP(n1/2)||\hat{\mu} - \mu_0|| \cdot ||\hat{\pi} - \pi_0|| = o_P(n^{-1/2})

예를 들어 각 모델이 n1/4n^{-1/4} 속도(rate)면 충분하다.

수학적 유도

효율적 영향함수

ATE τ=E[Y(1)Y(0)]\tau = E[Y(1) - Y(0)]의 효율적 영향함수는 다음과 같다: φ(Z;τ,η)=μ1(X)μ0(X)τ+A(Yμ1(X))π(X)(1A)(Yμ0(X))1π(X)\varphi(Z; \tau, \eta) = \mu_1(X) - \mu_0(X) - \tau + \frac{A(Y - \mu_1(X))}{\pi(X)} - \frac{(1-A)(Y - \mu_0(X))}{1 - \pi(X)}

성질:

  • E[φ(Z;τ0,η0)]=0E[\varphi(Z; \tau_0, \eta_0)] = 0
  • E[φ(Z;τ0,η0)2]=E[\varphi(Z; \tau_0, \eta_0)^2] = 준모수 분산 한계
  • Neyman 직교성(Neyman orthogonal): ηE[φ]η0=0\partial_\eta E[\varphi]|_{\eta_0} = 0

편향 분석

E[τ^DR]τ0=E[(π^π0)(μ^1μ1)π^(π^π0)(μ^0μ0)1π^]E[\hat{\tau}_{DR}] - \tau_0 = E\left[\frac{(\hat{\pi} - \pi_0)(\hat{\mu}_1 - \mu_1)}{\hat{\pi}} - \frac{(\hat{\pi} - \pi_0)(\hat{\mu}_0 - \mu_0)}{1-\hat{\pi}}\right]

이처럼 편향이 두 오차의 곱(product of errors) 형태로 나타난다.

비교: OR vs IPW vs DR

AspectOutcome RegressionIPWDoubly Robust
Model neededμa(x)\mu_a(x)π(x)\pi(x)Both
ConsistencyIf μ^\hat{\mu} correctIf π^\hat{\pi} correctIf either correct
EfficiencyNot efficientNot efficientSemiparametrically efficient
VarianceLow if μ^\hat{\mu} goodHigh with extreme π^\hat{\pi}Best of both
With MLRegularization biasVariance issuesRobust to both

확장

CATE 추정

DR-Learner는 DR pseudo-outcome을 XX에 대해 회귀한다. τ^(x)=En[φ^(Z)X=x]\hat{\tau}(x) = E_n[\hat{\varphi}(Z) | X = x]

ATT 추정

τ^ATT=1n1i:Ai=1[Yiμ^0(Xi)(1Ai)π^(Xi)Ai(1π^(Xi))(Yiμ^0(Xi))]\hat{\tau}_{ATT} = \frac{1}{n_1}\sum_{i: A_i=1}\left[Y_i - \hat{\mu}_0(X_i) - \frac{(1-A_i)\hat{\pi}(X_i)}{A_i(1-\hat{\pi}(X_i))}(Y_i - \hat{\mu}_0(X_i))\right]

종단 설정 (Longitudinal Settings)

시변 처치(time-varying treatment)에 적용하며, g-computation과 결합한다.

관련 개념

  • Pseudo-outcome - DR 추정량의 핵심 구성요소
  • DR-Learner - CATE를 위한 DR 확장
  • Influence Function - DR의 이론적 기반
  • Neyman-Orthogonal Score - 직교성(orthogonality) 성질
  • Propensity Score - 처치 배정 확률
  • Double-Debiased ML - 관련 프레임워크

역사적 배경

  • Robins, Rotnitzky, Zhao (1994): 최초의 이중 강건 추정량.
  • Bang & Robins (2005): “Doubly Robust Estimation”이라는 이름이 여기서 붙었다.
  • Scharfstein, Rotnitzky, Robins (1999): 준모수 이론과의 연결을 보였다.
  • Chernozhukov et al. (2018): ML과 결합한 DML로 이어진다.

구현

Python (econml):

from econml.dr import LinearDRLearner
dr = LinearDRLearner()
dr.fit(Y, T, X=X, W=W)
ate = dr.ate(X)

R (AIPW package):

library(AIPW)
AIPW_SL <- AIPW$new(Y = Y, A = A, W = W,
                    Q.SL.library = c("SL.glm", "SL.ranger"),
                    g.SL.library = c("SL.glm", "SL.ranger"))
AIPW_SL$fit()
AIPW_SL$summary()

참고 문헌

  • Robins, Rotnitzky, Zhao (1994) - Original DR estimator
  • kennedyOptimalDoublyRobust2023 - Optimal DR for CATE
  • chernozhukovDoubleDebiasedMachine2018 - DML framework
  • Bang & Robins (2005) - “Doubly Robust Estimation in Missing Data and Causal Inference Models”

연결 그래프