SCM (Structural Causal Model)
정의
SCM은 변수 사이의 인과 관계를 수학적으로 표현하는 틀(framework)이다. Pearl의 인과추론(causal inference) 체계에서 핵심을 이룬다.
형식적 정의:
| Component | Meaning |
|---|---|
| Endogenous variables (관측 가능한 변수들) | |
| Exogenous variables (관측 불가, ) | |
| Structural equations: | |
| Distribution over exogenous: |
구조방정식(structural equation):
각 변수는 부모 변수와 외생적 잡음(noise)으로 결정된다.
예시
Causal Graph G: SCM M:
X V = {X, Y, Z}
↓ U = {U_X, U_Y, U_Z}
Y
↓ F = { X := U_X,
Z Y := f(X) + U_Y,
Z := g(Y) + U_Z }
P = { U_X ~ N(0,1),
U_Y ~ N(0,1),
U_Z ~ N(0,1) }
결합분포(joint distribution) — 마르코프 분해(Markov factorization):
SCM과 DAG 비교
| Aspect | DAG | SCM |
|---|---|---|
| 표현 | Qualitative (화살표 유무) | Quantitative (함수 형태) |
| 정보량 | 인과 방향만 | 인과 방향 + 함수 관계 |
| 용도 | Identification | Identification + Estimation |
| Intervention | 개념적 표현 | 수학적 조작 가능 |
인과 간선 가정 (causal edge assumption)
각 변수의 값은 부모 변수로 완전히 결정된다.
의미:
- 인과 충분성(causal sufficiency): 모든 공통 원인이 관측된다.
- 이상적인 경우 측정되지 않은 교란변수(confounder)가 없다.
개입 (do-operator)
정의
는 변수 를 값 로 강제 설정한다는 뜻이다.
수학적 조작:
- 의 구조방정식을 로 대체한다.
- 나머지 방정식은 유지한다.
예시
Original SCM:
X := U_X
Y := 2X + U_Y
Z := Y + U_Z
After :
X := 3 ← Changed!
Y := 2X + U_Y ← Uses X = 3
Z := Y + U_Z
개입 분포와 관측 분포
- 관측(observational): 관측된 조건부 분포로, 교란(confounding)을 포함한다.
- 개입(interventional): 인과적 개입으로, 교란을 제거한다.
인과효과 식별 (causal effect identification)
SCM에서 DAG로
SCM 에서 DAG 를 추출한다.
- 의 각 변수가 노드(node)가 된다.
- 가 간선(edge)이 된다.
do-계산법 (do-calculus)
Pearl의 세 가지 규칙으로 개입 분포(interventional distribution)를 관측 분포로 변환한다.
규칙 1 (관측의 삽입·삭제): 단, 일 때 성립한다.
규칙 2 (개입과 관측의 교환): 단, 일 때 성립한다.
규칙 3 (개입의 삽입·삭제): 단, 일 때 성립한다.
반사실 (counterfactual)
SCM에서는 반사실 추론(counterfactual reasoning)이 가능하다.
반사실 질의(counterfactual query): “만약 가 였다면 는 무엇이 되었을까?”
3단계 절차:
- 귀추(abduction): 증거를 관측하고 를 추론한다.
- 개입(action): 로 SCM을 수정한다.
- 예측(prediction): 수정한 모형에서 를 계산한다.
선형 SCM (linear SCM)
선형 가우시안 SCM(linear Gaussian SCM):
행렬 형태:
특징:
- 닫힌 형태의 해(closed-form solution)가 존재한다.
- LiNGAM: 비가우시안 잡음(non-Gaussian noise)으로 식별가능(identifiable)하다.
SCM으로부터의 인과 발견 (causal discovery)
목표
데이터 로부터 그 바탕이 되는 SCM(또는 DAG)을 복원한다.
접근법
- 제약 기반(constraint-based) (PC, FCI): 조건부 독립성 검정
- 점수 기반(score-based) (GES, FGES): 점수 최적화
- 비대칭 기반(asymmetry-based) (LiNGAM): 분포의 비대칭성
식별가능성 (identifiability)
- 마르코프 동치(Markov equivalence): 같은 조건부 독립성 → 같은 Markov Equivalence Class
- 비가우시안(non-Gaussian): LiNGAM으로 유일한 DAG를 식별할 수 있다.
관련 개념
- DAG - SCM의 그래프 표현
- Confounder - 측정되지 않은 공통 원인
- d-separation - 그래프상의 조건부 독립성
- Markov Equivalence Class - 관측적으로 동치인 그래프들
- Back-door Criterion - 인과효과 식별
- Potential Outcomes - 또 다른 인과 추론 틀
- Markov Property - 그래프-분포 관계
- Graph Foundations Overview - 그래프 표현 전체 정리
참고 문헌
- Pearl, J. (2009). Causality: Models, Reasoning, and Inference
- yaoSurveyCausalInference2021 - 인과 발견 맥락에서의 SCM