Tae Hyun Kim (Lowell)

Collider

3분 읽기 #causal-inference#scm#dag

정의

collider는 처치(treatment) X와 결과(outcome) Y 양쪽 모두로부터 영향을 받는 변수, 즉 공통 효과(common effect)다. X → C ← Y 구조에서 C가 collider에 해당한다.

DAG 표현:

  Treatment (X) → Collider (C) ← Outcome (Y)

핵심 특성:

  • 기본 상태에서는 X와 Y 사이의 연관(association)을 차단한다.
  • C를 조건부(condition)로 두면 X와 Y 사이에 허위 연관(spurious association)이 생긴다 (collider bias).

왜 “collider”라 부르나:

  • 두 개의 화살표가 같은 변수에서 “충돌(collide)“하기 때문이다.

직관적 이해

핵심 아이디어:

collider를 통제(control)하면 원래 없던 X-Y 관계가 나타나는 것처럼 보인다.

예: 데이팅 앱에서 Attractiveness와 Niceness

   Attractive → Date ← Nice
  • 매력적이거나 친절하면 데이트 상대로 선택된다.
  • 전체 인구에서는 Attractiveness와 Niceness가 서로 무관하다.
  • 데이트 상대만 분석할 때(Date를 조건부로 둘 때)는 다르다.
    • “덜 매력적인 사람은 더 친절해야 선택된다”
    • 허위 음(negative)의 상관이 나타난다.

collider bias 예시

1. 출판 편향(Publication Bias, 메타분석)

  Methodological Rigor → Publication ← Innovativeness
  • 출판된 논문만 분석할 때(Publication을 조건부로 둘 때)는 이렇게 된다.
    • 엄밀성(rigor)이 낮아도 혁신적이면 출판된다.
    • 혁신적이지 않아도 엄밀하면 출판된다.
  • 결과: 엄밀성과 혁신성이 음의 상관을 보이는 것처럼 나타난다.
  • 실제: 둘은 본래 무관하거나 오히려 양의 상관을 가진다.

2. 버크슨의 역설(Berkson’s Paradox, 병원 표본)

  Disease A → Hospitalization ← Disease B
  • 병원 표본만 분석하면 이렇게 된다.
    • 질병 A가 없어도 질병 B 때문에 입원한다.
    • 질병 B가 없어도 질병 A 때문에 입원한다.
  • 결과: 질병 A와 B가 음의 상관을 보인다.
  • 모집단(population): 실제로는 둘이 무관하다.

3. 무응답 편향(Nonresponse Bias, 설문)

  Variable X → Response ← Variable Y
  • 응답자만 분석할 때(Response를 조건부로 둘 때)는 이렇게 된다.
    • X와 Y가 응답 여부에 영향을 준다.
  • 결과: X-Y 관계가 왜곡된다.

4. 탈락 편향(Attrition Bias, 종단 연구)

  Baseline X → Dropout ← Outcome Y
  • 남은 참가자만 분석할 때(중도 탈락하지 않은 표본)는 이렇게 된다.
    • X와 Y가 탈락 여부에 영향을 준다.
  • 결과: 선택편향(selection bias)이 생긴다.

5. 표본 선택 효과(Sample Selection Effect)

  Variable X → Sample Selection ← Variable Y
  • 특정 표본만 분석할 때는 이렇게 된다.
    • 예: 성공한 사람들만, 또는 대학 진학자만 분석하는 경우.
  • 결과: X-Y 관계가 모집단과 달라진다.

collider bias는 왜 발생하나

수학적 직관

C=f(X,Y)+ϵC = f(X, Y) + \epsilon

C를 조건부로 두면 다음이 성립한다. P(YX,C=c)P(YX)P(Y|X, C=c) \neq P(Y|X)

  • C의 값을 고정하면 X의 정보가 Y에 대한 정보를 제공한다.
  • “X가 크면, C=c를 만족하려면 Y는 작아야 한다”는 식이다.

정보 흐름

Without conditioning on C:
    X         Y     (no path, independent)

With conditioning on C:
    X → [C] ← Y     (path opened, dependent)
  • 조건부로 두는 행위가 “정보의 통로”를 열어준다.

collider 식별하기

DAG에서 판별

변수 C가 collider가 되는 조건은 다음과 같다.

  1. XCX \rightarrow C (X가 C에 영향)
  2. YCY \rightarrow C (Y가 C에 영향)

시간적 단서

경험칙(rule of thumb): 처치 이후 변수(post-treatment variable)는 collider일 수 있다.

  • 처치와 결과 이후에 발생하는 변수가 이에 해당한다.
  • 예: 최종 결과, 선택 변수.

주의: 모든 처치 이후 변수가 collider는 아니다

X → M → Y    (M은 Mediator, collider 아님)
X → C ← Y    (C는 Collider)

collider는 통제하지 마라

잘못된 관행

“가능한 한 많은 변수를 통제하자”는 발상은 위험하다.

올바른 접근

  1. DAG를 그려 인과 구조(causal structure)를 파악한다.
  2. collider를 식별한다.
  3. collider는 통제 대상에서 제외한다.

예외: collider의 자손(descendant)

X → C ← Y

    D
  • C의 자손인 D를 통제해도 collider bias가 발생한다.
  • D를 통해 C에 대한 부분적 정보가 전달되기 때문이다.

collider와 교란변수 비교

AspectConfounderCollider
DAG 구조X ← Z → YX → C ← Y
역할Common causeCommon effect
기본 상태Spurious association 생성Association 차단
Control 효과Spurious association 제거Spurious association 생성
Control 여부해야 함하면 안 됨

관련 개념

  • DAG - 인과 구조 시각화
  • Confounder - 공통 원인(통제해야 함)
  • Mediator - 인과 경로 상의 변수
  • Back-door Criterion - 인과 식별 조건
  • Selection Bias - collider bias의 한 형태
  • v-structure - unshielded collider, MEC 구분의 핵심

참고 문헌

  • rohrerThinkingClearlyCorrelations - collider bias 설명
  • Berkson, J. (1946). Limitations of the application of fourfold table analysis
  • Pearl, J. (2009). Causality

연결 그래프