Tae Hyun Kim (Lowell)

ESMM (Entire Space Multi-Task Model)

3분 읽기 #recsys#representation-learning

정의

ESMM은 CVR 학습의 표본 선택편향(sample selection bias)과 데이터 희소성(data sparsity)을 동시에 푸는 다중 작업 학습(multi-task learning) 모델이다. impressionclickconversion\text{impression} \to \text{click} \to \text{conversion}으로 이어지는 순차적 사용자 행동을 이용해, 전체 impression space에서 CVR을 간접적으로 학습한다.

핵심 분해:

P(o=1,r=1)CTCVR=P(o=1)CTR×P(r=1o=1)CVR\underbrace{P(o=1, r=1)}_{\text{CTCVR}} = \underbrace{P(o=1)}_{\text{CTR}} \times \underbrace{P(r=1 \mid o=1)}_{\text{CVR}}

학습 목적함수:

LESMM=LCTR+LCTCVR\mathcal{L}_{\text{ESMM}} = \mathcal{L}_{\text{CTR}} + \mathcal{L}_{\text{CTCVR}}
  • LCTR=E(u,i)D[δ(ou,i,o^u,i)]\mathcal{L}_{\text{CTR}} = E_{(u,i) \in \mathcal{D}}[\delta(o_{u,i}, \hat{o}_{u,i})] — 전체 impression space에서 CTR을 학습한다.
  • LCTCVR=E(u,i)D[δ(ou,iru,i, o^u,ir^u,i)]\mathcal{L}_{\text{CTCVR}} = E_{(u,i) \in \mathcal{D}}[\delta(o_{u,i} \cdot r_{u,i},\ \hat{o}_{u,i} \cdot \hat{r}_{u,i})] — 전체 impression space에서 CTCVR을 학습한다.
  • CVR tower에는 직접적인 손실 항이 없고, CTCVR 곱셈 구조로 간접 학습한다.

직관적 이해

전체 공간에서 학습하는 이유

기존의 단순(naive) CVR 모델은 다음 문제를 안고 있다.

전체 impression (D)     클릭된 아이템 (O)     전환 (R)
 ┌──────────────┐     ┌──────────┐        ┌────┐
 │  ■ ■ □ □ □   │     │  ■ ■ □   │  CVR   │ ■  │
 │  □ □ □ □ □   │ →   │  ■ □ □   │  학습 → │ ■  │
 │  □ □ □ □ □   │     │          │   ↑     │    │
 └──────────────┘     └──────────┘   │     └────┘
   Inference space      Training     Selection
                        space        Bias!
  • 학습 시: click=1인 샘플에서만 CVR을 학습한다.
  • 추론 시: 전체 impression에 대해 CVR을 예측한다.
  • 따라서 학습 분포와 추론 분포가 어긋난다 (MNAR: Missing Not At Random).

ESMM은 CVR tower를 직접 학습하지 않는다. 대신 CTR × CVR = CTCVR라는 관계를 이용해, 전체 impression space에서 CTCVR 손실로 CVR을 간접 학습한다.

아키텍처

Raw Features (User, Item)

┌─── Shared Embedding Lookup Table ───┐
│                                      │
↓                                      ↓
CTR Tower                         CVR Tower
   ↓                                  ↓
  pCTR ──────────── × ──────────── pCVR

                  pCTCVR

            L_CTR + L_CTCVR (학습)
  • 공유 임베딩(shared embedding): CTR의 풍부한 데이터(클릭 레이블)를 CVR tower로 전이해 데이터 희소성을 완화한다.
  • 곱셈 구조: CVR tower가 전체 space에서 학습하므로 선택편향을 우회한다.

해결하는 문제

문제해결 메커니즘
Sample Selection Biasclick space 대신 전체 impression space에서 CTCVR을 학습한다
Data Sparsity공유 임베딩으로 CTR의 정보를 CVR로 전이한다

한계

1. Inherent Estimation Bias (IEB)

ESMM의 CVR 추정값(estimate)은 구조적으로 항상 실제 값보다 높다.

BiasESMM:=ED[R^]ED[R]>0\text{Bias}^{\text{ESMM}} := E_\mathcal{D}[\hat{R}] - E_\mathcal{D}[R] > 0

원인은 R^=C^/O^\hat{R} = \hat{C}/\hat{O} 형태에 있다. Jensen 부등식에서 E[C^/O^]E[C^]/E[O^]E[\hat{C}/\hat{O}] \geq E[\hat{C}]/E[\hat{O}]가 성립하고, 등호 조건인 Var(O^)=0\text{Var}(\hat{O})=0은 현실적으로 만족되지 않는다.

2. Potential Independence Priority (PIP)

ESMM의 인과 그래프에는 ORO \to R 엣지가 빠져 있다. 이 때문에 CVR tower가 click의 인과적 효과를 무시한 채 P(r=1)P(r=1)을 학습할 위험이 있다.

두 한계 모두 ESCM2에서 반사실(counterfactual) 위험 정규화 항으로 해결한다.

관련 개념

  • Multi-Task Learning — ESMM의 학습 패러다임
  • Selection Bias — ESMM이 풀려는 핵심 문제
  • ESCM2 — ESMM의 IEB/PIP 한계를 보완하는 후속 모델
  • Propensity Score — ESCM²가 CTR을 성향점수(propensity score)로 활용

참고 논문

  • maEntireSpaceMultiTask2018 — ESMM 원논문 (SIGIR 2018)
  • wangESCM2^2EntireSpace2022 — IEB/PIP 한계를 증명하고 ESCM²를 제안

연결 그래프