Multi-Task Learning
정의
다중 작업 학습(multi-task learning)은 서로 관련된 여러 태스크를 동시에 학습해, 공유 표현(shared representation)으로 일반화(generalization) 성능을 끌어올리는 학습 패러다임이다.
여기서 는 태스크 의 손실이고, 는 태스크 가중치다.
직관적 이해
함께 학습하는 이유
- 공유 표현: 관련 태스크가 공통 패턴을 학습하면 개별 태스크 성능도 함께 올라간다.
- 정규화 효과: 여러 태스크를 함께 풀면 과적합(overfitting)을 억제한다.
- 데이터 효율: 데이터가 희소한 태스크가 풍부한 태스크로부터 정보를 전이받는다.
광고·추천에서의 핵심 응용
CTR과 CVR을 동시에 예측한다.
User/Item Features
↓
Shared Embedding
↓
┌───┴───┐
↓ ↓
CTR Tower CVR Tower
↓ ↓
pCTR pCVR
주요 아키텍처
1. Shared-Bottom
모든 태스크가 동일한 하위 네트워크를 공유한다. 단순하지만 태스크 간 충돌이 생길 수 있다.
2. MMoE (Multi-gate Mixture-of-Experts)
태스크별 게이트가 expert 네트워크를 선택적으로 조합한다. 태스크 간 관계가 약할 때 유리하다.
3. PLE (Progressive Layered Extraction)
공유 expert와 전용 expert를 점진적으로 분리해 태스크 충돌을 최소화한다.
광고 예측에서의 주요 모델
ESMM (Entire Space Multi-Task Model)
- 문제 해결: CVR의 선택편향(selection bias)(click=1에서만 학습)과 데이터 희소성(data sparsity)을 함께 다룬다.
- 핵심: impression 전체 공간에서 를 학습한다.
- 한계: inherent estimation bias(IEB)와 potential independence priority(PIP)가 남는다.
ESCM² (Entire Space Counterfactual Multi-Task Model)
- 개선점: ESMM에 IPS/DR counterfactual risk regularizer를 더한다.
- 방법: CVR을 로 재정의하고, IPS/DR로 unbiased하게 학습한다.
- 한계: CTR 정확도에 의존하고, impression space 안에서만 작동한다.
IPW-ESCM² (제안 프레임워크)
- ESCM²에 역성향 가중(IPW) 가중치를 결합한다.
- win selection bias와 click selection bias를 동시에 보정한다.
- 자세한 내용은 research_design_selection_bias를 참조한다.
관련 개념
- 선택편향(selection bias) — 다중 작업 학습으로 해결하려는 핵심 문제다.
- 역성향 가중(IPW) — 편향(bias)을 보정하는 가중 방법이다.
- 보정(calibration) — 예측 확률이 얼마나 정확한지를 가리킨다.
- Survival Analysis — win propensity 추정에 활용한다.
참고 논문
- maEntireSpaceMultiTask2018 — Entire Space Multi-Task Model (ESMM), SIGIR 2018
- wangESCMEntireSpace2022 — ESCM²: Entire Space Counterfactual Multi-Task Model, SIGIR 2022
- Ma et al. (2018). Modeling Task Relationships in Multi-Task Learning with Multi-Gate Mixture-of-Experts (MMoE), KDD