사후예측점검(PPC) 시각화로 모델 적합도를 진단하는 예시 · Figure, arXiv:1709.01449
31. What — 베이지안 워크플로란 무엇인가
4- 정의: 베이지안 워크플로는 "모델을 한 번 적합(fit)하는 행위"가 아니라, 모델 설계 → 사전예측검정(prior predictive check) → 적합(inference) → 계산 진단 → 사후예측검정(posterior predictive check) → 모델 비교/수정 → 의사결정으로 이어지는 반복적(iterative) 연구 절차다 (Gelman et al., 2020, "Bayesian Workflow").
5- 전제: 베이즈 정리(사전 × 가능도 → 사후) 자체는 선수 레슨의 내용으로 전제한다. 이 레슨은 그 정리를 "실제 연구·데이터분석 현장에서 어떻게 굴리는가"를 다룬다.
6- 산출물의 차이: 빈도주의 분석의 산출물이 보통 추정치 하나와 p값이라면, 베이지안 분석의 산출물은 사후분포 전체 p(\theta \mid y) 이고, 그 위에서 확률적 진술("효과가 0보다 클 확률 93%")을 만든다.
7- 워크플로의 3단 구조
8 1. 모델을 만들기 전: 사전분포와 가능도가 만들어내는 가짜 데이터가 상식에 맞는지 점검(사전예측검정)
9 2. 모델을 돌린 뒤: 표본이 제대로 수렴했는지(계산 진단), 모델이 관측 데이터를 재현하는지(사후예측검정)
10 3. 결론 단계: 사후분포를 손실/효용과 결합해 행동을 고르는 베이지안 의사결정
112. Why — 점추정 하나로 의사결정하면 무엇이 무너지는가
12- 문제의 핵심: 실무에서 흔한 보고는 "신약 효과 +3.2%p", "B안 전환율 +1.4%p" 같은 점추정(point estimate) 하나다. 그런데 점추정은
14처럼 사후분포를 한 점으로 압축한 값이라, 분포의 폭(불확실성)·비대칭성·꼬리 위험을 전부 버린다.
15- 같은 점추정, 전혀 다른 결론: 효과 추정치가 둘 다 +3%p여도, 사후 95% 구간이 [2.5, 3.5] 인 경우와 [-9, 15] 인 경우의 의사결정은 완전히 달라야 한다. 점추정만 보면 두 상황이 구별되지 않는다.
16- 소표본에서 특히 치명적: 매장 12곳, 병원 8곳 같은 소규모 그룹 비교에서는 그룹별 표본이 적어 개별 추정치가 극단으로 튄다. 이때 점추정 순위표("1등 매장은 A")는 대부분 노이즈의 순위표다.
17- p값의 오독 문제: p < 0.05 는 "가설이 참일 확률"이 아니라 "귀무가설 하에서 이 정도 데이터가 나올 확률"이다. 미국통계학회는 p값의 단독 사용이 과학적 결론을 왜곡한다고 공식 경고했다 (Wasserstein & Lazar, 2016). 현장이 실제로 원하는 답은 P(\theta > 0 \mid y) 같은 가설에 대한 확률이다.
18- 실제 사례 1 — 임상시험 승인: 베이지안 적응적 설계는 중간 분석에서 사후확률을 근거로 조기 중단·용량 변경을 허용해, 환자 노출과 기간을 줄인다 (Berry, 2006). "효과가 있는가/없는가"의 이분법이 아니라 "임상적으로 의미 있는 최소 효과보다 클 확률"로 판단한다.
19- 실제 사례 2 — 제품 A/B 테스트: 구글의 베이지안 밴딧 실험은 사후분포로부터 표본을 뽑아 트래픽을 배분해, 고정 표본 설계보다 손실(열등 안에 노출된 사용자 수)을 줄였다 (Scott, 2010).
20- 실제 사례 3 — 소규모 그룹 비교: 병원별 사망률, 학교별 성취도처럼 그룹 크기가 제각각인 데이터에서 계층 모형은 표본이 적은 그룹을 전체 평균 쪽으로 수축(shrinkage)시켜 과대 해석을 막는다.
21- 한 문장 요약: 워크플로가 필요한 이유는 "모델이 틀릴 수 있다"를 절차 안에 내장하기 위해서다. 한 번의 적합은 결론이 아니라 가설일 뿐이다 (Betancourt, 2018).
223. How — 워크플로를 구성하는 4개의 관문
23- (1) 사전예측검정: 데이터를 보기 전에 사전분포가 만드는 가상의 관측을 뽑아본다.