2한 문장 요약
3- 통계 검정은 하나가 아니라 질문의 형태와 데이터의 성질에 따라 골라 쓰는 도구 상자다. 도구를 잘못 고르면 결론 자체가 뒤집힌다.
4What — 검정은 '만능 자'가 아니라 '연장 세트'다
5- 망치로 나사를 박을 수 없듯, 모든 데이터에 t검정 하나만 들이대면 안 된다.
6- 대표적인 연장들(자세한 사용법은 뒤 블록에서 다룬다):
7 • 평균 비교 — 키, 혈압, 체류시간처럼 '숫자로 재는 양'의 평균 차이 → t검정 계열 (Gosset(Student), 1908)
8 • 비율·범주 비교 — 클릭했다/안 했다, 합격/불합격처럼 '세는 개수' → 카이제곱 검정 (Pearson, 1900), 표본이 아주 작으면 Fisher 정확검정 (Fisher, 1935)
9 • 순위 비교 — 분포가 한쪽으로 심하게 치우쳤거나 표본이 작을 때 평균 대신 순위로 비교 → Wilcoxon 순위합 검정 (Wilcoxon, 1945; Mann & Whitney, 1947)
10- 즉 '무엇을 재었는가(측정 척도)'가 먼저이고, 검정 이름은 그다음에 따라온다.
11Why — 잘못 고르면 두 방향으로 손해를 본다
12- 효과가 있는데 없다고 결론: 데이터가 치우쳐 있는데 평균 비교를 쓰면, 소수의 극단값이 평균과 표준편차를 흔들어 신호가 잡음에 묻힌다.
13- 효과가 없는데 있다고 결론: 검정이 요구하는 전제(예: 관측값들이 서로 독립)를 어기면, 우연히 생긴 차이를 진짜 효과로 착각한다.
14- 두 오류의 대가는 실무에서 완전히 다르다. 신약은 '없는 효과를 있다고' 하면 환자가 위험해지고, 마케팅은 '있는 효과를 없다고' 하면 매출 기회를 통째로 버린다.
15사례 1 — 신약 임상시험, 작고 치우친 데이터
16- 상황: 환자 20명, 증상 점수는 대부분 0~2인데 몇 명만 15점처럼 크게 튀는 오른쪽으로 치우친 분포.
17- 잘못된 선택: 평균 비교 검정을 그대로 적용 → 극단값 때문에 흩어짐(표준편차)이 부풀고, 신약과 위약의 차이가 '우연 범위'로 보인다.
18- 옳은 선택: 순위 기반 검정으로 바꾸면 '신약군 환자가 대체로 더 낮은 점수 순위에 있다'는 사실이 그대로 살아난다.
19- 교훈: 표본이 작을수록 분포 모양의 가정이 결과를 좌우한다.
20사례 2 — A/B 테스트, 클릭률은 '평균'이 아니다
21- 상황: 버튼 색 A안 1만 명 중 520명 클릭, B안 1만 명 중 610명 클릭.
22- 각 사용자의 데이터는 0(안 누름) 또는 1(누름)뿐인 범주형이다. 여기에 연속량용 평균 비교를 습관처럼 쓰면 전제가 어긋난다.
23- 옳은 선택: 클릭/비클릭 개수를 표로 세는 비율 비교(카이제곱·비율검정). 웹 실험 실무 표준도 이 방식이다 (Kohavi et al., 2009).
24- 덤: 같은 사용자를 여러 번 세면 '독립' 전제가 깨진다 — 검정 이름보다 데이터를 어떻게 모았는가가 먼저다.
25How — 검정을 고르는 3가지 질문
261. 무엇을 재었나? 숫자량인가(평균/순위), 범주인가(비율).
272. 몇 집단을 비교하나? 두 집단인가, 셋 이상인가.
283. 짝이 지어져 있나? 서로 다른 사람들인가(독립), 같은 사람의 전·후인가(대응).
29- 이 세 답이 정해지면 쓸 검정은 사실상 하나로 좁혀진다. 검정 선택은 암기가 아니라 질문 정리다.
30이 레슨의 목표
31- 공식을 외우는 것이 아니라, 새 데이터를 봤을 때 "이건 무엇을 재었고, 몇 집단이고, 짝이 있나"를 스스로 묻고 맞는 도구를 집어 드는 실무 감각을 기르는 것이다.