2What: 표본은 매번 다르게 나온다
3뉴스에서 "이번 대선 후보 지지율 42%"라는 한 줄을 봅니다. 그런데 이 42%는 온 국민에게 물어본 값이 아니라, 그중 1,000명만 뽑아 계산한 값입니다.
4- 만약 다른 1,000명을 다시 뽑으면? → 40%가 나올 수도, 44%가 나올 수도 있습니다
5- 즉, 같은 모집단에서 표본을 뽑을 때마다 통계량(여기선 표본 평균)이 조금씩 흔들립니다
6- 이 흔들림을 표본 변동성(sampling variability)이라 부릅니다
7비유하자면, 큰 국통에 담긴 국의 간을 볼 때 한 숟갈로 판단하는 것과 같습니다. 숟갈을 뜰 때마다 짠맛이 조금씩 다르게 느껴지죠.
8Why: 숫자 하나만 믿으면 위험하다
9핵심 문장을 기억하세요.
10> 단일 표본 통계량은 진짜 값(모수)이 아니라, 진짜 값 주변에서 흔들리는 추정치다.
111. 여론조사: 42%라는 값 하나만 보고 "과반 못 넘겼다"고 단정하면 위험합니다. 흔들림(오차) 범위가 ±3%p라면 실제로는 45%일 수도 있으니까요.
122. 임상시험: 신약 그룹의 평균 회복률이 대조군보다 5%p 높았다 해도, 그 차이가 우연한 흔들림인지 진짜 효과인지 구분해야 합니다.
133. A/B 테스트: 버튼 색을 바꿨더니 클릭률이 올랐다? 표본이 작으면 다음 주엔 반대로 나올 수 있습니다.
14결론: 흔들림의 크기를 모르면 어떤 결론도 신뢰할 수 없습니다. 통계학의 창시자 피셔(Fisher, 1925)가 추론 이론을 세운 이유가 바로 이 흔들림을 정량화하기 위해서였습니다.
15How: 흔들림 자체를 분포로 그린다
16해결책은 "표본 평균이 얼마나, 어떤 모양으로 흔들리는가"를 하나의 분포로 나타내는 것입니다.
17- 표본을 무한히 반복해 뽑으며 매번 표본 평균 \bar{x} 를 기록한다
18- 이 평균들이 만드는 분포 = 표집분포(sampling distribution)
19- 표집분포의 표준편차 = 표준오차(standard error) → 흔들림의 크기
20\bar{x} \sim \text{진짜 값 } \mu \text{ 주변의 분포}
21놀랍게도 이 표집분포는 모집단이 어떤 모양이든 표본이 커지면 정규분포에 가까워집니다. 이것이 중심극한정리(Central Limit Theorem)이며, 라플라스(Laplace, 1810)가 일반화한 결과입니다.
22이 레슨의 예고
23앞으로 우리는 모든 추론의 관문인 세 가지를 배웁니다.
241. 표집분포: 통계량이 흔들리는 모양
252. 중심극한정리: 왜 그 모양이 정규분포가 되는가
263. 표준오차: 흔들림을 숫자로 재는 법
27이 셋을 알아야 신뢰구간·가설검정·p값 같은 모든 통계 추론이 비로소 말이 됩니다.