21. 무엇을 하려는가 (What)
3- 이 레슨의 목표: 공식 없이, 컴퓨터로 데이터를 여러 번 다시 뽑아서 오차막대(신뢰구간)와 '우연 여부' 판단을 만드는 것.
4- 오차막대 = 점수 옆에 붙는 세로 막대. "이 숫자는 이 정도 폭으로 흔들릴 수 있다"를 보여주는 표시.
5- 두 가지 도구를 배운다.
6 1) 부트스트랩(bootstrap) — 가진 데이터에서 복원추출(뽑은 걸 다시 넣고 또 뽑기)로 가짜 표본을 수천 개 만들어 점수의 흔들림 폭을 재는 방법 (Efron, 1979).
7 2) 순열검정(permutation test) — 두 모델의 라벨(어느 쪽 결과인지)을 무작위로 섞어서 "실력 차이가 없다면 이 정도 차이는 얼마나 흔한가"를 세어보는 방법 (Fisher, 1935).
82. 왜 필요한가 (Why) — 문제 제기
9- 평균에는 교과서 공식이 있다. 표준오차(SE, 평균이 표본마다 흔들리는 폭)는 한 줄로 끝난다.
10SE = \frac{s}{\sqrt{n}}
11- 그런데 머신러닝에서 실제로 보고하는 숫자는 평균이 아니다.
12 - F1 점수 — 정밀도와 재현율을 섞어 만든 분류 성능 점수. 나눗셈이 두 번 들어간 비율의 비율이라 "모든 샘플의 평균"으로 쓸 수 없다.
13 - AUC — 모델이 양성 샘플을 음성 샘플보다 높게 매길 확률. 샘플 쌍을 비교해 만들기 때문에 개별 샘플이 서로 얽혀 있다.
14 - BLEU — 기계번역 품질 점수. 문장 단위 점수를 그냥 평균 내는 게 아니라 전체 코퍼스를 한 덩어리로 집계한다.
15- 즉 이 지표들에는 s/\sqrt{n} 같은 깔끔한 SE 공식이 없다. 공식이 없으니 오차막대를 그릴 수 없고, 오차막대가 없으니 "이 차이가 진짜인가"를 판단할 근거가 사라진다.
163. 실제로 벌어지는 실수
17- 논문·리포트에서 가장 흔한 문장: "우리 모델 A(F1 = 0.82)가 기존 모델 B(F1 = 0.79)보다 우수하다."
18- 여기서 빠진 질문 세 가지.
19 - 테스트셋이 500개였나 50,000개였나? (표본이 작으면 0.03 차이는 쉽게 뒤집힌다)
20 - 랜덤 시드를 바꿔 다시 학습했다면 0.82가 또 나오나?
21 - 테스트 문장 몇 개만 바뀌었어도 순위가 유지되나?
22- 실제 사례: 기계번역 분야에서 BLEU 차이만 보고 우열을 주장하던 관행에 대해, 부트스트랩 재표본으로 검정하면 작은 차이는 통계적으로 구별되지 않는다는 점이 지적되었다 (Koehn, 2004).
23- 자연어처리 논문 다수가 유의성 검정 없이 점수만 비교한다는 조사도 있다 (Dror 외, 2018 — '히치하이커 가이드'). 재현 실험에서 시드만 바꿔도 순위가 뒤집힌 보고 역시 알려져 있다 (Reimers & Gurevych, 2017).
24- 비유: 몸무게를 잰다고 하자. 저울에 한 번 올라가 68.2kg, 다음 날 67.9kg. 이 0.3kg 차이로 "살이 빠졌다"고 말할 수 있을까? 저울 자체의 흔들림 폭을 모르면 아무 말도 할 수 없다. 오차막대가 바로 그 흔들림 폭이다.
254. 그래서 어떻게 하는가 (How) — 핵심 한 문장
26- 공식이 없으면, 컴퓨터로 표본을 여러 번 다시 만들어서 직접 흔들림을 관찰한다.
27- 부트스트랩의 발상: "모집단을 다시 조사할 수 없으니, 내가 가진 표본을 작은 모집단이라 치고 거기서 계속 다시 뽑자."
28 - 테스트셋 1,000개 → 복원추출로 1,000개 재표본 만들기 → F1 계산 → 이걸 2,000번 반복 → F1 값 2,000개의 분포가 곧 오차막대의 재료.
29- 순열검정의 발상: "차이가 없다는 가정이 맞다면, 두 모델의 결과 라벨을 섞어도 지금 같은 차이가 자주 나와야 한다."
30 - 섞어서 만든 가짜 차이 수천 개 중, 실제 차이(0.03)보다 큰 것이 몇 %인지 세면 그것이 p값 역할을 한다.
31- 두 방법의 공통점: 지표가 무엇이든(F1, AUC, BLEU, 정확도, 심지어 직접 만든 점수) 계산만 가능하면 그대로 적용된다. 새 공식을 유도할 필요가 전혀 없다.
325. 이 레슨의 범위
33- 다루는 것: 리샘플링(데이터를 다시 뽑기)으로 오차막대 만들기 — 부트스트랩 신뢰구간, 순열검정 p값, 반복 횟수 정하기, 흔한 함정.
34- 다루지 않는 것: 정규분포 근사에 기대는 공식 계산, 이론적 유도.
35- 학습 후 얻는 것: "F1 = 0.82" 대신 "F1 = 0.82 (95% CI 0.79–0.85)"라고 쓸 수 있는 능력. 그리고 남의 논문에서 오차막대 없는 비교를 보면 의심할 줄 아는 눈.