핵심 질문: 논문의 결과를 재현하려 했지만 성능이 10% 이상 낮게 나옵니다. 논문이 거짓인 걸까요, 아니면 무엇이 빠진 걸까요?
ML 연구의 재현성 위기(Reproducibility Crisis)는 현실입니다. 2020년 NeurIPS 재현성 챌린지에서 참가 팀의 상당수가 원논문의 결과를 재현하지 못했습니다. 이는 저자가 거짓을 쓴 것이 아니라, 실험의 세부 설정이 논문에 충분히 기술되지 않았기 때문입니다.
재현 실패의 실제 원인들:
- 랜덤 시드가 고정되지 않거나 보고되지 않음
- 하이퍼파라미터 검색 범위가 공개되지 않음
- 데이터 전처리 파이프라인의 미세한 차이 (토크나이저 버전, 정규화 방법)
- 하드웨어 차이로 인한 부동소수점 연산 차이
- "best run"만 보고하고 평균을 보고하지 않음
재현성이 중요한 이유:
- 과학적 신뢰: 재현되지 않는 결과는 과학이 아닙니다
- 후속 연구: baseline을 재현할 수 없으면 비교 실험이 불가능
- 실용적 가치: 산업에서 논문 결과를 배포하려면 재현이 필수
- 리뷰 과정: NeurIPS, ICML 등 주요 학회에서 재현성 체크리스트를 요구
이 레슨에서는 처음부터 재현 가능하게 실험을 설계하는 방법을 배웁니다. 나중에 재현성을 추가하는 것은 10배 어렵습니다.