2What — ML 실험 추적(Experiment Tracking)이란?
3- 모델 학습 시 사용한 하이퍼파라미터, 데이터 버전, 코드 버전, 성능 지표를 자동으로 기록·비교하는 체계
4- 예: "learning_rate=0.001, batch_size=64, val_acc=0.93" 같은 정보를 매 실험마다 저장
5- 대표 도구: MLflow (오픈소스, 로컬 가능), W&B (클라우드 기반, 시각화 강력)
6Why — 실험 추적 없이 발생하는 세 가지 고통
71. '지난번 그 모델' 미스터리
8 - 수백 번 학습을 돌린 뒤 "어떤 하이퍼파라미터 조합이 최고 성능이었지?" → 대답 불가
9 - print()로 찍은 로그는 터미널 꺼지면 사라지고, 텍스트 파일은 이름 규칙이 무너짐
10 - 실제 사례: Uber는 초기 ML 플랫폼 부재로 엔지니어마다 다른 방식으로 모델을 관리해 재현 불가 문제가 빈발했고, 이를 해결하기 위해 Michelangelo 플랫폼을 구축 (Hermann & Del Balso, 2017)
112. 재현 불가(Irreproducibility) 공포
12 - 같은 코드를 돌려도 결과가 달라짐 → 랜덤 시드, 데이터 전처리 버전, 라이브러리 버전 중 뭐가 바뀌었는지 추적 불가
13 - print/로그파일 관리의 한계: 파라미터 일부만 기록, 데이터 버전 누락, 환경 정보 없음
14 - Nature 설문에서 연구자 70%가 "다른 연구자의 실험을 재현하지 못한 경험이 있다"고 응답 (Baker, 2016)
153. 배포 사고 — 버전 혼동과 성능 회귀
16 - 팀원 A가 만든 v3 모델을 배포해야 하는데, 팀원 B가 성능이 낮은 v2를 프로덕션에 올림
17 - 성능 회귀(Performance Regression): 새 모델이 특정 데이터 구간에서 이전보다 나빠졌지만, 비교 기록이 없어 발견 못 함
18 - 금융·의료 분야에서는 이런 실수가 규제 위반으로 이어짐
19How — 실험 추적이 해결하는 세 가지 핵심 가치
20- 재현성(Reproducibility): 모든 실험의 코드·데이터·환경·파라미터를 자동 스냅샷 → 언제든 동일 결과 재현 가능
21- 비교(Comparison): 수백 개 실험을 테이블/차트로 정렬·필터링 → "lr=0.001이 0.01보다 낫다"를 즉시 확인
22- 협업(Collaboration): 팀원 전원이 같은 대시보드에서 실험 결과를 공유 → "지난번 그 모델" 대신 "Run #247" 으로 소통 (Zaharia et al., 2018)
23이 레슨에서 얻는 구체적 능력
24- MLflow로 로컬 실험을 기록하고 UI에서 비교하는 워크플로우 체험
25- W&B로 학습 곡선을 실시간 시각화하고 팀과 공유하는 방법 이해
26- "실험 추적 도구 없이 모델을 만들지 않겠다"는 습관 형성 → 포트폴리오에 실험 관리 역량을 증명할 수 있음