2What — 데이터 파이프라인의 정의
3- 데이터 파이프라인: 원시 데이터를 수집 → 정제 → 변환 → 저장하는 자동화된 워크플로우
4- 각 단계가 이전 단계의 출력을 입력으로 받아 순차·병렬 처리
5- 핵심 원칙: "모델 품질은 데이터 품질을 넘지 못한다" (Sambasivan et al., 2021)
6Why — 파이프라인이 필요한 이유
7- 재현성(Reproducibility): 동일 입력 → 동일 출력 보장. Jupyter Notebook 수동 실행은 셀 순서 의존성으로 재현 불가
8- 확장성(Scalability): 데이터 10배 증가 시 노트북 커널 OOM 발생 → 파이프라인은 분산 처리로 선형 확장
9- 자동화: 스케줄링·모니터링·알림을 통해 사람 개입 없이 24/7 운영
10- 품질 관리: 스키마 검증, 이상치 탐지, 데이터 드리프트 감지를 단계별로 삽입 가능
11Notebook-only 작업의 구체적 문제점
12- 셀 실행 순서가 코드에 기록되지 않아 동료가 다른 결과를 얻음
13- 전역 변수 오염: 위쪽 셀 삭제 후에도 메모리에 남아 숨은 버그 유발
14- 100GB+ 데이터셋 처리 시 단일 머신 한계 → 파이프라인 도구(Airflow, Prefect)는 워커 분산 지원
15- 버전 관리 불가: 어떤 전처리를 적용했는지 히스토리 추적 어려움
16How — 실제 사용 사례 3가지
17- 추천 시스템의 실시간 피처 파이프라인: 사용자 클릭 이벤트 → Kafka 스트림 → 피처 스토어(Feast) → 모델 서빙. 지연 시간 수백 ms 이내 (Zhao et al., 2019)
18- 자율주행의 센서 데이터 처리: LiDAR·카메라·GPS 동기화 → 포인트 클라우드 정합 → 라벨링 큐 적재. 초당 수 GB 처리 필요
19- LLM 사전학습용 웹 크롤링 파이프라인: CommonCrawl 수집 → 중복 제거(MinHash) → 유해 콘텐츠 필터링 → 토크나이징. GPT-3 학습 데이터 570GB 처리 (Brown et al., 2020)
20핵심 요약
21- 파이프라인 = 재현 가능 + 확장 가능 + 자동화된 데이터 처리 시스템
22- ML 프로젝트 실패 원인의 대다수는 모델이 아닌 데이터 문제 (Sculley et al., 2015)
23- 프로토타입은 노트북, 프로덕션은 파이프라인 — 이 전환 시점을 인식하는 것이 엔지니어링 성숙도의 지표