이런 분들이 찾고 있어요
이 레슨과 관련된 학습 키워드
AI를 아는 것에서, 풀 수 있는 것으로
이 레슨과 관련된 학습 키워드
핵심 질문: 왜 데이터를 "뻥튀기"해야 하는가?
딥러닝 모델은 수백만~수억 개의 파라미터를 학습합니다. 하지만 현실에서 라벨링된 데이터는 항상 부족하죠. 데이터가 적으면 모델은 훈련 데이터를 "암기"해버립니다 — 이것이 과적합(overfitting)입니다.
과적합의 전형적 신호:
Data Augmentation의 원리:
기존 데이터에 변환을 적용해서 "의미적으로 동일하지만 픽셀 수준에서 다른" 새 샘플을 만듭니다.
고양이 사진 1장이 있다고 해보죠:
이렇게 1장으로 수십~수백 장의 학습 데이터를 만들 수 있어요.
데이터 증강이 효과적인 이유 3가지:
1. 데이터 다양성 증가: 모델이 다양한 시점/조명/구도를 학습
2. 과적합 방지: 같은 이미지를 반복하지 않으니 암기가 어려움
3. 불변성(invariance) 학습: "좌우 반전해도 고양이는 고양이"라는 걸 모델이 배움
주의사항: 라벨을 보존하는 변환만 적용해야 합니다!
왜 중요한가? 딥러닝 모델은 데이터가 부족하면 학습 데이터를 외워버립니다(과적합). 직관적으로 "더 많은 데이터를 모으면 해결"이지만, 의료 영상, 위성 사진, 산업 결함 등 많은 도메인에서 데이터 수집은 극도로 비싸거나 물리적으로 불가능합니다. 데이터 증강은 기존 데이터를 변환하여 새로운 학습 샘플을 생성합니다.
핵심은 "라벨을 보존하는 변환"을 적용하는 것입니다. 고양이를 뒤집어도 여전히 고양이이지만, 6을 뒤집으면 9가 됩니다. 이 도메인 지식을 반영한 증강이 데이터 수집 대비 100배 저렴하면서도 유사한 효과를 줍니다.