왜 객체 검출의 두 가지 접근: 1-Stage vs 2-Stage이 필요한가? 실무에서 이 개념 없이는 문제를 해결할 수 없습니다. 핵심 동기와 배경을 먼저 이해합시다.
객체 검출(Object Detection)은 이미지에서 "어디에" "무엇이" 있는지를 찾는 과제입니다.
1-Stage Detector (단일 단계):
- 이미지 전체를 한 번에 보고 바로 박스 + 클래스를 예측합니다
- 대표 모델: YOLO, SSD, RetinaNet
- 장점: 빠른 속도 — 실시간 처리에 적합 (30~60+ FPS)
- 단점: 작은 물체나 밀집된 물체에서 정확도가 떨어질 수 있음
2-Stage Detector (두 단계):
- 1단계: "물체가 있을 것 같은 후보 영역(Region Proposal)"을 먼저 찾습니다
- 2단계: 각 후보 영역을 정밀하게 분류하고 박스를 보정합니다
- 대표 모델: R-CNN, Fast R-CNN, Faster R-CNN
- 장점: 높은 정확도 — 특히 작은 물체에 강함
- 단점: 상대적으로 느림 (5~15 FPS)
핵심 트레이드오프:
\text{1-Stage: 속도} \uparrow \quad \text{정확도} \downarrow \qquad \text{2-Stage: 속도} \downarrow \quad \text{정확도} \uparrow
Faster R-CNN은 2-stage의 대표 주자로, Region Proposal을 신경망(RPN)으로 생성해서 속도와 정확도를 모두 잡았습니다.
왜 중요한가? 1단계 검출기(YOLO, SSD)는 빠르지만 작은 객체나 밀집된 객체에서 정확도가 떨어집니다. 2단계 검출기는 "어디에 물체가 있을까?"(RPN)와 "이것이 무엇인가?"(분류 헤드)를 분리함으로써 각 단계가 자기 역할에 집중할 수 있습니다.
특히 의료 영상에서 작은 종양 검출, 자율주행에서 먼 거리의 보행자 인식 등 정확도가 생명과 직결되는 응용에서 2단계 접근법이 여전히 선호됩니다.
속도보다 정확도가 중요한 상황에서 2단계 검출기가 최적의 선택인 이유입니다.
Faster R-CNN은 Ren 등이 제안한 2단계 객체 검출기로, RPN과 Fast R-CNN을 통합했다 (Ren et al., 2015).