
You Only Look Once. YOLO
두줄요약
YOLOv1의 단일 신경망 기반 객체 검출 구조와 출력·손실 구성을 설명했습니다.\nYOLOv2의 앵커 박스, 다중 스케일 학습 등 정확도 개선 기법을 정리했습니다.
구조와 흐름
- YOLOv1의 2-stage detection 대비 단일 CNN 기반 1-stage 통합 검출
- S×S 그리드별 바운딩 박스, confidence score, 조건부 클래스 확률 예측
- 7×7×30 Prediction Tensor와 좌표·신뢰도·클래스 손실의 결합
장단점
- 단순한 학습 파이프라인과 이미지 전체 맥락 학습 기반의 빠른 학습·예측
- 겹친 객체, 작은 객체, 새로운 바운딩 박스 형태에서의 낮은 정확도
해결 방법
- YOLOv2의 Batch Normalization, 고해상도 분류기, Darknet-19 기반 완전 합성곱 구조
- Anchor Box와 dimension clustering 기반의 오프셋 예측
- passthrough layer와 multi-scale training 기반의 작은 객체·다양한 입력 크기 보완
성능/운영 포인트
- 앵커 박스 5개와 20개 클래스 기준 13×13×125 출력 구성
- 앵커 수 증가에 따른 recall 향상과 예측 속도 저하의 균형
- VOC에서 SSD보다 높은 성능, COCO에서는 더 낮은 성능 언급


