English summary. An end-to-end single-object detection pipeline in PyTorch — parsing Pascal-VOC-style XML annotations, scaling and drawing bounding boxes, building a custom
Dataset/DataLoader, and training a CNN that jointly predicts the bounding box and class.
이미지 속 하나의 객체를 탐지(바운딩 박스 + 클래스)하는 딥러닝 파이프라인을 PyTorch로 처음부터 구현한 노트북입니다. YOLO 같은 프레임워크를 쓰지 않고, 어노테이션 파싱부터 모델 학습까지 탐지의 내부 동작을 직접 다룹니다.
파이프라인 (01_object_detection.ipynb)
- 어노테이션 파싱 — Pascal VOC 형식의 XML에서 바운딩 박스 좌표·라벨 추출
- 좌표 변환·시각화 — 이미지 리사이즈에 맞춘 Scaled Bounding Box 계산, 박스 그리기
- 데이터 파이프라인 — 커스텀
Dataset+DataLoader,torchvision.transforms - 모델 — CNN 특징 추출 + 바운딩 박스 회귀 + 클래스 분류 헤드
- 학습·추론 — 손실(위치 + 분류) 결합,
tqdm진행 표시, 예측 박스 시각화
노트북의 실제 출력입니다.
| 정답 박스 (Ground Truth) | 예측 박스 (Prediction) |
|---|---|
![]() |
![]() |
객체의 바운딩 박스와 클래스를 예측한 결과입니다.
pip install torch torchvision opencv-python pillow numpy matplotlib torchsummary tqdm
# images.zip(이미지 + XML 어노테이션)을 노트북 경로에 배치 후 실행
jupyter notebook- YOLO 기반 탐지(별도 과정): yolo-object-detection
- 픽셀 단위 분할: semantic-segmentation
NVIDIA AI Academy Seoul 교육과정 실습 — 전체 포트폴리오

