해당 내용의 데이터는 ai hub 위성 영상 객체 판독을 사용했음. 링크
AI-Hub
데이터셋 다운로드 승인이 완료 된 후 API 다운로드 서비스를 이용하실 수 있습니다. API 다운로드 파일은 분할 압축되어 다운로드 됩니다. 분할 압축 해제를 위해서는 분할 압축 파일들의 병합이
aihub.or.kr
1. 문제와 데이터
아리랑(KOMPSAT) 3/3A호 위성영상에서 정유탱크(storage tank)를 검출을 목표로 한다.
평가 지표는 AP @ IoU > 0.5 — 예측 박스와 정답 박스가 절반 넘게 겹치면 맞춘 것으로 치고 계산한 Average Precision
원본은 AI Hub 위성영상객체판독 데이터셋에는 20개 클래스에 객체 502,248개가 들어있는데, 정유탱크는 그중 0.42%뿐이다.
| 전체 패치 (1024×1024 png) | 1,747 | 219 | 1,966 |
| 전체 객체 (20클래스) | 449,392 | 52,856 | 502,248 |
| 정유탱크 박스 | 1,743 | 353 | 2,096 |
| 정유탱크가 있는 패치 | 140 | 27 | 167 |
심지어 하나의 이미지에 극단적으로 88개의 객체가 있는 경우도 있음.
2. 실험 설계
140장으로 단일 클래스 학습은 과적합이 될것이다. 그래서 같은 데이터의 나머지 19개 클래스 449,386개 객체를 전부 쓰는 안을 함께 검증하기로 했다.
| 실험 | 클래스 | train 이미지 | train 박스 | val |
| Exp A | 탱크 1개 | 140 (양성만) | 1,743 | 219장 전체 |
| Exp A2 | 탱크 1개 | 1,747 (음성 포함) | 1,743 | 219장 전체 |
| Exp B | 20개 전체 | 1,747 | 449,386 | 219장 전체 |
val을 세 실험 모두 219장 전체로 고정한 이유 - 양성 27장만으로 평가하면 음성 패치에서 나오는 오탐(FP)이 집계에서 빠져 AP가 부풀려진다. 무엇보다 비교하려면 분모가 같아야 한다.
A2가 존재하는 이유 - A와 B는 클래스 수와 이미지 수가 동시에 다르다. B가 이겨도 원인이 어느 쪽인지 모른다. A2를 끼우면 A → A2 = 이미지 수 효과, A2 → B = 다중 클래스 supervision 효과로 분리된다.
+ 실제 코드는 앞썬 블로그에 있습니다.
3.실험 비교
[정유 탱크의 이미지는 167장뿐이니, 같은 데이터의 20개 클래스 449,386개 객체를 전부 써서 백본을 학습시키면 탱크 검출도 좋아질 것이다.] 가 가설이였지만 결과는 정반대였다.


4. 결론
타겟에 집중한 작은 데이터가, 크고 다양한 데이터보다 정확하고 4.7배 쌌다.
| A (탱크만, 140장) | 0.8457 | 29분 | 최고 |
| A2 (탱크만, 1,747장) | 0.8360 | 62분 | 중간 |
| B (20클래스) | 0.7942 | 136분 | 최저 |
"데이터가 적으니 관련 있는 걸 다 넣자"는 직관이 틀렸다.
타겟이 극소수 클래스(0.39%)일 때는 다중 클래스 학습이 신호를 희석시킨다. 다만 이번 테스트에서는 사전학습 가중치를 쓸 수 있었기 때문이다. COCO 백본이 이미 "물체다움"을 알고 있어서 140장으로도 충분했다. 사전학습이 금지된 상황이라면 20클래스 449k 박스가 백본을 만드는 유일한 재료였을 테고, 결과가 반대로 나왔을 가능성이 높다.
A 실험 결과 이미지 (예측 / 라벨 순)


A2 실험 결과 이미지 (예측 / 라벨 순)


B 실험 결과 이미지 (예측 / 라벨 순)


번외
라벨 정확도

변환된 YOLO 라벨을 되돌려 그린 것. 왼쪽 위 6px부터 오른쪽 아래 132px까지 크기를 변경하고, 이미지를 돌려가면서 테스트 함
'ML > 인공지능' 카테고리의 다른 글
| YOLO 객체 검출 학습 - Ultralytics (0) | 2026.08.12 |
|---|---|
| Kaplan-Meier curve (0) | 2025.07.19 |
| bigquery ML 분류 (긍정/부정) - 영어 (1) | 2025.07.13 |
| bigquery ML Titanic (1) | 2025.06.24 |
| [논문 리뷰] RoBERTa: A Robustly Optimized BERT Pretraining Approach (0) | 2024.05.14 |