연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T11. 객체 검출, 다중 객체 추적, 영상 이해
- T11-1.1구조대응
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)
아래 DETR 계열 검출기, VideoMAE, SAM이 모두 이 백본 계보 위에 서 있다. 우리가 트랜스포머 기반 인식기를 쓸 때 계보의 출발점으로 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 트랜스포머는 자연어에서 표준이 됐는데 영상에서는 여전히 CNN이 중심이다. 합성곱 없이 이미지를 다루고 싶다.
핵심 구조
- 이미지를 16x16 조각으로 자른다. 각 조각을 단어처럼 벡터로 바꿔 표준 트랜스포머 인코더에 그대로 넣는다. 합성곱을 쓰지 않는다.
주요 결과
- 큰 데이터로 미리 학습하면 ImageNet, CIFAR-100, VTAB에서 당시 최고 CNN에 맞먹거나 앞선다. 학습에 드는 계산량은 오히려 적었다.
한계
- 데이터가 적으면 CNN보다 못하다. 합성곱이 갖는 지역성 가정이 없어서 대규모 사전학습에 의존한다.
- T11-2.1구조대응
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks
2단계 검출기 기준선이다. 뒤에 나오는 DETR 계열이 무엇을 대체했는지 재는 기준으로 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 2단계 검출기는 후보 영역을 뽑는 단계가 따로 돌아 느리다. 이 병목을 없애고 싶다.
핵심 구조
- 후보 영역 제안망(RPN, 물체가 있을 만한 자리를 먼저 찍는 작은 신경망)을 검출망과 같은 특징을 쓰도록 붙인다. 이미지당 후보 300개만 쓴다.
주요 결과
- PASCAL VOC 2007과 2012, MS COCO에서 당시 최고 정확도. VGG-16 기준 GPU에서 초당 5프레임.
한계
- 실시간에는 못 미친다. 앵커 박스와 NMS(겹친 상자를 지우는 후처리) 같은 수작업 부품이 남는다.
- T11-2.2구조대응
You Only Look Once: Unified, Real-Time Object Detection (YOLO)
실시간 1단계 검출의 출발점이다. RT-DETR이 비교 대상으로 삼는 계열의 원논문이다.
한국어 검토 보기
해결 문제
- 검출을 여러 단계로 쪼개면 느리다. 한 번의 신경망 통과로 끝내고 싶다.
핵심 구조
- 검출을 회귀 문제로 바꾼다. 이미지를 격자로 나누고 각 칸에서 상자 좌표와 클래스 확률을 한 번에 예측한다.
주요 결과
- 기본 모델 초당 45프레임. 경량판 Fast YOLO는 초당 155프레임에 당시 실시간 검출기 평균 정밀도의 두 배. 그림 같은 낯선 화풍에도 일반화가 잘 됐다.
한계
- 작은 물체와 붙어 있는 물체에 약하다. 위치 정확도가 2단계 검출기보다 낮다.
- T11-2.3구조대응
Focal Loss for Dense Object Detection (RetinaNet)
YOLO에서 DETR로 넘어가는 사이의 1단계 검출기 표준 기준선이다. 초점 손실 자체는 불균형이 심한 우리 위험 이벤트 학습에도 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 1단계 검출기는 빠른데 정확도가 2단계 검출기에 못 미친다. 왜 그런지 원인을 밝히고 싶다.
핵심 구조
- 원인을 배경과 물체의 극심한 개수 불균형으로 짚는다. 이미 잘 맞힌 쉬운 예시의 손실 값을 깎아내리는 초점 손실(focal loss)을 제안한다. 이 손실로 학습한 조밀 검출기 RetinaNet을 함께 낸다.
주요 결과
- 속도는 1단계 검출기 수준을 지키면서 정확도는 당시 최고 2단계 검출기와 맞먹었다.
한계
- 앵커 박스와 NMS 후처리는 그대로 남는다. 손실 함수의 조절 값에 성능이 민감하다.
- T11-2.4구조대응
End-to-End Object Detection with Transformers (DETR)
영상 안전 판단의 검출 단계에서 후처리 규칙을 줄이는 구조로 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 기존 검출기는 앵커 박스(미리 정해둔 후보 상자)와 NMS 같은 수작업 부품에 의존한다. 이걸 없애고 싶다.
핵심 구조
- CNN 백본에 트랜스포머 인코더와 디코더를 붙인다. 학습 가능한 객체 질의(object query)를 두고, 이분 매칭 손실로 예측과 정답을 일대일로 붙인다. 후처리가 없다.
주요 결과
- COCO에서 Faster R-CNN과 비슷한 정확도. 파놉틱 분할로도 확장돼 기준선을 넘었다.
한계
- 학습이 오래 걸리고 수렴이 느리다. 작은 물체 정확도가 상대적으로 낮다.
- T11-2.5구조대응
Deformable DETR: Deformable Transformers for End-to-End Object Detection
DETR에서 RT-DETR로 넘어가는 중간 단계다. 실시간 트랜스포머 검출기의 근거를 잇는 고리다.
한국어 검토 보기
해결 문제
- DETR은 수렴이 느리고 작은 물체에 약하다. 전체 화면에 주의를 고르게 뿌리는 구조가 원인이다.
핵심 구조
- 변형 가능한 주의(deformable attention)를 쓴다. 기준점 주변의 소수 표본 지점만 본다. 다중 스케일 특징을 함께 처리한다.
주요 결과
- DETR보다 학습 에폭을 10분의 1로 줄이면서 더 좋은 성능. 특히 작은 물체에서 개선이 컸다.
한계
- 표본 지점 방식이라 구현이 복잡하고 전용 연산자가 필요하다.
- T11-2.6구조대응
DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection
RT-DETR이 비교 기준으로 삼는 DINO-R50이 이 논문이고, Grounding DINO의 이름과 뼈대도 여기서 온다. 두 논문을 읽으려면 이 문헌이 먼저다.
한국어 검토 보기
해결 문제
- DETR 계열은 여전히 학습이 느리고 정확도가 대형 CNN 검출기에 밀린다.
핵심 구조
- 세 가지를 바꾼다. 잡음을 넣어 학습시키되 맞는 예시와 틀린 예시를 대조하는 방식, 앵커 초기값을 섞어 고르는 질의 선택, 상자 예측을 두 번 앞질러 보는 방식이다.
주요 결과
- ResNet-50 기준 12에폭에 COCO AP 49.4, 24에폭에 51.3. SwinL 백본에 Objects365 사전학습을 더하면 COCO val2017에서 63.2, test-dev에서 63.3.
한계
- 학습 절차가 복잡하다. 최고 성능 수치는 대형 백본과 대규모 사전학습에 기댄다.
- T11-3.1구조대응
Simple Online and Realtime Tracking (SORT)
추적 계보의 첫 논문이다. 뒤 논문들이 무엇을 보완했는지 재는 기준선으로 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 검출 결과를 프레임 사이에서 이어 붙여야 한다. 실시간으로 돌아가면서 단순한 방법을 찾고 싶다.
핵심 구조
- 칼만 필터로 다음 위치를 예측하고, 헝가리안 알고리즘으로 검출 상자와 궤적을 IoU 기준으로 붙인다. 외형 정보를 쓰지 않는다.
주요 결과
- 초당 260회 갱신으로 당시 최신 추적기보다 20배 이상 빠르다. 검출기를 바꾸면 추적 성능이 최대 18.9퍼센트 오른다는 점을 짚었다.
한계
- 가림이 생기면 ID가 자주 바뀐다. 외형을 안 보니 비슷한 궤적이 엉킨다.
- T11-3.3구조대응
ByteTrack: Multi-Object Tracking by Associating Every Detection Box
설비 사이에 사람이 가려지는 공장 화면에서 궤적 유지 로직으로 맞대볼 수 있다.
한국어 검토 보기
해결 문제
- 점수가 낮은 검출 상자를 버리면 가려진 사람이 통째로 사라지고 궤적이 끊긴다.
핵심 구조
- 두 단계 매칭이다. 먼저 고점수 상자를 궤적에 붙이고, 남은 궤적에 저점수 상자를 IoU로 다시 붙인다. 별도 재식별 모델 없이 동작한다.
주요 결과
- MOT17 테스트에서 MOTA 80.3, IDF1 77.3, HOTA 63.1. V100 단일 GPU 30 FPS. 기존 추적기 9종에 붙였을 때 IDF1이 1에서 10점 올랐다. 여기 쓰인 지표 정의는 4.1절(MOTA), 4.2절(IDF1), 4.3절(HOTA)에 있다.
한계
- 움직임 예측이 칼만 필터라 카메라가 흔들리거나 물체가 급격히 방향을 바꾸면 약하다.
- T11-4.1구조대응
Evaluating Multiple Object Tracking Performance: The CLEAR MOT Metrics (MOTA, MOTP)
3.3절 ByteTrack의 MOTA 80.3 같은 수치가 바로 이 문헌이 정의한 지표다. MOTA 수치를 쓸 때 붙일 정의 문헌이다.
한국어 검토 보기
해결 문제
- 다중 객체 추적기가 여러 갈래로 쏟아지는데 공통 지표가 없다. 결과를 서로 비교할 수가 없다.
핵심 구조
- 직관적이고 일반적인 지표 두 개를 정의한다. 하나는 위치 추정의 정밀도(MOTP), 다른 하나는 놓침, 오검출, ID 뒤바뀜을 함께 세는 정확도(MOTA)다.
주요 결과
- 2006년과 2007년 국제 CLEAR 평가 두 차례에 실제로 쓰여 여러 추적 과제의 성능을 비교했다.
한계
- 프레임 단위 오류를 더하는 방식이라 궤적을 얼마나 일관되게 유지했는지는 약하게 반영한다. 논문 자체도 장단점을 함께 논의한다.
- T11-4.2구조대응
Performance Measures and a Data Set for Multi-Target, Multi-Camera Tracking (IDF1)
3장 여러 논문이 쓰는 IDF1 수치의 정의 문헌이다. 우리 추적 성능을 IDF1로 보고하려면 이 문헌을 붙여야 한다.
한국어 검토 보기
해결 문제
- 기존 지표는 오류 종류마다 가중치가 들쭉날쭉하다. 카메라 여러 대에서 같은 사람을 같은 ID로 유지했는지를 제대로 못 잰다.
핵심 구조
- 세 가지를 낸다. 첫째, 모든 오류를 똑같이 다루면서 신원 유지에 무게를 두는 정밀도와 재현율 한 쌍(ID precision, ID recall, 이 둘의 조화평균이 IDF1)이다. 둘째, 카메라 8대로 85분 동안 2700명 이상을 찍은 대형 라벨 데이터셋이다. 셋째, 비교 기준이 되는 참조 시스템이다.
주요 결과
- 제안한 지표가 다중 카메라 환경의 신원 유지 성능을 제대로 가려냈다. 참조 시스템은 당시 최고 수준을 냈다.
한계
- 원래 다중 카메라 신원 유지를 겨냥한 지표다. 단일 카메라에 쓰면 궤적 조각화를 세는 방식이 다른 지표와 어긋날 수 있다.
- T11-4.3구조대응
HOTA: A Higher Order Metric for Evaluating Multi-Object Tracking
우리 추적 성능을 수치로 보고할 때 쓰는 현행 표준 지표다. 성능 주장에는 이 지표를 붙여야 한다.
한국어 검토 보기
해결 문제
- 기존 추적 지표는 검출 성능이나 연결 성능 중 한쪽에 치우친다. 사람이 눈으로 보는 좋은 추적과 순위가 어긋난다.
핵심 구조
- 검출 정확도, 연결 정확도, 위치 정확도를 하나의 값으로 균형 있게 합친다. 다섯 가지 기본 오류 유형별 하위 지표로 쪼개 볼 수 있다.
주요 결과
- MOTChallenge 실험에서 기존 지표가 놓치던 성능 측면을 잡아냈다. 사람의 시각적 평가와 더 잘 맞았다.
한계
- 지표 하나로 합치는 과정에서 개별 오류 원인이 가려질 수 있다. 하위 지표를 같이 봐야 한다.
- T11-4.4구조대응
MOT16: A Benchmark for Multi-Object Tracking
3장 추적 성능 수치가 대부분 MOT17 기준인데, MOT17을 따로 다룬 별도 논문은 확인하지 못했다. MOT17 기준 수치를 쓸 때는 이 MOT16 문헌과 6절 MOT20 문헌을 함께 근거로 붙인다.
한국어 검토 보기
해결 문제
- 추적 논문마다 데이터와 라벨 기준이 달라 성능을 나란히 비교할 수 없다.
핵심 구조
- MOTChallenge 벤치마크의 새 판을 낸다. 보행자 추적이 중심이다. 모든 영상을 일관된 규약으로 다시 라벨링하고, 라벨 상자 수를 크게 늘렸다. 객체 종류 구분과 가림 정도(visibility) 표시를 추가했다.
주요 결과
- 라벨 규약과 평가 절차를 통일해 MOTChallenge 계열 비교의 기준을 만들었다.
한계
- 보행자 중심이라 지게차 같은 산업 장비는 대상이 아니다. 조명과 배경도 공장 환경과 다르다.
- T11-5.1구조대응
Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset (I3D)
영상 행동인식의 기준선이자 Kinetics의 출처다. 뒤 논문들의 성능 수치가 모두 이 데이터셋 기준이다.
한국어 검토 보기
해결 문제
- 행동 인식 데이터셋이 작아서 모델 구조를 제대로 비교할 수 없다. 영상용 대규모 사전학습 기반이 없다.
핵심 구조
- Kinetics 데이터셋을 만든다. 행동 400종에 클래스당 클립 400개 이상이다. 이미지넷으로 학습한 2D 필터를 시간축으로 부풀려 3D로 바꾸는 I3D 구조를 제안한다.
주요 결과
- Kinetics 사전학습 후 HMDB-51 80.9퍼센트, UCF-101 98.0퍼센트로 당시 최고를 크게 넘었다.
한계
- 연산량이 크다. 짧은 클립 단위 분류라 긴 맥락을 못 본다.
- T11-6.1구조대응
Learning Transferable Visual Models From Natural Language Supervision (CLIP)
말로 물체를 정의해 찾는 개방어휘 검출의 토대다. Grounding DINO 같은 방식이 여기서 출발한다.
한국어 검토 보기
해결 문제
- 시각 모델은 미리 정한 클래스 목록에 묶인다. 새 개념을 넣으려면 라벨을 새로 모아야 한다.
핵심 구조
- 인터넷에서 모은 이미지와 설명문 4억 쌍으로 학습한다. 이미지 인코더와 텍스트 인코더를 같은 공간에 맞춘다. 클래스 이름을 문장으로 써서 분류한다.
주요 결과
- 컴퓨터비전 데이터셋 30종 이상에서 전이 성능을 확인했다. ImageNet은 학습 예시를 하나도 안 쓰고 ResNet-50과 같은 수준을 냈다.
한계
- 세밀한 구분, 개수 세기, 추상 과제에 약하다. 학습 데이터의 편향을 그대로 물려받는다.
- T11-6.2구조대응
Segment Anything (SAM)
SAM 2의 원본이다. 픽셀 단위 영역 판정을 쓰려면 이 원논문의 한계부터 봐야 한다.
한국어 검토 보기
해결 문제
- 분할 모델은 과제마다 새로 학습해야 한다. 한 모델로 아무 물체나 잘라내게 하고 싶다.
핵심 구조
- 점, 상자, 대략적 마스크 같은 힌트를 받으면 마스크를 내주는 촉발형 분할 모델이다. 데이터 엔진을 돌려 이미지 1100만 장에서 마스크 10억 개 이상을 모은 SA-1B를 만들었다.
주요 결과
- 학습에 없던 이미지 분포와 과제에서도 제로샷으로 동작한다. 종종 기존 지도학습 모델을 넘어섰다.
한계
- 정지 이미지 전용이라 시간축이 없다. 마스크에 의미 라벨이 붙지 않는다. 모델이 무겁다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기