연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T11. 객체 검출, 다중 객체 추적, 영상 이해

  1. T11-1.1구조대응

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)

    저자
    Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 외 9인 (총 12인)
    연도
    arXiv 2020년 10월 공개, 발표: ICLR 2021

    아래 DETR 계열 검출기, VideoMAE, SAM이 모두 이 백본 계보 위에 서 있다. 우리가 트랜스포머 기반 인식기를 쓸 때 계보의 출발점으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 트랜스포머는 자연어에서 표준이 됐는데 영상에서는 여전히 CNN이 중심이다. 합성곱 없이 이미지를 다루고 싶다.
    핵심 구조
    • 이미지를 16x16 조각으로 자른다. 각 조각을 단어처럼 벡터로 바꿔 표준 트랜스포머 인코더에 그대로 넣는다. 합성곱을 쓰지 않는다.
    주요 결과
    • 큰 데이터로 미리 학습하면 ImageNet, CIFAR-100, VTAB에서 당시 최고 CNN에 맞먹거나 앞선다. 학습에 드는 계산량은 오히려 적었다.
    한계
    • 데이터가 적으면 CNN보다 못하다. 합성곱이 갖는 지역성 가정이 없어서 대규모 사전학습에 의존한다.
  2. T11-2.1구조대응

    Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks

    저자
    Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun
    연도
    arXiv 2015, 발표: NIPS 2015, 확장판 IEEE TPAMI 2017 (39권 6호, 1137-1149)

    2단계 검출기 기준선이다. 뒤에 나오는 DETR 계열이 무엇을 대체했는지 재는 기준으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 2단계 검출기는 후보 영역을 뽑는 단계가 따로 돌아 느리다. 이 병목을 없애고 싶다.
    핵심 구조
    • 후보 영역 제안망(RPN, 물체가 있을 만한 자리를 먼저 찍는 작은 신경망)을 검출망과 같은 특징을 쓰도록 붙인다. 이미지당 후보 300개만 쓴다.
    주요 결과
    • PASCAL VOC 2007과 2012, MS COCO에서 당시 최고 정확도. VGG-16 기준 GPU에서 초당 5프레임.
    한계
    • 실시간에는 못 미친다. 앵커 박스와 NMS(겹친 상자를 지우는 후처리) 같은 수작업 부품이 남는다.
  3. T11-2.2구조대응

    You Only Look Once: Unified, Real-Time Object Detection (YOLO)

    저자
    Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi
    연도
    arXiv 2015, 발표: CVPR 2016 (779-788)

    실시간 1단계 검출의 출발점이다. RT-DETR이 비교 대상으로 삼는 계열의 원논문이다.

    한국어 검토 보기
    해결 문제
    • 검출을 여러 단계로 쪼개면 느리다. 한 번의 신경망 통과로 끝내고 싶다.
    핵심 구조
    • 검출을 회귀 문제로 바꾼다. 이미지를 격자로 나누고 각 칸에서 상자 좌표와 클래스 확률을 한 번에 예측한다.
    주요 결과
    • 기본 모델 초당 45프레임. 경량판 Fast YOLO는 초당 155프레임에 당시 실시간 검출기 평균 정밀도의 두 배. 그림 같은 낯선 화풍에도 일반화가 잘 됐다.
    한계
    • 작은 물체와 붙어 있는 물체에 약하다. 위치 정확도가 2단계 검출기보다 낮다.
  4. T11-2.3구조대응

    Focal Loss for Dense Object Detection (RetinaNet)

    저자
    Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, Piotr Dollar
    연도
    arXiv 2017년 8월 공개, 발표: ICCV 2017 (2999-3007)

    YOLO에서 DETR로 넘어가는 사이의 1단계 검출기 표준 기준선이다. 초점 손실 자체는 불균형이 심한 우리 위험 이벤트 학습에도 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 1단계 검출기는 빠른데 정확도가 2단계 검출기에 못 미친다. 왜 그런지 원인을 밝히고 싶다.
    핵심 구조
    • 원인을 배경과 물체의 극심한 개수 불균형으로 짚는다. 이미 잘 맞힌 쉬운 예시의 손실 값을 깎아내리는 초점 손실(focal loss)을 제안한다. 이 손실로 학습한 조밀 검출기 RetinaNet을 함께 낸다.
    주요 결과
    • 속도는 1단계 검출기 수준을 지키면서 정확도는 당시 최고 2단계 검출기와 맞먹었다.
    한계
    • 앵커 박스와 NMS 후처리는 그대로 남는다. 손실 함수의 조절 값에 성능이 민감하다.
  5. T11-2.4구조대응

    End-to-End Object Detection with Transformers (DETR)

    저자
    Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, Sergey Zagoruyko
    연도
    arXiv 2020, 발표: ECCV 2020

    영상 안전 판단의 검출 단계에서 후처리 규칙을 줄이는 구조로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 기존 검출기는 앵커 박스(미리 정해둔 후보 상자)와 NMS 같은 수작업 부품에 의존한다. 이걸 없애고 싶다.
    핵심 구조
    • CNN 백본에 트랜스포머 인코더와 디코더를 붙인다. 학습 가능한 객체 질의(object query)를 두고, 이분 매칭 손실로 예측과 정답을 일대일로 붙인다. 후처리가 없다.
    주요 결과
    • COCO에서 Faster R-CNN과 비슷한 정확도. 파놉틱 분할로도 확장돼 기준선을 넘었다.
    한계
    • 학습이 오래 걸리고 수렴이 느리다. 작은 물체 정확도가 상대적으로 낮다.
  6. T11-2.5구조대응

    Deformable DETR: Deformable Transformers for End-to-End Object Detection

    저자
    Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai
    연도
    arXiv 2020, 발표: ICLR 2021 (구두 발표)

    DETR에서 RT-DETR로 넘어가는 중간 단계다. 실시간 트랜스포머 검출기의 근거를 잇는 고리다.

    한국어 검토 보기
    해결 문제
    • DETR은 수렴이 느리고 작은 물체에 약하다. 전체 화면에 주의를 고르게 뿌리는 구조가 원인이다.
    핵심 구조
    • 변형 가능한 주의(deformable attention)를 쓴다. 기준점 주변의 소수 표본 지점만 본다. 다중 스케일 특징을 함께 처리한다.
    주요 결과
    • DETR보다 학습 에폭을 10분의 1로 줄이면서 더 좋은 성능. 특히 작은 물체에서 개선이 컸다.
    한계
    • 표본 지점 방식이라 구현이 복잡하고 전용 연산자가 필요하다.
  7. T11-2.6구조대응

    DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

    저자
    Hao Zhang, Feng Li, Shilong Liu, Lei Zhang, Hang Su, Jun Zhu, Lionel M. Ni, Heung-Yeung Shum
    연도
    arXiv 2022년 3월 공개, 발표: ICLR 2023

    RT-DETR이 비교 기준으로 삼는 DINO-R50이 이 논문이고, Grounding DINO의 이름과 뼈대도 여기서 온다. 두 논문을 읽으려면 이 문헌이 먼저다.

    한국어 검토 보기
    해결 문제
    • DETR 계열은 여전히 학습이 느리고 정확도가 대형 CNN 검출기에 밀린다.
    핵심 구조
    • 세 가지를 바꾼다. 잡음을 넣어 학습시키되 맞는 예시와 틀린 예시를 대조하는 방식, 앵커 초기값을 섞어 고르는 질의 선택, 상자 예측을 두 번 앞질러 보는 방식이다.
    주요 결과
    • ResNet-50 기준 12에폭에 COCO AP 49.4, 24에폭에 51.3. SwinL 백본에 Objects365 사전학습을 더하면 COCO val2017에서 63.2, test-dev에서 63.3.
    한계
    • 학습 절차가 복잡하다. 최고 성능 수치는 대형 백본과 대규모 사전학습에 기댄다.
  8. T11-3.1구조대응

    Simple Online and Realtime Tracking (SORT)

    저자
    Alex Bewley, Zongyuan Ge, Lionel Ott, Fabio Ramos, Ben Upcroft
    연도
    arXiv 2016, 발표: IEEE ICIP 2016 (3464-3468)

    추적 계보의 첫 논문이다. 뒤 논문들이 무엇을 보완했는지 재는 기준선으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 검출 결과를 프레임 사이에서 이어 붙여야 한다. 실시간으로 돌아가면서 단순한 방법을 찾고 싶다.
    핵심 구조
    • 칼만 필터로 다음 위치를 예측하고, 헝가리안 알고리즘으로 검출 상자와 궤적을 IoU 기준으로 붙인다. 외형 정보를 쓰지 않는다.
    주요 결과
    • 초당 260회 갱신으로 당시 최신 추적기보다 20배 이상 빠르다. 검출기를 바꾸면 추적 성능이 최대 18.9퍼센트 오른다는 점을 짚었다.
    한계
    • 가림이 생기면 ID가 자주 바뀐다. 외형을 안 보니 비슷한 궤적이 엉킨다.
  9. T11-3.3구조대응

    ByteTrack: Multi-Object Tracking by Associating Every Detection Box

    저자
    Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang
    연도
    arXiv 2021, 발표: ECCV 2022

    설비 사이에 사람이 가려지는 공장 화면에서 궤적 유지 로직으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 점수가 낮은 검출 상자를 버리면 가려진 사람이 통째로 사라지고 궤적이 끊긴다.
    핵심 구조
    • 두 단계 매칭이다. 먼저 고점수 상자를 궤적에 붙이고, 남은 궤적에 저점수 상자를 IoU로 다시 붙인다. 별도 재식별 모델 없이 동작한다.
    주요 결과
    • MOT17 테스트에서 MOTA 80.3, IDF1 77.3, HOTA 63.1. V100 단일 GPU 30 FPS. 기존 추적기 9종에 붙였을 때 IDF1이 1에서 10점 올랐다. 여기 쓰인 지표 정의는 4.1절(MOTA), 4.2절(IDF1), 4.3절(HOTA)에 있다.
    한계
    • 움직임 예측이 칼만 필터라 카메라가 흔들리거나 물체가 급격히 방향을 바꾸면 약하다.
  10. T11-4.1구조대응

    Evaluating Multiple Object Tracking Performance: The CLEAR MOT Metrics (MOTA, MOTP)

    저자
    Keni Bernardin, Rainer Stiefelhagen
    연도
    2008

    3.3절 ByteTrack의 MOTA 80.3 같은 수치가 바로 이 문헌이 정의한 지표다. MOTA 수치를 쓸 때 붙일 정의 문헌이다.

    한국어 검토 보기
    해결 문제
    • 다중 객체 추적기가 여러 갈래로 쏟아지는데 공통 지표가 없다. 결과를 서로 비교할 수가 없다.
    핵심 구조
    • 직관적이고 일반적인 지표 두 개를 정의한다. 하나는 위치 추정의 정밀도(MOTP), 다른 하나는 놓침, 오검출, ID 뒤바뀜을 함께 세는 정확도(MOTA)다.
    주요 결과
    • 2006년과 2007년 국제 CLEAR 평가 두 차례에 실제로 쓰여 여러 추적 과제의 성능을 비교했다.
    한계
    • 프레임 단위 오류를 더하는 방식이라 궤적을 얼마나 일관되게 유지했는지는 약하게 반영한다. 논문 자체도 장단점을 함께 논의한다.
  11. T11-4.2구조대응

    Performance Measures and a Data Set for Multi-Target, Multi-Camera Tracking (IDF1)

    저자
    Ergys Ristani, Francesco Solera, Roger S. Zou, Rita Cucchiara, Carlo Tomasi
    연도
    arXiv 2016년 9월 공개, 발표: ECCV 2016 워크숍 (17-35)

    3장 여러 논문이 쓰는 IDF1 수치의 정의 문헌이다. 우리 추적 성능을 IDF1로 보고하려면 이 문헌을 붙여야 한다.

    한국어 검토 보기
    해결 문제
    • 기존 지표는 오류 종류마다 가중치가 들쭉날쭉하다. 카메라 여러 대에서 같은 사람을 같은 ID로 유지했는지를 제대로 못 잰다.
    핵심 구조
    • 세 가지를 낸다. 첫째, 모든 오류를 똑같이 다루면서 신원 유지에 무게를 두는 정밀도와 재현율 한 쌍(ID precision, ID recall, 이 둘의 조화평균이 IDF1)이다. 둘째, 카메라 8대로 85분 동안 2700명 이상을 찍은 대형 라벨 데이터셋이다. 셋째, 비교 기준이 되는 참조 시스템이다.
    주요 결과
    • 제안한 지표가 다중 카메라 환경의 신원 유지 성능을 제대로 가려냈다. 참조 시스템은 당시 최고 수준을 냈다.
    한계
    • 원래 다중 카메라 신원 유지를 겨냥한 지표다. 단일 카메라에 쓰면 궤적 조각화를 세는 방식이 다른 지표와 어긋날 수 있다.
  12. T11-4.3구조대응

    HOTA: A Higher Order Metric for Evaluating Multi-Object Tracking

    저자
    Jonathon Luiten, Aljosa Osep, Patrick Dendorfer, Philip Torr, Andreas Geiger, Laura Leal-Taixe, Bastian Leibe
    연도
    arXiv 2020, 발표: International Journal of Computer Vision 2021 (129권 2호, 548-578)

    우리 추적 성능을 수치로 보고할 때 쓰는 현행 표준 지표다. 성능 주장에는 이 지표를 붙여야 한다.

    한국어 검토 보기
    해결 문제
    • 기존 추적 지표는 검출 성능이나 연결 성능 중 한쪽에 치우친다. 사람이 눈으로 보는 좋은 추적과 순위가 어긋난다.
    핵심 구조
    • 검출 정확도, 연결 정확도, 위치 정확도를 하나의 값으로 균형 있게 합친다. 다섯 가지 기본 오류 유형별 하위 지표로 쪼개 볼 수 있다.
    주요 결과
    • MOTChallenge 실험에서 기존 지표가 놓치던 성능 측면을 잡아냈다. 사람의 시각적 평가와 더 잘 맞았다.
    한계
    • 지표 하나로 합치는 과정에서 개별 오류 원인이 가려질 수 있다. 하위 지표를 같이 봐야 한다.
  13. T11-4.4구조대응

    MOT16: A Benchmark for Multi-Object Tracking

    저자
    Anton Milan, Laura Leal-Taixe, Ian Reid, Stefan Roth, Konrad Schindler
    연도
    arXiv 2016년 3월 공개 (정식 학회 게재는 확인되지 않음)

    3장 추적 성능 수치가 대부분 MOT17 기준인데, MOT17을 따로 다룬 별도 논문은 확인하지 못했다. MOT17 기준 수치를 쓸 때는 이 MOT16 문헌과 6절 MOT20 문헌을 함께 근거로 붙인다.

    한국어 검토 보기
    해결 문제
    • 추적 논문마다 데이터와 라벨 기준이 달라 성능을 나란히 비교할 수 없다.
    핵심 구조
    • MOTChallenge 벤치마크의 새 판을 낸다. 보행자 추적이 중심이다. 모든 영상을 일관된 규약으로 다시 라벨링하고, 라벨 상자 수를 크게 늘렸다. 객체 종류 구분과 가림 정도(visibility) 표시를 추가했다.
    주요 결과
    • 라벨 규약과 평가 절차를 통일해 MOTChallenge 계열 비교의 기준을 만들었다.
    한계
    • 보행자 중심이라 지게차 같은 산업 장비는 대상이 아니다. 조명과 배경도 공장 환경과 다르다.
  14. T11-5.1구조대응

    Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset (I3D)

    저자
    Joao Carreira, Andrew Zisserman
    연도
    arXiv 2017, 발표: CVPR 2017 (4724-4733)

    영상 행동인식의 기준선이자 Kinetics의 출처다. 뒤 논문들의 성능 수치가 모두 이 데이터셋 기준이다.

    한국어 검토 보기
    해결 문제
    • 행동 인식 데이터셋이 작아서 모델 구조를 제대로 비교할 수 없다. 영상용 대규모 사전학습 기반이 없다.
    핵심 구조
    • Kinetics 데이터셋을 만든다. 행동 400종에 클래스당 클립 400개 이상이다. 이미지넷으로 학습한 2D 필터를 시간축으로 부풀려 3D로 바꾸는 I3D 구조를 제안한다.
    주요 결과
    • Kinetics 사전학습 후 HMDB-51 80.9퍼센트, UCF-101 98.0퍼센트로 당시 최고를 크게 넘었다.
    한계
    • 연산량이 크다. 짧은 클립 단위 분류라 긴 맥락을 못 본다.
  15. T11-6.1구조대응

    Learning Transferable Visual Models From Natural Language Supervision (CLIP)

    저자
    Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh 외 7인
    연도
    arXiv 2021, 발표: ICML 2021 (8748-8763)

    말로 물체를 정의해 찾는 개방어휘 검출의 토대다. Grounding DINO 같은 방식이 여기서 출발한다.

    한국어 검토 보기
    해결 문제
    • 시각 모델은 미리 정한 클래스 목록에 묶인다. 새 개념을 넣으려면 라벨을 새로 모아야 한다.
    핵심 구조
    • 인터넷에서 모은 이미지와 설명문 4억 쌍으로 학습한다. 이미지 인코더와 텍스트 인코더를 같은 공간에 맞춘다. 클래스 이름을 문장으로 써서 분류한다.
    주요 결과
    • 컴퓨터비전 데이터셋 30종 이상에서 전이 성능을 확인했다. ImageNet은 학습 예시를 하나도 안 쓰고 ResNet-50과 같은 수준을 냈다.
    한계
    • 세밀한 구분, 개수 세기, 추상 과제에 약하다. 학습 데이터의 편향을 그대로 물려받는다.
  16. T11-6.2구조대응

    Segment Anything (SAM)

    저자
    Alexander Kirillov, Eric Mintun, Nikhila Ravi 외 9인 (총 12인, Meta AI Research)
    연도
    arXiv 2023, 발표: ICCV 2023 (3992-4003)

    SAM 2의 원본이다. 픽셀 단위 영역 판정을 쓰려면 이 원논문의 한계부터 봐야 한다.

    한국어 검토 보기
    해결 문제
    • 분할 모델은 과제마다 새로 학습해야 한다. 한 모델로 아무 물체나 잘라내게 하고 싶다.
    핵심 구조
    • 점, 상자, 대략적 마스크 같은 힌트를 받으면 마스크를 내주는 촉발형 분할 모델이다. 데이터 엔진을 돌려 이미지 1100만 장에서 마스크 10억 개 이상을 모은 SA-1B를 만들었다.
    주요 결과
    • 학습에 없던 이미지 분포와 과제에서도 제로샷으로 동작한다. 종종 기존 지도학습 모델을 넘어섰다.
    한계
    • 정지 이미지 전용이라 시간축이 없다. 마스크에 의미 라벨이 붙지 않는다. 모델이 무겁다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기