연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T11. 객체 검출, 다중 객체 추적, 영상 이해

  1. T11-6.3후보2025년 이후

    SAM 2: Segment Anything in Images and Videos

    저자
    Nikhila Ravi 외 17인 (Meta FAIR)
    연도
    arXiv 2024, 발표: ICLR 2025

    위험 구역 경계와 사람 영역을 픽셀 단위로 나눠 침입 여부를 판정하는 데 적용 후보다.

    한국어 검토 보기
    해결 문제
    • 이미지 분할 기반 모델을 영상으로 넓히고, 프레임 사이에서 같은 대상을 계속 따라가게 하고 싶다.
    핵심 구조
    • 스트리밍 메모리를 붙인 단순 트랜스포머다. 앞 프레임의 결과를 메모리에 넣어 다음 프레임 분할에 쓴다. 사람이 클릭으로 교정하면 바로 반영한다.
    주요 결과
    • 영상 분할에서 기존 방법 대비 상호작용 횟수 3분의 1로 더 높은 정확도. 이미지 분할은 SAM보다 정확하고 6배 빠르다.
    한계
    • 여러 물체가 비슷하게 생기면 섞인다. 장면이 확 바뀌면 메모리가 오염된다. 모델이 무겁다.
  2. T11-2.7후보

    DETRs Beat YOLOs on Real-time Object Detection (RT-DETR)

    저자
    Yian Zhao, Wenyu Lv, Shangliang Xu, Jinman Wei, Guanzhong Wang, Qingqing Dang, Yi Liu, Jie Chen
    연도
    arXiv 2023, 발표: CVPR 2024 (16965-16974)

    현장 카메라 실시간 검출 엔진 교체 후보다.

    한국어 검토 보기
    해결 문제
    • YOLO 계열은 NMS 후처리 때문에 속도와 정확도가 같이 흔들린다. 실시간에서 후처리 없는 검출기를 만들고 싶다.
    핵심 구조
    • 효율적 하이브리드 인코더로 다중 스케일 특징을 처리한다. 불확실성이 가장 낮은 질의를 고르는 방식으로 초기 질의를 뽑는다. 디코더 층 수를 바꿔 재학습 없이 속도를 조절한다.
    주요 결과
    • RT-DETR-R50이 COCO AP 53.1퍼센트에 T4 GPU 108 FPS, R101이 54.3퍼센트에 74 FPS.
    한계
    • 학습 비용과 메모리 요구가 CNN 검출기보다 크다. 저사양 엣지 장비에서는 그대로 쓰기 어렵다.
  3. T11-2.8후보

    Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

    저자
    Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, Lei Zhang
    연도
    arXiv 2023, 발표: ECCV 2024 (38-55)

    안전모 미착용, 지게차 접근처럼 학습 데이터가 적은 새 위험 항목을 말로 정의해 잡는 데 후보다.

    한국어 검토 보기
    해결 문제
    • 검출기는 미리 정한 클래스만 찾는다. 사람이 말로 지시한 임의의 물체를 찾게 하고 싶다.
    핵심 구조
    • 2.6절 DINO 검출기에 언어를 밀착 결합한다. 특징 강화기, 언어가 이끄는 질의 선택, 교차 모달 디코더 세 부분을 둔다.
    주요 결과
    • COCO 제로샷 전이에서 52.5 AP. ODinW 제로샷 벤치마크 평균 26.1 AP로 당시 최고.
    한계
    • 추론이 무겁고 실시간에 부담이다. 문장 표현에 따라 결과가 흔들린다.
  4. T11-2.9후보

    YOLOv10: Real-Time End-to-End Object Detection

    저자
    Ao Wang, Hui Chen, Lihao Liu, Kai Chen, Zijia Lin, Jungong Han, Guiguang Ding
    연도
    arXiv 2024년 5월 공개, 발표: NeurIPS 2024

    2.7절 RT-DETR의 "NMS 때문에 YOLO가 느리다"는 주장에 대한 반대편 최신 근거다. 저사양 엣지 장비용 실시간 검출기 후보로 RT-DETR과 나란히 놓고 봐야 한다.

    한국어 검토 보기
    해결 문제
    • YOLO 계열이 NMS 후처리에 묶여 있다는 지적이 있다. CNN 검출기 쪽에서 후처리 없이 끝까지 한 번에 가는 방법을 찾고 싶다.
    핵심 구조
    • 학습할 때 정답 배정을 두 갈래로 두고 둘을 일치시킨다(consistent dual assignments). 그래서 추론에서 NMS가 필요 없다. 여기에 속도와 정확도를 함께 보는 모델 설계를 더한다.
    주요 결과
    • YOLOv10-S가 RT-DETR-R18과 비슷한 정확도에서 1.8배 빠르고 파라미터와 연산량은 2.8배 작다. YOLOv10-B는 YOLOv9-C 대비 지연 46퍼센트, 파라미터 25퍼센트 감소.
    한계
    • 개방어휘 검출은 안 된다. 정해둔 클래스만 찾는다.
  5. T11-3.4후보

    Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking (OC-SORT)

    저자
    Jinkun Cao, Jiangmiao Pang, Xinshuo Weng, Rawal Khirodkar, Kris Kitani
    연도
    arXiv 2022, 발표: CVPR 2023 (9686-9696)

    ByteTrack 다음 세대 추적기다. 사람이 방향을 급하게 바꾸는 작업 현장에 적용 후보다.

    한국어 검토 보기
    해결 문제
    • 칼만 필터는 가림 구간에서 예측 오차가 계속 쌓인다. 물체가 직선으로 안 움직이면 궤적이 무너진다.
    핵심 구조
    • 가림이 끝난 뒤 실제 검출값을 이어 가상의 궤적을 되그린다. 그 궤적으로 필터 상태를 되살린다. 움직임 방향까지 매칭에 넣는다.
    주요 결과
    • MOT17, MOT20, KITTI, 머리 추적, 특히 DanceTrack에서 당시 최고 수준. CPU 한 개로 초당 700프레임 이상.
    한계
    • 검출기 품질에 여전히 크게 의존한다. 여러 사람이 겹쳐 오래 가려지면 되그린 궤적이 틀릴 수 있다.
  6. T11-5.3후보

    VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training

    저자
    Zhan Tong, Yibing Song, Jue Wang, Limin Wang
    연도
    arXiv 2022, 발표: NeurIPS 2022 (arXiv 페이지 코멘트에 카메라레디로 명시)

    라벨이 거의 없는 공장 CCTV를 자기지도로 미리 학습시키는 방식의 후보다.

    한국어 검토 보기
    해결 문제
    • 영상 트랜스포머는 초대형 데이터로 사전학습해야 한다. 현장 데이터가 적으면 못 쓴다.
    핵심 구조
    • 영상을 튜브 단위로 가리고 복원하는 자기지도 학습이다. 가림 비율을 90에서 95퍼센트까지 극단적으로 올린다.
    주요 결과
    • 추가 데이터 없이 Kinetics-400 87.4퍼센트, Something-Something V2 75.4퍼센트, UCF101 91.3퍼센트, HMDB51 62.6퍼센트. 3천에서 4천 편 수준의 작은 데이터에서도 동작.
    한계
    • 사전학습 연산량이 크다. 사전학습 도메인과 현장 도메인이 다르면 성능이 떨어진다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기