연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T11. 객체 검출, 다중 객체 추적, 영상 이해

  1. T11-6.3후보2025년 이후

    SAM 2: Segment Anything in Images and Videos

    저자
    Nikhila Ravi 외 17인 (Meta FAIR)
    연도
    arXiv 2024, 발표: ICLR 2025

    위험 구역 경계와 사람 영역을 픽셀 단위로 나눠 침입 여부를 판정하는 데 적용 후보다.

    한국어 검토 보기
    해결 문제
    • 이미지 분할 기반 모델을 영상으로 넓히고, 프레임 사이에서 같은 대상을 계속 따라가게 하고 싶다.
    핵심 구조
    • 스트리밍 메모리를 붙인 단순 트랜스포머다. 앞 프레임의 결과를 메모리에 넣어 다음 프레임 분할에 쓴다. 사람이 클릭으로 교정하면 바로 반영한다.
    주요 결과
    • 영상 분할에서 기존 방법 대비 상호작용 횟수 3분의 1로 더 높은 정확도. 이미지 분할은 SAM보다 정확하고 6배 빠르다.
    한계
    • 여러 물체가 비슷하게 생기면 섞인다. 장면이 확 바뀌면 메모리가 오염된다. 모델이 무겁다.
  2. T11-1.1구조대응

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)

    저자
    Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 외 9인 (총 12인)
    연도
    arXiv 2020년 10월 공개, 발표: ICLR 2021

    아래 DETR 계열 검출기, VideoMAE, SAM이 모두 이 백본 계보 위에 서 있다. 우리가 트랜스포머 기반 인식기를 쓸 때 계보의 출발점으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 트랜스포머는 자연어에서 표준이 됐는데 영상에서는 여전히 CNN이 중심이다. 합성곱 없이 이미지를 다루고 싶다.
    핵심 구조
    • 이미지를 16x16 조각으로 자른다. 각 조각을 단어처럼 벡터로 바꿔 표준 트랜스포머 인코더에 그대로 넣는다. 합성곱을 쓰지 않는다.
    주요 결과
    • 큰 데이터로 미리 학습하면 ImageNet, CIFAR-100, VTAB에서 당시 최고 CNN에 맞먹거나 앞선다. 학습에 드는 계산량은 오히려 적었다.
    한계
    • 데이터가 적으면 CNN보다 못하다. 합성곱이 갖는 지역성 가정이 없어서 대규모 사전학습에 의존한다.
  3. T11-2.1구조대응

    Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks

    저자
    Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun
    연도
    arXiv 2015, 발표: NIPS 2015, 확장판 IEEE TPAMI 2017 (39권 6호, 1137-1149)

    2단계 검출기 기준선이다. 뒤에 나오는 DETR 계열이 무엇을 대체했는지 재는 기준으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 2단계 검출기는 후보 영역을 뽑는 단계가 따로 돌아 느리다. 이 병목을 없애고 싶다.
    핵심 구조
    • 후보 영역 제안망(RPN, 물체가 있을 만한 자리를 먼저 찍는 작은 신경망)을 검출망과 같은 특징을 쓰도록 붙인다. 이미지당 후보 300개만 쓴다.
    주요 결과
    • PASCAL VOC 2007과 2012, MS COCO에서 당시 최고 정확도. VGG-16 기준 GPU에서 초당 5프레임.
    한계
    • 실시간에는 못 미친다. 앵커 박스와 NMS(겹친 상자를 지우는 후처리) 같은 수작업 부품이 남는다.
  4. T11-2.2구조대응

    You Only Look Once: Unified, Real-Time Object Detection (YOLO)

    저자
    Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi
    연도
    arXiv 2015, 발표: CVPR 2016 (779-788)

    실시간 1단계 검출의 출발점이다. RT-DETR이 비교 대상으로 삼는 계열의 원논문이다.

    한국어 검토 보기
    해결 문제
    • 검출을 여러 단계로 쪼개면 느리다. 한 번의 신경망 통과로 끝내고 싶다.
    핵심 구조
    • 검출을 회귀 문제로 바꾼다. 이미지를 격자로 나누고 각 칸에서 상자 좌표와 클래스 확률을 한 번에 예측한다.
    주요 결과
    • 기본 모델 초당 45프레임. 경량판 Fast YOLO는 초당 155프레임에 당시 실시간 검출기 평균 정밀도의 두 배. 그림 같은 낯선 화풍에도 일반화가 잘 됐다.
    한계
    • 작은 물체와 붙어 있는 물체에 약하다. 위치 정확도가 2단계 검출기보다 낮다.
  5. T11-2.3구조대응

    Focal Loss for Dense Object Detection (RetinaNet)

    저자
    Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, Piotr Dollar
    연도
    arXiv 2017년 8월 공개, 발표: ICCV 2017 (2999-3007)

    YOLO에서 DETR로 넘어가는 사이의 1단계 검출기 표준 기준선이다. 초점 손실 자체는 불균형이 심한 우리 위험 이벤트 학습에도 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 1단계 검출기는 빠른데 정확도가 2단계 검출기에 못 미친다. 왜 그런지 원인을 밝히고 싶다.
    핵심 구조
    • 원인을 배경과 물체의 극심한 개수 불균형으로 짚는다. 이미 잘 맞힌 쉬운 예시의 손실 값을 깎아내리는 초점 손실(focal loss)을 제안한다. 이 손실로 학습한 조밀 검출기 RetinaNet을 함께 낸다.
    주요 결과
    • 속도는 1단계 검출기 수준을 지키면서 정확도는 당시 최고 2단계 검출기와 맞먹었다.
    한계
    • 앵커 박스와 NMS 후처리는 그대로 남는다. 손실 함수의 조절 값에 성능이 민감하다.
  6. T11-2.4구조대응

    End-to-End Object Detection with Transformers (DETR)

    저자
    Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, Sergey Zagoruyko
    연도
    arXiv 2020, 발표: ECCV 2020

    영상 안전 판단의 검출 단계에서 후처리 규칙을 줄이는 구조로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 기존 검출기는 앵커 박스(미리 정해둔 후보 상자)와 NMS 같은 수작업 부품에 의존한다. 이걸 없애고 싶다.
    핵심 구조
    • CNN 백본에 트랜스포머 인코더와 디코더를 붙인다. 학습 가능한 객체 질의(object query)를 두고, 이분 매칭 손실로 예측과 정답을 일대일로 붙인다. 후처리가 없다.
    주요 결과
    • COCO에서 Faster R-CNN과 비슷한 정확도. 파놉틱 분할로도 확장돼 기준선을 넘었다.
    한계
    • 학습이 오래 걸리고 수렴이 느리다. 작은 물체 정확도가 상대적으로 낮다.
  7. T11-2.5구조대응

    Deformable DETR: Deformable Transformers for End-to-End Object Detection

    저자
    Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai
    연도
    arXiv 2020, 발표: ICLR 2021 (구두 발표)

    DETR에서 RT-DETR로 넘어가는 중간 단계다. 실시간 트랜스포머 검출기의 근거를 잇는 고리다.

    한국어 검토 보기
    해결 문제
    • DETR은 수렴이 느리고 작은 물체에 약하다. 전체 화면에 주의를 고르게 뿌리는 구조가 원인이다.
    핵심 구조
    • 변형 가능한 주의(deformable attention)를 쓴다. 기준점 주변의 소수 표본 지점만 본다. 다중 스케일 특징을 함께 처리한다.
    주요 결과
    • DETR보다 학습 에폭을 10분의 1로 줄이면서 더 좋은 성능. 특히 작은 물체에서 개선이 컸다.
    한계
    • 표본 지점 방식이라 구현이 복잡하고 전용 연산자가 필요하다.
  8. T11-2.6구조대응

    DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

    저자
    Hao Zhang, Feng Li, Shilong Liu, Lei Zhang, Hang Su, Jun Zhu, Lionel M. Ni, Heung-Yeung Shum
    연도
    arXiv 2022년 3월 공개, 발표: ICLR 2023

    RT-DETR이 비교 기준으로 삼는 DINO-R50이 이 논문이고, Grounding DINO의 이름과 뼈대도 여기서 온다. 두 논문을 읽으려면 이 문헌이 먼저다.

    한국어 검토 보기
    해결 문제
    • DETR 계열은 여전히 학습이 느리고 정확도가 대형 CNN 검출기에 밀린다.
    핵심 구조
    • 세 가지를 바꾼다. 잡음을 넣어 학습시키되 맞는 예시와 틀린 예시를 대조하는 방식, 앵커 초기값을 섞어 고르는 질의 선택, 상자 예측을 두 번 앞질러 보는 방식이다.
    주요 결과
    • ResNet-50 기준 12에폭에 COCO AP 49.4, 24에폭에 51.3. SwinL 백본에 Objects365 사전학습을 더하면 COCO val2017에서 63.2, test-dev에서 63.3.
    한계
    • 학습 절차가 복잡하다. 최고 성능 수치는 대형 백본과 대규모 사전학습에 기댄다.
  9. T11-2.7후보

    DETRs Beat YOLOs on Real-time Object Detection (RT-DETR)

    저자
    Yian Zhao, Wenyu Lv, Shangliang Xu, Jinman Wei, Guanzhong Wang, Qingqing Dang, Yi Liu, Jie Chen
    연도
    arXiv 2023, 발표: CVPR 2024 (16965-16974)

    현장 카메라 실시간 검출 엔진 교체 후보다.

    한국어 검토 보기
    해결 문제
    • YOLO 계열은 NMS 후처리 때문에 속도와 정확도가 같이 흔들린다. 실시간에서 후처리 없는 검출기를 만들고 싶다.
    핵심 구조
    • 효율적 하이브리드 인코더로 다중 스케일 특징을 처리한다. 불확실성이 가장 낮은 질의를 고르는 방식으로 초기 질의를 뽑는다. 디코더 층 수를 바꿔 재학습 없이 속도를 조절한다.
    주요 결과
    • RT-DETR-R50이 COCO AP 53.1퍼센트에 T4 GPU 108 FPS, R101이 54.3퍼센트에 74 FPS.
    한계
    • 학습 비용과 메모리 요구가 CNN 검출기보다 크다. 저사양 엣지 장비에서는 그대로 쓰기 어렵다.
  10. T11-2.8후보

    Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

    저자
    Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, Lei Zhang
    연도
    arXiv 2023, 발표: ECCV 2024 (38-55)

    안전모 미착용, 지게차 접근처럼 학습 데이터가 적은 새 위험 항목을 말로 정의해 잡는 데 후보다.

    한국어 검토 보기
    해결 문제
    • 검출기는 미리 정한 클래스만 찾는다. 사람이 말로 지시한 임의의 물체를 찾게 하고 싶다.
    핵심 구조
    • 2.6절 DINO 검출기에 언어를 밀착 결합한다. 특징 강화기, 언어가 이끄는 질의 선택, 교차 모달 디코더 세 부분을 둔다.
    주요 결과
    • COCO 제로샷 전이에서 52.5 AP. ODinW 제로샷 벤치마크 평균 26.1 AP로 당시 최고.
    한계
    • 추론이 무겁고 실시간에 부담이다. 문장 표현에 따라 결과가 흔들린다.
  11. T11-2.9후보

    YOLOv10: Real-Time End-to-End Object Detection

    저자
    Ao Wang, Hui Chen, Lihao Liu, Kai Chen, Zijia Lin, Jungong Han, Guiguang Ding
    연도
    arXiv 2024년 5월 공개, 발표: NeurIPS 2024

    2.7절 RT-DETR의 "NMS 때문에 YOLO가 느리다"는 주장에 대한 반대편 최신 근거다. 저사양 엣지 장비용 실시간 검출기 후보로 RT-DETR과 나란히 놓고 봐야 한다.

    한국어 검토 보기
    해결 문제
    • YOLO 계열이 NMS 후처리에 묶여 있다는 지적이 있다. CNN 검출기 쪽에서 후처리 없이 끝까지 한 번에 가는 방법을 찾고 싶다.
    핵심 구조
    • 학습할 때 정답 배정을 두 갈래로 두고 둘을 일치시킨다(consistent dual assignments). 그래서 추론에서 NMS가 필요 없다. 여기에 속도와 정확도를 함께 보는 모델 설계를 더한다.
    주요 결과
    • YOLOv10-S가 RT-DETR-R18과 비슷한 정확도에서 1.8배 빠르고 파라미터와 연산량은 2.8배 작다. YOLOv10-B는 YOLOv9-C 대비 지연 46퍼센트, 파라미터 25퍼센트 감소.
    한계
    • 개방어휘 검출은 안 된다. 정해둔 클래스만 찾는다.
  12. T11-3.1구조대응

    Simple Online and Realtime Tracking (SORT)

    저자
    Alex Bewley, Zongyuan Ge, Lionel Ott, Fabio Ramos, Ben Upcroft
    연도
    arXiv 2016, 발표: IEEE ICIP 2016 (3464-3468)

    추적 계보의 첫 논문이다. 뒤 논문들이 무엇을 보완했는지 재는 기준선으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 검출 결과를 프레임 사이에서 이어 붙여야 한다. 실시간으로 돌아가면서 단순한 방법을 찾고 싶다.
    핵심 구조
    • 칼만 필터로 다음 위치를 예측하고, 헝가리안 알고리즘으로 검출 상자와 궤적을 IoU 기준으로 붙인다. 외형 정보를 쓰지 않는다.
    주요 결과
    • 초당 260회 갱신으로 당시 최신 추적기보다 20배 이상 빠르다. 검출기를 바꾸면 추적 성능이 최대 18.9퍼센트 오른다는 점을 짚었다.
    한계
    • 가림이 생기면 ID가 자주 바뀐다. 외형을 안 보니 비슷한 궤적이 엉킨다.
  13. T11-3.2유사문제

    Simple Online and Realtime Tracking with a Deep Association Metric (DeepSORT)

    저자
    Nicolai Wojke, Alex Bewley, Dietrich Paulus
    연도
    arXiv 2017, 발표: IEEE ICIP 2017 (3645-3649)

    작업자와 지게차를 끊김 없이 따라가야 하는 우리 영상 안전 판단과 같은 문제를 다룬다.

    한국어 검토 보기
    해결 문제
    • SORT는 빠르지만 가림(occlusion)이 생기면 ID가 자주 바뀐다.
    핵심 구조
    • 칼만 필터와 헝가리안 매칭에 외형 특징을 더한다. 사람 재식별 데이터로 학습한 깊은 외형 거리 척도를 매칭에 쓴다.
    주요 결과
    • ID 전환이 45퍼센트 줄었다. 높은 프레임률에서 경쟁력 있는 성능.
    한계
    • 재식별 모델이 학습 도메인에 묶인다. 공장처럼 복장이 비슷한 환경에서는 외형 구분력이 떨어진다.
  14. T11-3.3구조대응

    ByteTrack: Multi-Object Tracking by Associating Every Detection Box

    저자
    Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang
    연도
    arXiv 2021, 발표: ECCV 2022

    설비 사이에 사람이 가려지는 공장 화면에서 궤적 유지 로직으로 맞대볼 수 있다.

    한국어 검토 보기
    해결 문제
    • 점수가 낮은 검출 상자를 버리면 가려진 사람이 통째로 사라지고 궤적이 끊긴다.
    핵심 구조
    • 두 단계 매칭이다. 먼저 고점수 상자를 궤적에 붙이고, 남은 궤적에 저점수 상자를 IoU로 다시 붙인다. 별도 재식별 모델 없이 동작한다.
    주요 결과
    • MOT17 테스트에서 MOTA 80.3, IDF1 77.3, HOTA 63.1. V100 단일 GPU 30 FPS. 기존 추적기 9종에 붙였을 때 IDF1이 1에서 10점 올랐다. 여기 쓰인 지표 정의는 4.1절(MOTA), 4.2절(IDF1), 4.3절(HOTA)에 있다.
    한계
    • 움직임 예측이 칼만 필터라 카메라가 흔들리거나 물체가 급격히 방향을 바꾸면 약하다.
  15. T11-3.4후보

    Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking (OC-SORT)

    저자
    Jinkun Cao, Jiangmiao Pang, Xinshuo Weng, Rawal Khirodkar, Kris Kitani
    연도
    arXiv 2022, 발표: CVPR 2023 (9686-9696)

    ByteTrack 다음 세대 추적기다. 사람이 방향을 급하게 바꾸는 작업 현장에 적용 후보다.

    한국어 검토 보기
    해결 문제
    • 칼만 필터는 가림 구간에서 예측 오차가 계속 쌓인다. 물체가 직선으로 안 움직이면 궤적이 무너진다.
    핵심 구조
    • 가림이 끝난 뒤 실제 검출값을 이어 가상의 궤적을 되그린다. 그 궤적으로 필터 상태를 되살린다. 움직임 방향까지 매칭에 넣는다.
    주요 결과
    • MOT17, MOT20, KITTI, 머리 추적, 특히 DanceTrack에서 당시 최고 수준. CPU 한 개로 초당 700프레임 이상.
    한계
    • 검출기 품질에 여전히 크게 의존한다. 여러 사람이 겹쳐 오래 가려지면 되그린 궤적이 틀릴 수 있다.
  16. T11-4.1구조대응

    Evaluating Multiple Object Tracking Performance: The CLEAR MOT Metrics (MOTA, MOTP)

    저자
    Keni Bernardin, Rainer Stiefelhagen
    연도
    2008

    3.3절 ByteTrack의 MOTA 80.3 같은 수치가 바로 이 문헌이 정의한 지표다. MOTA 수치를 쓸 때 붙일 정의 문헌이다.

    한국어 검토 보기
    해결 문제
    • 다중 객체 추적기가 여러 갈래로 쏟아지는데 공통 지표가 없다. 결과를 서로 비교할 수가 없다.
    핵심 구조
    • 직관적이고 일반적인 지표 두 개를 정의한다. 하나는 위치 추정의 정밀도(MOTP), 다른 하나는 놓침, 오검출, ID 뒤바뀜을 함께 세는 정확도(MOTA)다.
    주요 결과
    • 2006년과 2007년 국제 CLEAR 평가 두 차례에 실제로 쓰여 여러 추적 과제의 성능을 비교했다.
    한계
    • 프레임 단위 오류를 더하는 방식이라 궤적을 얼마나 일관되게 유지했는지는 약하게 반영한다. 논문 자체도 장단점을 함께 논의한다.
  17. T11-4.2구조대응

    Performance Measures and a Data Set for Multi-Target, Multi-Camera Tracking (IDF1)

    저자
    Ergys Ristani, Francesco Solera, Roger S. Zou, Rita Cucchiara, Carlo Tomasi
    연도
    arXiv 2016년 9월 공개, 발표: ECCV 2016 워크숍 (17-35)

    3장 여러 논문이 쓰는 IDF1 수치의 정의 문헌이다. 우리 추적 성능을 IDF1로 보고하려면 이 문헌을 붙여야 한다.

    한국어 검토 보기
    해결 문제
    • 기존 지표는 오류 종류마다 가중치가 들쭉날쭉하다. 카메라 여러 대에서 같은 사람을 같은 ID로 유지했는지를 제대로 못 잰다.
    핵심 구조
    • 세 가지를 낸다. 첫째, 모든 오류를 똑같이 다루면서 신원 유지에 무게를 두는 정밀도와 재현율 한 쌍(ID precision, ID recall, 이 둘의 조화평균이 IDF1)이다. 둘째, 카메라 8대로 85분 동안 2700명 이상을 찍은 대형 라벨 데이터셋이다. 셋째, 비교 기준이 되는 참조 시스템이다.
    주요 결과
    • 제안한 지표가 다중 카메라 환경의 신원 유지 성능을 제대로 가려냈다. 참조 시스템은 당시 최고 수준을 냈다.
    한계
    • 원래 다중 카메라 신원 유지를 겨냥한 지표다. 단일 카메라에 쓰면 궤적 조각화를 세는 방식이 다른 지표와 어긋날 수 있다.
  18. T11-4.3구조대응

    HOTA: A Higher Order Metric for Evaluating Multi-Object Tracking

    저자
    Jonathon Luiten, Aljosa Osep, Patrick Dendorfer, Philip Torr, Andreas Geiger, Laura Leal-Taixe, Bastian Leibe
    연도
    arXiv 2020, 발표: International Journal of Computer Vision 2021 (129권 2호, 548-578)

    우리 추적 성능을 수치로 보고할 때 쓰는 현행 표준 지표다. 성능 주장에는 이 지표를 붙여야 한다.

    한국어 검토 보기
    해결 문제
    • 기존 추적 지표는 검출 성능이나 연결 성능 중 한쪽에 치우친다. 사람이 눈으로 보는 좋은 추적과 순위가 어긋난다.
    핵심 구조
    • 검출 정확도, 연결 정확도, 위치 정확도를 하나의 값으로 균형 있게 합친다. 다섯 가지 기본 오류 유형별 하위 지표로 쪼개 볼 수 있다.
    주요 결과
    • MOTChallenge 실험에서 기존 지표가 놓치던 성능 측면을 잡아냈다. 사람의 시각적 평가와 더 잘 맞았다.
    한계
    • 지표 하나로 합치는 과정에서 개별 오류 원인이 가려질 수 있다. 하위 지표를 같이 봐야 한다.
  19. T11-4.4구조대응

    MOT16: A Benchmark for Multi-Object Tracking

    저자
    Anton Milan, Laura Leal-Taixe, Ian Reid, Stefan Roth, Konrad Schindler
    연도
    arXiv 2016년 3월 공개 (정식 학회 게재는 확인되지 않음)

    3장 추적 성능 수치가 대부분 MOT17 기준인데, MOT17을 따로 다룬 별도 논문은 확인하지 못했다. MOT17 기준 수치를 쓸 때는 이 MOT16 문헌과 6절 MOT20 문헌을 함께 근거로 붙인다.

    한국어 검토 보기
    해결 문제
    • 추적 논문마다 데이터와 라벨 기준이 달라 성능을 나란히 비교할 수 없다.
    핵심 구조
    • MOTChallenge 벤치마크의 새 판을 낸다. 보행자 추적이 중심이다. 모든 영상을 일관된 규약으로 다시 라벨링하고, 라벨 상자 수를 크게 늘렸다. 객체 종류 구분과 가림 정도(visibility) 표시를 추가했다.
    주요 결과
    • 라벨 규약과 평가 절차를 통일해 MOTChallenge 계열 비교의 기준을 만들었다.
    한계
    • 보행자 중심이라 지게차 같은 산업 장비는 대상이 아니다. 조명과 배경도 공장 환경과 다르다.
  20. T11-5.1구조대응

    Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset (I3D)

    저자
    Joao Carreira, Andrew Zisserman
    연도
    arXiv 2017, 발표: CVPR 2017 (4724-4733)

    영상 행동인식의 기준선이자 Kinetics의 출처다. 뒤 논문들의 성능 수치가 모두 이 데이터셋 기준이다.

    한국어 검토 보기
    해결 문제
    • 행동 인식 데이터셋이 작아서 모델 구조를 제대로 비교할 수 없다. 영상용 대규모 사전학습 기반이 없다.
    핵심 구조
    • Kinetics 데이터셋을 만든다. 행동 400종에 클래스당 클립 400개 이상이다. 이미지넷으로 학습한 2D 필터를 시간축으로 부풀려 3D로 바꾸는 I3D 구조를 제안한다.
    주요 결과
    • Kinetics 사전학습 후 HMDB-51 80.9퍼센트, UCF-101 98.0퍼센트로 당시 최고를 크게 넘었다.
    한계
    • 연산량이 크다. 짧은 클립 단위 분류라 긴 맥락을 못 본다.
  21. T11-5.2유사문제

    SlowFast Networks for Video Recognition

    저자
    Christoph Feichtenhofer, Haoqi Fan, Jitendra Malik, Kaiming He
    연도
    arXiv 2018년 12월 공개, 발표: ICCV 2019 (6201-6210)

    작업자 행동을 실시간으로 판정하는 문제와 같은 문제를 다룬다.

    한국어 검토 보기
    해결 문제
    • 영상은 공간 정보와 움직임 정보의 성격이 다른데 한 경로로 같이 처리하면 비효율이다.
    핵심 구조
    • 두 경로를 쓴다. 느린 경로는 프레임을 드물게 보며 모양을 잡고, 빠른 경로는 촘촘히 보며 움직임을 잡는다. 빠른 경로는 채널 수를 줄여 가볍게 만든다.
    주요 결과
    • Kinetics 행동 분류, Charades, AVA 행동 검출에서 당시 최고 수준.
    한계
    • 학습에 대용량 라벨 영상이 필요하다. 긴 시간 맥락(수 분 단위)은 잡지 못한다.
  22. T11-5.3후보

    VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training

    저자
    Zhan Tong, Yibing Song, Jue Wang, Limin Wang
    연도
    arXiv 2022, 발표: NeurIPS 2022 (arXiv 페이지 코멘트에 카메라레디로 명시)

    라벨이 거의 없는 공장 CCTV를 자기지도로 미리 학습시키는 방식의 후보다.

    한국어 검토 보기
    해결 문제
    • 영상 트랜스포머는 초대형 데이터로 사전학습해야 한다. 현장 데이터가 적으면 못 쓴다.
    핵심 구조
    • 영상을 튜브 단위로 가리고 복원하는 자기지도 학습이다. 가림 비율을 90에서 95퍼센트까지 극단적으로 올린다.
    주요 결과
    • 추가 데이터 없이 Kinetics-400 87.4퍼센트, Something-Something V2 75.4퍼센트, UCF101 91.3퍼센트, HMDB51 62.6퍼센트. 3천에서 4천 편 수준의 작은 데이터에서도 동작.
    한계
    • 사전학습 연산량이 크다. 사전학습 도메인과 현장 도메인이 다르면 성능이 떨어진다.
  23. T11-6.1구조대응

    Learning Transferable Visual Models From Natural Language Supervision (CLIP)

    저자
    Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh 외 7인
    연도
    arXiv 2021, 발표: ICML 2021 (8748-8763)

    말로 물체를 정의해 찾는 개방어휘 검출의 토대다. Grounding DINO 같은 방식이 여기서 출발한다.

    한국어 검토 보기
    해결 문제
    • 시각 모델은 미리 정한 클래스 목록에 묶인다. 새 개념을 넣으려면 라벨을 새로 모아야 한다.
    핵심 구조
    • 인터넷에서 모은 이미지와 설명문 4억 쌍으로 학습한다. 이미지 인코더와 텍스트 인코더를 같은 공간에 맞춘다. 클래스 이름을 문장으로 써서 분류한다.
    주요 결과
    • 컴퓨터비전 데이터셋 30종 이상에서 전이 성능을 확인했다. ImageNet은 학습 예시를 하나도 안 쓰고 ResNet-50과 같은 수준을 냈다.
    한계
    • 세밀한 구분, 개수 세기, 추상 과제에 약하다. 학습 데이터의 편향을 그대로 물려받는다.
  24. T11-6.2구조대응

    Segment Anything (SAM)

    저자
    Alexander Kirillov, Eric Mintun, Nikhila Ravi 외 9인 (총 12인, Meta AI Research)
    연도
    arXiv 2023, 발표: ICCV 2023 (3992-4003)

    SAM 2의 원본이다. 픽셀 단위 영역 판정을 쓰려면 이 원논문의 한계부터 봐야 한다.

    한국어 검토 보기
    해결 문제
    • 분할 모델은 과제마다 새로 학습해야 한다. 한 모델로 아무 물체나 잘라내게 하고 싶다.
    핵심 구조
    • 점, 상자, 대략적 마스크 같은 힌트를 받으면 마스크를 내주는 촉발형 분할 모델이다. 데이터 엔진을 돌려 이미지 1100만 장에서 마스크 10억 개 이상을 모은 SA-1B를 만들었다.
    주요 결과
    • 학습에 없던 이미지 분포와 과제에서도 제로샷으로 동작한다. 종종 기존 지도학습 모델을 넘어섰다.
    한계
    • 정지 이미지 전용이라 시간축이 없다. 마스크에 의미 라벨이 붙지 않는다. 모델이 무겁다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기