연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T11. 객체 검출, 다중 객체 추적, 영상 이해
- T11-6.3후보2025년 이후
SAM 2: Segment Anything in Images and Videos
위험 구역 경계와 사람 영역을 픽셀 단위로 나눠 침입 여부를 판정하는 데 적용 후보다.
한국어 검토 보기
해결 문제
- 이미지 분할 기반 모델을 영상으로 넓히고, 프레임 사이에서 같은 대상을 계속 따라가게 하고 싶다.
핵심 구조
- 스트리밍 메모리를 붙인 단순 트랜스포머다. 앞 프레임의 결과를 메모리에 넣어 다음 프레임 분할에 쓴다. 사람이 클릭으로 교정하면 바로 반영한다.
주요 결과
- 영상 분할에서 기존 방법 대비 상호작용 횟수 3분의 1로 더 높은 정확도. 이미지 분할은 SAM보다 정확하고 6배 빠르다.
한계
- 여러 물체가 비슷하게 생기면 섞인다. 장면이 확 바뀌면 메모리가 오염된다. 모델이 무겁다.
- T11-2.7후보
DETRs Beat YOLOs on Real-time Object Detection (RT-DETR)
현장 카메라 실시간 검출 엔진 교체 후보다.
한국어 검토 보기
해결 문제
- YOLO 계열은 NMS 후처리 때문에 속도와 정확도가 같이 흔들린다. 실시간에서 후처리 없는 검출기를 만들고 싶다.
핵심 구조
- 효율적 하이브리드 인코더로 다중 스케일 특징을 처리한다. 불확실성이 가장 낮은 질의를 고르는 방식으로 초기 질의를 뽑는다. 디코더 층 수를 바꿔 재학습 없이 속도를 조절한다.
주요 결과
- RT-DETR-R50이 COCO AP 53.1퍼센트에 T4 GPU 108 FPS, R101이 54.3퍼센트에 74 FPS.
한계
- 학습 비용과 메모리 요구가 CNN 검출기보다 크다. 저사양 엣지 장비에서는 그대로 쓰기 어렵다.
- T11-2.8후보
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
안전모 미착용, 지게차 접근처럼 학습 데이터가 적은 새 위험 항목을 말로 정의해 잡는 데 후보다.
한국어 검토 보기
해결 문제
- 검출기는 미리 정한 클래스만 찾는다. 사람이 말로 지시한 임의의 물체를 찾게 하고 싶다.
핵심 구조
- 2.6절 DINO 검출기에 언어를 밀착 결합한다. 특징 강화기, 언어가 이끄는 질의 선택, 교차 모달 디코더 세 부분을 둔다.
주요 결과
- COCO 제로샷 전이에서 52.5 AP. ODinW 제로샷 벤치마크 평균 26.1 AP로 당시 최고.
한계
- 추론이 무겁고 실시간에 부담이다. 문장 표현에 따라 결과가 흔들린다.
- T11-2.9후보
YOLOv10: Real-Time End-to-End Object Detection
2.7절 RT-DETR의 "NMS 때문에 YOLO가 느리다"는 주장에 대한 반대편 최신 근거다. 저사양 엣지 장비용 실시간 검출기 후보로 RT-DETR과 나란히 놓고 봐야 한다.
한국어 검토 보기
해결 문제
- YOLO 계열이 NMS 후처리에 묶여 있다는 지적이 있다. CNN 검출기 쪽에서 후처리 없이 끝까지 한 번에 가는 방법을 찾고 싶다.
핵심 구조
- 학습할 때 정답 배정을 두 갈래로 두고 둘을 일치시킨다(consistent dual assignments). 그래서 추론에서 NMS가 필요 없다. 여기에 속도와 정확도를 함께 보는 모델 설계를 더한다.
주요 결과
- YOLOv10-S가 RT-DETR-R18과 비슷한 정확도에서 1.8배 빠르고 파라미터와 연산량은 2.8배 작다. YOLOv10-B는 YOLOv9-C 대비 지연 46퍼센트, 파라미터 25퍼센트 감소.
한계
- 개방어휘 검출은 안 된다. 정해둔 클래스만 찾는다.
- T11-3.4후보
Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking (OC-SORT)
ByteTrack 다음 세대 추적기다. 사람이 방향을 급하게 바꾸는 작업 현장에 적용 후보다.
한국어 검토 보기
해결 문제
- 칼만 필터는 가림 구간에서 예측 오차가 계속 쌓인다. 물체가 직선으로 안 움직이면 궤적이 무너진다.
핵심 구조
- 가림이 끝난 뒤 실제 검출값을 이어 가상의 궤적을 되그린다. 그 궤적으로 필터 상태를 되살린다. 움직임 방향까지 매칭에 넣는다.
주요 결과
- MOT17, MOT20, KITTI, 머리 추적, 특히 DanceTrack에서 당시 최고 수준. CPU 한 개로 초당 700프레임 이상.
한계
- 검출기 품질에 여전히 크게 의존한다. 여러 사람이 겹쳐 오래 가려지면 되그린 궤적이 틀릴 수 있다.
- T11-5.3후보
VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
라벨이 거의 없는 공장 CCTV를 자기지도로 미리 학습시키는 방식의 후보다.
한국어 검토 보기
해결 문제
- 영상 트랜스포머는 초대형 데이터로 사전학습해야 한다. 현장 데이터가 적으면 못 쓴다.
핵심 구조
- 영상을 튜브 단위로 가리고 복원하는 자기지도 학습이다. 가림 비율을 90에서 95퍼센트까지 극단적으로 올린다.
주요 결과
- 추가 데이터 없이 Kinetics-400 87.4퍼센트, Something-Something V2 75.4퍼센트, UCF101 91.3퍼센트, HMDB51 62.6퍼센트. 3천에서 4천 편 수준의 작은 데이터에서도 동작.
한계
- 사전학습 연산량이 크다. 사전학습 도메인과 현장 도메인이 다르면 성능이 떨어진다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기