연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T12. 영상 이해와 근거 선택 (Vision-Language Model)

  1. T12-2구조대응2025년 이후

    Adaptive Keyframe Sampling for Long Video Understanding

    저자
    Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye
    연도
    2025
    발표처
    CVPR 2025 (openaccess.thecvf.com CVPR2025 논문집)
    한국어 검토 보기
    핵심 구조
    • 키프레임 선택을 최적화 문제로 정의한다.
    • 두 가지를 같이 본다. 하나는 프롬프트와의 관련도, 다른 하나는 영상 전체에 대한 커버리지(고르게 덮는 정도)다.
    • 기존 MLLM 앞단에 끼워 넣는 모듈이다. 모델 본체는 건드리지 않는다.
    주요 결과
    • 긴 영상 벤치마크에서 고정 토큰 조건으로 영상 질의응답 성능이 올라갔다.
    • 저자들은 "영상 기반 MLLM에서 정보 사전 선별이 중요하다"는 점을 강조한다. 코드를 공개했다.
    한계
    • 관련도와 커버리지의 균형점을 어떻게 잡을지가 하이퍼파라미터에 달렸다.
    • 질문이 영상 전체에 흩어진 여러 사건을 요구하면 커버리지 항만으로는 부족할 수 있다.
    푸는 문제
    • 이미지 한 장이 아니라 긴 영상이 들어오면 시각 토큰이 모델 용량을 크게 넘는다.
    • 정해진 토큰 예산 안에서 유용한 정보를 최대로 담아야 한다.
    우리 기능과의 관계
    • 설비 영상 장시간 녹화에서 이상 구간만 골라 AI 분석에 넘기는 사전 선별 단계에 대응한다.
  2. T12-1구조대응2025년 이후

    Frame-Voyager: Learning to Query Frames for Video Large Language Models

    저자
    Sicheng Yu, Chengkai Jin, Huanyu Wang, Zhenghao Chen, Sheng Jin, Zhongrong Zuo, Xiaolei Xu, Zhenbang Sun, Bingni Zhang, Jiawei Wu, Hao Zhang, Qianru Sun
    연도
    2024 (arXiv), 2025 (학회)
    발표처
    ICLR 2025
    한국어 검토 보기
    핵심 구조
    • 프레임 "조합"을 고르도록 학습한다. 프레임 하나씩이 아니라 T개 묶음 단위다.
    • 학습 라벨 만드는 법이 핵심이다. M개 프레임에서 T개 조합을 여러 개 뽑아 기존 Video-LLM에 넣고, 예측 손실(loss)이 낮은 조합을 좋은 조합으로 순위 매긴다.
    • 이 순위를 지도 신호로 써서 선택 모델을 따로 학습한다.
    주요 결과
    • 영상 질의응답 벤치마크 4종에서, 서로 다른 Video-LLM 2종에 끼워 넣어 모든 설정에서 개선을 보고했다.
    • 끼워 넣기만 하면 되는 plug-and-play 방식이다.
    한계
    • 조합을 훑어서 라벨을 만드는 과정 자체가 비싸다. 조합 수가 늘면 비용이 급격히 는다.
    • 라벨의 품질이 기준으로 쓴 Video-LLM 성능에 묶인다.
    • 학습된 도메인 밖(공장 CCTV 같은 산업 영상)에서의 성능은 논문 범위 밖이다.
    푸는 문제
    • 영상 전체를 모델에 넣을 수 없다. 입력 토큰 상한 때문이다.
    • 기존 방식인 균등 샘플링(일정 간격으로 뽑기)과 글-프레임 검색은 정보 밀도 차이와 복잡한 지시문을 반영하지 못한다.
    우리 기능과의 관계
    • 영상 안전 판단에서 "이 장면 중 어느 프레임을 근거로 볼지"를 질문에 맞춰 고르는 구조에 대응한다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기