연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T12. 영상 이해와 근거 선택 (Vision-Language Model)

  1. T12-13유사문제2025년 이후

    Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

    저자
    Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen 외
    연도
    2024 (arXiv), 2025 (학회)
    발표처
    CVPR 2025, 논문집 24108-24118쪽
    한국어 검토 보기
    핵심 구조
    • 특징 네 가지를 내세운다. 영역 다양성(시각 영역 6개, 세부 분야 30개), 시간 길이 다양성(11초부터 1시간까지), 입력 다양성(프레임에 자막과 오디오까지), 사람 전문가 주석.
    • 규모는 영상 900편, 총 254시간, 질의응답 쌍 2700개다. 모두 사람이 직접 붙였다.
    주요 결과
    • 상용 모델 중에서는 Gemini 1.5 Pro가 가장 좋았고 공개 모델을 크게 앞섰다.
    • 영상이 길어질수록 성능이 떨어지는 공통 약점을 보였다.
    • 자막과 오디오를 같이 넣으면 성능이 오른다는 점도 보였다.
    한계
    • 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
    • 객관식 평가라 근거 제시 능력은 직접 재지 않는다.
    푸는 문제
    • 영상용 멀티모달 LLM을 종합적으로 재는 자리가 없었다.
    • 짧은 영상만 재거나, 영역이 한쪽에 치우친 데이터셋이 대부분이었다.
    우리 기능과의 관계
    • 긴 영상 이해 성능을 재는 최신 국제 기준이다. 후보 모델을 고를 때 비교 근거로 쓸 수 있다.
  2. T12-6유사문제

    Can I Trust Your Answer? Visually Grounded Video Question Answering (NExT-GQA)

    저자
    Junbin Xiao, Angela Yao, Yicong Li, Tat-Seng Chua
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    CVPR 2024 (Highlight)
    한국어 검토 보기
    핵심 구조
    • NExT-QA에 시간 구간 라벨 10.5K개를 붙여 NExT-GQA 데이터셋을 만들었다. 답과 근거 구간을 같이 평가한다.
    • 사후 어텐션 분석으로 기존 VLM이 근거를 얼마나 짚는지 측정했다.
    • 개선안으로 가우시안 마스크 최적화와 교차 모달 학습을 제안했다.
    주요 결과
    • 질의응답 성능은 강한데 근거 제시 능력은 매우 약하다는 것을 정량으로 보였다.
    • 제안 방법으로 근거 정확도와 질의응답 성능을 함께 올렸다.
    한계
    • 근거를 시간 구간으로만 본다. 화면 안 어느 위치인지(공간 근거)는 다루지 않는다.
    • 일상 영상 중심이다. 산업 현장 영상으로 그대로 옮겨지는지는 미검증이다.
    푸는 문제
    • 영상 질의응답 모델이 답은 잘 맞히는데, 그 답이 실제 영상 근거에 붙어 있는가.
    • 근거 없이 언어 편향이나 우연한 패턴으로 맞히는 경우를 걸러야 한다.
    우리 기능과의 관계
    • 영상 안전 판단과 AI 보고서에서 "판단 근거를 시간 구간으로 함께 제시하고 검증한다"는 요구와 같은 문제를 다룬다.
  3. T12-9유사문제

    QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries (Moment-DETR)

    저자
    Jie Lei, Tamara L. Berg, Mohit Bansal
    연도
    2021
    발표처
    NeurIPS 2021
    한국어 검토 보기
    핵심 구조
    • QVHighlights 데이터셋. 유튜브 영상 1만 편 이상. 사람이 쓴 질의, 관련 구간, 중요도 점수가 함께 있다.
    • Moment-DETR 모델. 구간 찾기를 집합 예측(set prediction) 문제로 본다. 별도 후보 구간 생성이나 사전 정의 앵커가 없다.
    • 음성 인식 자막(ASR)을 약지도 신호로 써서 사전학습하면 성능이 크게 오른다.
    주요 결과
    • 유튜브 영상 1만 편 이상에 사람이 쓴 질의, 관련 구간, 5점 척도 중요도 점수를 모두 붙였다. 이 세 가지를 함께 붙인 데이터셋이 그전에 없었다.
    • Moment-DETR은 사람이 넣은 사전 지식(후보 구간 생성, 앵커) 없이도 잘 만들어진 기존 구조들과 견줄 성능을 냈다.
    • ASR 자막으로 약지도 사전학습을 하면 Moment-DETR이 기존 방법들을 크게 앞선다고 보고했다.
    • 부분 제거 실험(ablation)과 시각화를 함께 실었다.
    한계
    • LLM 이전 세대 구조다. 자유로운 지시문 이해나 근거 설명 생성은 못 한다.
    • 유튜브 브이로그와 뉴스 도메인이다. 산업 영상과 분포가 다르다.
    푸는 문제
    • 자연어 질의로 영상 속 구간을 찾고, 그 구간의 중요도를 매기는 문제다.
    • 기존 데이터셋은 질의당 구간이 하나라는 가정이 많았다.
    우리 기능과의 관계
    • 영상 안전 판단에서 "질의로 구간 찾기 + 중요도 점수"라는 평가 틀 자체가 우리와 같은 문제다.
  4. T12-12유사문제

    EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

    저자
    Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik
    연도
    2023
    발표처
    NeurIPS 2023, Datasets and Benchmarks Track
    한국어 검토 보기
    핵심 구조
    • Ego4D 영상에서 만든 객관식 질의응답 데이터셋이다. 사람이 다듬은 문제 5000개 이상, 영상 250시간 이상.
    • 문제 하나마다 3분짜리 영상 클립이 붙고 보기 5개 중 하나를 고른다.
    • "시간 증명 집합(temporal certificate set)"이라는 지표를 새로 제안했다. 답을 확정하려면 최소 몇 초 분량을 봐야 하는지를 잰다.
    주요 결과
    • 이 지표로 재면 EgoSchema의 시간 난이도가 2위 데이터셋의 약 5.7배다.
    • 당시 최고 수준 VLM이 33% 미만 정확도에 그쳤다. 찍기 기준은 20%다.
    • 사람은 약 76%를 맞혔다. 격차가 크다는 것을 보였다.
    한계
    • 1인칭 착용 카메라 영상 위주다. 고정 CCTV 시점과 화면 구성이 다르다.
    • 객관식이라 근거 구간 자체는 평가하지 않는다.
    푸는 문제
    • 긴 영상을 정말로 이해했는지 재는 자리가 없었다. 기존 데이터셋은 한 장면만 봐도 답이 나오는 문제가 많았다.
    • 얼마나 긴 시간을 봐야 답할 수 있는지를 수치로 재는 기준이 필요하다.
    우리 기능과의 관계
    • 이 문서 안 VideoAgent, LLoVi, Frame-Voyager가 모두 이 벤치마크로 숫자를 낸다. 비교의 공통 자다.
    • 긴 설비 영상 이해 성능을 우리가 잴 때 참고할 수 있는 문제 설계다.
  5. T12-14유사문제

    Evaluating Object Hallucination in Large Vision-Language Models (POPE)

    저자
    Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, Ji-Rong Wen
    연도
    2023
    발표처
    EMNLP 2023
    한국어 검토 보기
    핵심 구조
    • 물체 환각을 체계적으로 측정한 첫 연구다.
    • POPE라는 평가법을 제안한다. "이 이미지에 X가 있나요"를 예/아니오로 묻는 투표식 질의다.
    • 없는 물체를 고르는 방식을 세 가지로 나눈다. 무작위, 자주 나오는 물체, 실제 물체와 자주 같이 나오는 물체다.
    주요 결과
    • 여러 시각-언어 모델이 물체 환각을 심하게 일으킨다는 것을 보였다.
    • 학습 데이터에 자주 나오거나 실제 물체와 같이 자주 등장하는 물체일수록 더 많이 지어낸다.
    • 기존 캡션 기반 평가보다 안정적이고 유연하다는 점을 보였다. 코드와 데이터를 공개했다.
    한계
    • 정지 이미지의 물체 존재 여부만 본다. 영상의 동작이나 시간 관계 환각은 범위 밖이다.
    • 예/아니오 질문이라 서술형 답변의 환각은 간접적으로만 잡는다.
    푸는 문제
    • 시각-언어 모델이 화면에 없는 물체를 있다고 말한다. 이걸 물체 환각이라 부른다.
    • 근거를 대라고 시키는 시스템에서 이 문제는 곧바로 오탐으로 이어진다.
    우리 기능과의 관계
    • 영상 안전 판단이 "없는 위험을 봤다"고 말하는 오탐을 재는 방식에 대응한다.
    • NExT-GQA가 근거 구간의 정확성을 본다면, 이 논문은 존재하지 않는 대상을 지어내는 쪽을 본다. 신뢰성 축을 둘로 나눠 볼 수 있다.
    • 위 한계 중 영상 쪽 빈자리는 아래 15번 VideoHallucer가 메운다. 둘을 같이 봐야 한다.
  6. T12-15유사문제

    VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

    저자
    Yuxuan Wang, Yueqian Wang, Dongyan Zhao, Cihang Xie, Zilong Zheng
    연도
    2024
    발표처
    arXiv 프리프린트. arXiv 초록 페이지에 학회 표시가 없다
    한국어 검토 보기
    핵심 구조
    • 영상-언어 모델의 환각을 종합적으로 재는 첫 벤치마크라고 밝혔다.
    • 환각을 크게 둘로 나눈다. 내재(intrinsic)와 외재(extrinsic)다. 다시 세부로 나눈다. 물체-관계, 시간, 의미 세부, 외재 사실, 외재 비사실 다섯 가지다.
    • 측정 방식은 짝지은 예/아니오 질문이다. 기본 질문 하나와 환각을 유도하는 질문 하나를 짝으로 만들어 둘 다 맞혀야 통과시킨다.
    주요 결과
    • 영상-언어 모델 11종을 평가했다.
    • 지금 모델 대부분이 환각 문제가 심각하다는 것을 보였다.
    • 데이터와 파라미터를 키우면 기본 시각 단서와 반사실 판별은 좋아진다. 그런데 외재 사실 환각 잡기에는 도움이 거의 없다.
    • 지금 모델은 사실을 알아보는 쪽은 잘하지만 환각을 잡아내는 쪽은 약하다.
    • 부산물로 self-PEP 프레임워크를 내놨다. 모든 구조에서 환각 저항력이 평균 5.38% 올랐다고 보고했다.
    한계
    • 예/아니오 짝 질문 방식이다. 서술형 보고서의 환각은 간접적으로만 잡는다.
    • 평가 대상이 2024년 시점 모델 11종이다. 이후 모델은 다시 재야 한다.
    • 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
    푸는 문제
    • 영상까지 다루는 멀티모달 LLM이 영상에 없는 내용을 지어낸다. 이걸 영상 환각이라 부른다.
    • 정지 이미지용 환각 측정법(POPE)만으로는 영상의 동작이나 시간 관계 환각을 못 잡는다. 영상 전용 측정 자리가 필요하다.
    우리 기능과의 관계
    • 영상 안전 판단이 "없던 동작을 봤다", "순서를 바꿔 말한다"고 지어내는 오탐을 재는 문제와 같다.
    • POPE가 정지 이미지 물체 존재만 본다면, 이쪽은 시간과 동작까지 본다. 신뢰성 측정을 영상으로 넓히는 자리다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기