연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T12. 영상 이해와 근거 선택 (Vision-Language Model)

  1. T12-2구조대응2025년 이후

    Adaptive Keyframe Sampling for Long Video Understanding

    저자
    Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye
    연도
    2025
    발표처
    CVPR 2025 (openaccess.thecvf.com CVPR2025 논문집)
    한국어 검토 보기
    핵심 구조
    • 키프레임 선택을 최적화 문제로 정의한다.
    • 두 가지를 같이 본다. 하나는 프롬프트와의 관련도, 다른 하나는 영상 전체에 대한 커버리지(고르게 덮는 정도)다.
    • 기존 MLLM 앞단에 끼워 넣는 모듈이다. 모델 본체는 건드리지 않는다.
    주요 결과
    • 긴 영상 벤치마크에서 고정 토큰 조건으로 영상 질의응답 성능이 올라갔다.
    • 저자들은 "영상 기반 MLLM에서 정보 사전 선별이 중요하다"는 점을 강조한다. 코드를 공개했다.
    한계
    • 관련도와 커버리지의 균형점을 어떻게 잡을지가 하이퍼파라미터에 달렸다.
    • 질문이 영상 전체에 흩어진 여러 사건을 요구하면 커버리지 항만으로는 부족할 수 있다.
    푸는 문제
    • 이미지 한 장이 아니라 긴 영상이 들어오면 시각 토큰이 모델 용량을 크게 넘는다.
    • 정해진 토큰 예산 안에서 유용한 정보를 최대로 담아야 한다.
    우리 기능과의 관계
    • 설비 영상 장시간 녹화에서 이상 구간만 골라 AI 분석에 넘기는 사전 선별 단계에 대응한다.
  2. T12-1구조대응2025년 이후

    Frame-Voyager: Learning to Query Frames for Video Large Language Models

    저자
    Sicheng Yu, Chengkai Jin, Huanyu Wang, Zhenghao Chen, Sheng Jin, Zhongrong Zuo, Xiaolei Xu, Zhenbang Sun, Bingni Zhang, Jiawei Wu, Hao Zhang, Qianru Sun
    연도
    2024 (arXiv), 2025 (학회)
    발표처
    ICLR 2025
    한국어 검토 보기
    핵심 구조
    • 프레임 "조합"을 고르도록 학습한다. 프레임 하나씩이 아니라 T개 묶음 단위다.
    • 학습 라벨 만드는 법이 핵심이다. M개 프레임에서 T개 조합을 여러 개 뽑아 기존 Video-LLM에 넣고, 예측 손실(loss)이 낮은 조합을 좋은 조합으로 순위 매긴다.
    • 이 순위를 지도 신호로 써서 선택 모델을 따로 학습한다.
    주요 결과
    • 영상 질의응답 벤치마크 4종에서, 서로 다른 Video-LLM 2종에 끼워 넣어 모든 설정에서 개선을 보고했다.
    • 끼워 넣기만 하면 되는 plug-and-play 방식이다.
    한계
    • 조합을 훑어서 라벨을 만드는 과정 자체가 비싸다. 조합 수가 늘면 비용이 급격히 는다.
    • 라벨의 품질이 기준으로 쓴 Video-LLM 성능에 묶인다.
    • 학습된 도메인 밖(공장 CCTV 같은 산업 영상)에서의 성능은 논문 범위 밖이다.
    푸는 문제
    • 영상 전체를 모델에 넣을 수 없다. 입력 토큰 상한 때문이다.
    • 기존 방식인 균등 샘플링(일정 간격으로 뽑기)과 글-프레임 검색은 정보 밀도 차이와 복잡한 지시문을 반영하지 못한다.
    우리 기능과의 관계
    • 영상 안전 판단에서 "이 장면 중 어느 프레임을 근거로 볼지"를 질문에 맞춰 고르는 구조에 대응한다.
  3. T12-13유사문제2025년 이후

    Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

    저자
    Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen 외
    연도
    2024 (arXiv), 2025 (학회)
    발표처
    CVPR 2025, 논문집 24108-24118쪽
    한국어 검토 보기
    핵심 구조
    • 특징 네 가지를 내세운다. 영역 다양성(시각 영역 6개, 세부 분야 30개), 시간 길이 다양성(11초부터 1시간까지), 입력 다양성(프레임에 자막과 오디오까지), 사람 전문가 주석.
    • 규모는 영상 900편, 총 254시간, 질의응답 쌍 2700개다. 모두 사람이 직접 붙였다.
    주요 결과
    • 상용 모델 중에서는 Gemini 1.5 Pro가 가장 좋았고 공개 모델을 크게 앞섰다.
    • 영상이 길어질수록 성능이 떨어지는 공통 약점을 보였다.
    • 자막과 오디오를 같이 넣으면 성능이 오른다는 점도 보였다.
    한계
    • 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
    • 객관식 평가라 근거 제시 능력은 직접 재지 않는다.
    푸는 문제
    • 영상용 멀티모달 LLM을 종합적으로 재는 자리가 없었다.
    • 짧은 영상만 재거나, 영역이 한쪽에 치우친 데이터셋이 대부분이었다.
    우리 기능과의 관계
    • 긴 영상 이해 성능을 재는 최신 국제 기준이다. 후보 모델을 고를 때 비교 근거로 쓸 수 있다.
  4. T12-3구조대응

    Self-Chained Image-Language Model for Video Localization and Question Answering (SeViLA)

    저자
    Shoubin Yu, Jaemin Cho, Prateek Yadav, Mohit Bansal
    연도
    2023
    발표처
    NeurIPS 2023
    한국어 검토 보기
    핵심 구조
    • BLIP-2 하나에서 두 모듈을 만든다. 위치찾기(Localizer)와 답변(Answerer)이다.
    • 앞뒤로 연결한다. Localizer가 질문과 관련 있는 키프레임을 고르면 Answerer가 그걸로 답한다.
    • 반대 방향도 쓴다. Answerer가 만든 유사 라벨(pseudo-label)로 Localizer를 스스로 학습시킨다. 사람 구간 라벨이 없어도 된다.
    주요 결과
    • 영상 질의응답과 사건 예측 벤치마크 5종에서 강한 기준 모델들을 앞섰다고 보고했다.
    • 초록이 이름을 밝힌 것은 두 갈래다. 미세조정 최고 성능은 NExT-QA와 STAR, 제로샷 최고 성능은 NExT-QA, STAR, How2QA, VLEP다.
    • 다섯 번째 이름은 초록에 없다. 공식 저장소(https://github.com/Yui010206/SeViLA)는 평가 데이터로 NExT-QA, STAR, How2QA, TVQA, VLEP를 쓰고, QVHighlights로는 Localizer를 사전학습한다고 적었다.
    한계
    • 유사 라벨이 답변 모델의 편향을 그대로 물려받는다.
    • 이미지 모델 기반이라 프레임 사이 움직임 정보를 직접 다루지는 않는다.
    푸는 문제
    • 질문에 답할 근거가 영상의 일부 구간에만 있다. 균등 샘플링은 중요한 단서를 놓친다.
    • 시간 위치 찾기와 질의응답을 따로 학습하려면 사람이 붙인 구간 라벨이 비싸다.
    우리 기능과의 관계
    • 영상 안전 판단에서 "근거 구간 찾기"와 "판단"을 두 단계로 나누고, 사람 라벨 없이 돌리는 구조에 대응한다.
  5. T12-4구조대응

    VideoAgent: Long-form Video Understanding with Large Language Model as Agent

    저자
    Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy
    연도
    2024 (arXiv), 2024 (학회)
    발표처
    ECCV 2024. Computer Vision - ECCV 2024, LNCS, 58-76쪽
    한국어 검토 보기
    핵심 구조
    • 언어모델을 중심 에이전트로 둔다. 에이전트가 "지금 정보가 충분한가"를 판단하고, 부족하면 어느 구간을 더 볼지 결정한다.
    • 시각-언어 모델(VLM)과 검색 모델을 도구로 쓴다. 캡션 생성과 프레임 검색을 도구 호출로 처리한다.
    • 반복 추론과 계획을 강조한다. 프레임을 한 번에 정하지 않는다.
    주요 결과
    • EgoSchema 54.1%, NExT-QA 71.3% 제로샷 정확도.
    • 영상당 평균 8.4장, 8.2장만 썼다. 프레임을 훨씬 적게 쓰고도 기존 최고 성능을 넘었다.
    한계
    • 언어모델 호출이 여러 번 일어나 지연과 비용이 늘어난다. 실시간 판단에는 부담이다.
    • 도구(캡셔너, 검색기) 품질에 결과가 크게 좌우된다.
    같은 이름 주의
    • 2024년에 이름이 똑같은 다른 논문이 있다. VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding이다.
    • 여기서 말하는 VideoAgent는 스탠퍼드 팀(Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy)의 arXiv:2403.10517이다. 저자를 같이 적어야 헷갈리지 않는다.
    푸는 문제
    • 긴 영상을 한 번에 밀어 넣는 대신, 필요한 정보만 반복해서 찾아오는 방식이 가능한가.
    우리 기능과의 관계
    • 업무 실행 에이전트가 영상 근거를 스스로 더 찾아오며 판단을 다듬는 구조에 대응한다.
  6. T12-5후보

    A Simple LLM Framework for Long-Range Video Question-Answering (LLoVi)

    저자
    Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    EMNLP 2024 main
    한국어 검토 보기
    핵심 구조
    • 두 단계다. 먼저 짧은 클립마다 캡션(글 설명)을 만든다. 다음에 언어모델이 그 캡션들을 모아 시간 추론을 한다.
    • 프롬프트 설계가 중요하다. 답하기 전에 캡션을 먼저 요약하게 시키면 성능이 크게 오른다.
    주요 결과
    • EgoSchema 50.3% 정확도. 이전 최고 대비 18.1%p 개선을 보고했다.
    • NExT-QA, IntentQA, NExT-GQA에서도 개선을 보고했다.
    한계
    • 캡션이 놓친 정보는 언어모델이 복구할 수 없다. 캡셔너가 병목이다.
    • 미세한 동작이나 수치 판독처럼 글로 옮기기 어려운 단서에 약하다.
    푸는 문제
    • 긴 영상 질의응답에 반드시 전용 영상 모델이 필요한가. 더 단순한 방법은 없나.
    우리 기능과의 관계
    • 설비 영상을 글 로그로 바꿔 두고 AI 보고서 단계에서 언어모델로 추론하는 방식의 후보다.
  7. T12-6유사문제

    Can I Trust Your Answer? Visually Grounded Video Question Answering (NExT-GQA)

    저자
    Junbin Xiao, Angela Yao, Yicong Li, Tat-Seng Chua
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    CVPR 2024 (Highlight)
    한국어 검토 보기
    핵심 구조
    • NExT-QA에 시간 구간 라벨 10.5K개를 붙여 NExT-GQA 데이터셋을 만들었다. 답과 근거 구간을 같이 평가한다.
    • 사후 어텐션 분석으로 기존 VLM이 근거를 얼마나 짚는지 측정했다.
    • 개선안으로 가우시안 마스크 최적화와 교차 모달 학습을 제안했다.
    주요 결과
    • 질의응답 성능은 강한데 근거 제시 능력은 매우 약하다는 것을 정량으로 보였다.
    • 제안 방법으로 근거 정확도와 질의응답 성능을 함께 올렸다.
    한계
    • 근거를 시간 구간으로만 본다. 화면 안 어느 위치인지(공간 근거)는 다루지 않는다.
    • 일상 영상 중심이다. 산업 현장 영상으로 그대로 옮겨지는지는 미검증이다.
    푸는 문제
    • 영상 질의응답 모델이 답은 잘 맞히는데, 그 답이 실제 영상 근거에 붙어 있는가.
    • 근거 없이 언어 편향이나 우연한 패턴으로 맞히는 경우를 걸러야 한다.
    우리 기능과의 관계
    • 영상 안전 판단과 AI 보고서에서 "판단 근거를 시간 구간으로 함께 제시하고 검증한다"는 요구와 같은 문제를 다룬다.
  8. T12-7구조대응

    TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding

    저자
    Shuhuai Ren, Linli Yao, Shicheng Li, Xu Sun, Lu Hou
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    CVPR 2024
    한국어 검토 보기
    핵심 구조
    • 두 가지 모듈을 넣었다. 하나는 프레임의 시각 정보와 타임스탬프(시각 표시)를 묶어 인코딩하는 부분이다.
    • 다른 하나는 영상 길이에 따라 표현 개수를 바꾸는 적응형 모듈이다. 짧은 영상과 긴 영상을 같은 방식으로 다루지 않는다.
    • 6개 과제, 12.5만 건 규모의 시간 관련 지시 데이터셋(TimeIT)을 만들어 학습했다.
    주요 결과
    • YouCook2 조밀 캡션에서 F1 +9.2, CIDEr +2.8.
    • 하이라이트 검출에서 5.8점 개선.
    • 시간 구간 찾기에서 27.5의 상대 개선을 보고했다.
    한계
    • 학습 데이터가 일상, 요리, 지시 영상 위주다. 제조 현장 영상은 포함되지 않았다.
    • 절대 성능은 여전히 낮은 편이다. 개선폭이 크다는 것과 실용 수준은 다르다.
    푸는 문제
    • 기존 영상 LLM은 전체 요약만 한다. 사건이 몇 초에 일어났는지 못 짚는다.
    우리 기능과의 관계
    • 설비 영상에서 "몇 시 몇 분에 무슨 일"을 타임스탬프와 함께 뽑아 AI 보고서에 넣는 구조에 대응한다.
  9. T12-8구조대응

    VTimeLLM: Empower LLM to Grasp Video Moments

    저자
    Bin Huang, Xin Wang, Hong Chen, Zihan Song, Wenwu Zhu
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    CVPR 2024, 논문집 14271-14280쪽. CVF 오픈액세스 페이지: https://openaccess.thecvf.com/content/CVPR2024/html/Huang_VTimeLLM_Empower_LLM_to_Grasp_Video_Moments_CVPR_2024_paper.html
    한국어 검토 보기
    핵심 구조
    • 경계를 의식한 3단계 학습이다.
    • 1단계는 이미지-글 쌍으로 특징 정렬. 2단계는 사건이 여러 개 든 영상으로 경계 민감도 학습. 3단계는 고품질 영상 지시 데이터로 미세조정.
    주요 결과
    • 시간 구간 찾기와 조밀 영상 캡션에서 기존 영상 LLM을 크게 앞섰다.
    • 영상 대화 벤치마크에서도 앞섰다. 시간 이해가 좋아지면 대화 품질도 오른다는 점을 보였다.
    한계
    • 단계별 학습이라 데이터 준비와 학습 비용이 크다.
    • 경계 정밀도는 초 단위다. 밀리초 단위 안전 판단에는 그대로 쓰기 어렵다.
    근거 링크 주의
    • arXiv 초록 페이지에는 학회 표시가 없다.
    • 학회 확인은 위 CVF 오픈액세스 페이지로 한다. 저자와 쪽수가 그 페이지에 그대로 적혀 있다.
    푸는 문제
    • 영상 LLM이 사건의 시작과 끝 경계를 정확히 못 잡는다.
    우리 기능과의 관계
    • 영상 안전 판단에서 위험 행동의 시작과 끝 시각을 말로 뱉게 만드는 구조에 대응한다.
  10. T12-9유사문제

    QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries (Moment-DETR)

    저자
    Jie Lei, Tamara L. Berg, Mohit Bansal
    연도
    2021
    발표처
    NeurIPS 2021
    한국어 검토 보기
    핵심 구조
    • QVHighlights 데이터셋. 유튜브 영상 1만 편 이상. 사람이 쓴 질의, 관련 구간, 중요도 점수가 함께 있다.
    • Moment-DETR 모델. 구간 찾기를 집합 예측(set prediction) 문제로 본다. 별도 후보 구간 생성이나 사전 정의 앵커가 없다.
    • 음성 인식 자막(ASR)을 약지도 신호로 써서 사전학습하면 성능이 크게 오른다.
    주요 결과
    • 유튜브 영상 1만 편 이상에 사람이 쓴 질의, 관련 구간, 5점 척도 중요도 점수를 모두 붙였다. 이 세 가지를 함께 붙인 데이터셋이 그전에 없었다.
    • Moment-DETR은 사람이 넣은 사전 지식(후보 구간 생성, 앵커) 없이도 잘 만들어진 기존 구조들과 견줄 성능을 냈다.
    • ASR 자막으로 약지도 사전학습을 하면 Moment-DETR이 기존 방법들을 크게 앞선다고 보고했다.
    • 부분 제거 실험(ablation)과 시각화를 함께 실었다.
    한계
    • LLM 이전 세대 구조다. 자유로운 지시문 이해나 근거 설명 생성은 못 한다.
    • 유튜브 브이로그와 뉴스 도메인이다. 산업 영상과 분포가 다르다.
    푸는 문제
    • 자연어 질의로 영상 속 구간을 찾고, 그 구간의 중요도를 매기는 문제다.
    • 기존 데이터셋은 질의당 구간이 하나라는 가정이 많았다.
    우리 기능과의 관계
    • 영상 안전 판단에서 "질의로 구간 찾기 + 중요도 점수"라는 평가 틀 자체가 우리와 같은 문제다.
  11. T12-11구조대응

    BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

    저자
    Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi
    연도
    2023
    발표처
    ICML 2023. PMLR 202권 19730-19742쪽
    한국어 검토 보기
    핵심 구조
    • 이미지 인코더와 언어모델을 둘 다 얼려 둔다(frozen). 가중치를 고치지 않는다는 뜻이다.
    • 그 사이에 가벼운 Querying Transformer(Q-Former)를 끼운다. 이 작은 모듈만 학습한다.
    • 학습은 2단계다. 1단계는 얼린 이미지 인코더에서 시각-언어 표현을 뽑는 학습. 2단계는 얼린 언어모델로 글을 만들어 내는 학습.
    주요 결과
    • 학습해야 할 파라미터가 기존 방법보다 훨씬 적은데도 여러 시각-언어 과제에서 당시 최고 성능을 보고했다.
    • 제로샷 VQAv2에서 Flamingo80B를 8.7% 앞섰다. 학습 파라미터는 54배 적다.
    • 지시문을 따라 이미지를 글로 옮기는 제로샷 능력이 나타났다고 보고했다.
    한계
    • 정지 이미지 기준 구조다. 프레임 사이 시간 관계는 다루지 않는다.
    • 얼린 언어모델의 편향과 환각을 그대로 물려받는다.
    • 산업 현장 영상에 대한 별도 평가는 없다.
    푸는 문제
    • 이미지와 글을 같이 학습시키는 비용이 너무 커졌다. 큰 모델을 처음부터 끝까지 같이 학습시켜야 했기 때문이다.
    • 이미 잘 학습된 이미지 인코더와 언어모델을 그대로 두고 쓸 방법이 필요하다.
    우리 기능과의 관계
    • 이 문서 3번 SeViLA가 바로 BLIP-2 하나에서 Localizer와 Answerer 두 모듈을 떼어 만든 구조다. 그래서 기반 부품 자리에 함께 놓아야 앞뒤가 맞는다.
    • 큰 모델을 다시 학습시키지 않고 작은 연결 모듈만 붙여 현장 과제에 맞추는 방식에 대응한다.
  12. T12-12유사문제

    EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

    저자
    Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik
    연도
    2023
    발표처
    NeurIPS 2023, Datasets and Benchmarks Track
    한국어 검토 보기
    핵심 구조
    • Ego4D 영상에서 만든 객관식 질의응답 데이터셋이다. 사람이 다듬은 문제 5000개 이상, 영상 250시간 이상.
    • 문제 하나마다 3분짜리 영상 클립이 붙고 보기 5개 중 하나를 고른다.
    • "시간 증명 집합(temporal certificate set)"이라는 지표를 새로 제안했다. 답을 확정하려면 최소 몇 초 분량을 봐야 하는지를 잰다.
    주요 결과
    • 이 지표로 재면 EgoSchema의 시간 난이도가 2위 데이터셋의 약 5.7배다.
    • 당시 최고 수준 VLM이 33% 미만 정확도에 그쳤다. 찍기 기준은 20%다.
    • 사람은 약 76%를 맞혔다. 격차가 크다는 것을 보였다.
    한계
    • 1인칭 착용 카메라 영상 위주다. 고정 CCTV 시점과 화면 구성이 다르다.
    • 객관식이라 근거 구간 자체는 평가하지 않는다.
    푸는 문제
    • 긴 영상을 정말로 이해했는지 재는 자리가 없었다. 기존 데이터셋은 한 장면만 봐도 답이 나오는 문제가 많았다.
    • 얼마나 긴 시간을 봐야 답할 수 있는지를 수치로 재는 기준이 필요하다.
    우리 기능과의 관계
    • 이 문서 안 VideoAgent, LLoVi, Frame-Voyager가 모두 이 벤치마크로 숫자를 낸다. 비교의 공통 자다.
    • 긴 설비 영상 이해 성능을 우리가 잴 때 참고할 수 있는 문제 설계다.
  13. T12-14유사문제

    Evaluating Object Hallucination in Large Vision-Language Models (POPE)

    저자
    Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, Ji-Rong Wen
    연도
    2023
    발표처
    EMNLP 2023
    한국어 검토 보기
    핵심 구조
    • 물체 환각을 체계적으로 측정한 첫 연구다.
    • POPE라는 평가법을 제안한다. "이 이미지에 X가 있나요"를 예/아니오로 묻는 투표식 질의다.
    • 없는 물체를 고르는 방식을 세 가지로 나눈다. 무작위, 자주 나오는 물체, 실제 물체와 자주 같이 나오는 물체다.
    주요 결과
    • 여러 시각-언어 모델이 물체 환각을 심하게 일으킨다는 것을 보였다.
    • 학습 데이터에 자주 나오거나 실제 물체와 같이 자주 등장하는 물체일수록 더 많이 지어낸다.
    • 기존 캡션 기반 평가보다 안정적이고 유연하다는 점을 보였다. 코드와 데이터를 공개했다.
    한계
    • 정지 이미지의 물체 존재 여부만 본다. 영상의 동작이나 시간 관계 환각은 범위 밖이다.
    • 예/아니오 질문이라 서술형 답변의 환각은 간접적으로만 잡는다.
    푸는 문제
    • 시각-언어 모델이 화면에 없는 물체를 있다고 말한다. 이걸 물체 환각이라 부른다.
    • 근거를 대라고 시키는 시스템에서 이 문제는 곧바로 오탐으로 이어진다.
    우리 기능과의 관계
    • 영상 안전 판단이 "없는 위험을 봤다"고 말하는 오탐을 재는 방식에 대응한다.
    • NExT-GQA가 근거 구간의 정확성을 본다면, 이 논문은 존재하지 않는 대상을 지어내는 쪽을 본다. 신뢰성 축을 둘로 나눠 볼 수 있다.
    • 위 한계 중 영상 쪽 빈자리는 아래 15번 VideoHallucer가 메운다. 둘을 같이 봐야 한다.
  14. T12-15유사문제

    VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

    저자
    Yuxuan Wang, Yueqian Wang, Dongyan Zhao, Cihang Xie, Zilong Zheng
    연도
    2024
    발표처
    arXiv 프리프린트. arXiv 초록 페이지에 학회 표시가 없다
    한국어 검토 보기
    핵심 구조
    • 영상-언어 모델의 환각을 종합적으로 재는 첫 벤치마크라고 밝혔다.
    • 환각을 크게 둘로 나눈다. 내재(intrinsic)와 외재(extrinsic)다. 다시 세부로 나눈다. 물체-관계, 시간, 의미 세부, 외재 사실, 외재 비사실 다섯 가지다.
    • 측정 방식은 짝지은 예/아니오 질문이다. 기본 질문 하나와 환각을 유도하는 질문 하나를 짝으로 만들어 둘 다 맞혀야 통과시킨다.
    주요 결과
    • 영상-언어 모델 11종을 평가했다.
    • 지금 모델 대부분이 환각 문제가 심각하다는 것을 보였다.
    • 데이터와 파라미터를 키우면 기본 시각 단서와 반사실 판별은 좋아진다. 그런데 외재 사실 환각 잡기에는 도움이 거의 없다.
    • 지금 모델은 사실을 알아보는 쪽은 잘하지만 환각을 잡아내는 쪽은 약하다.
    • 부산물로 self-PEP 프레임워크를 내놨다. 모든 구조에서 환각 저항력이 평균 5.38% 올랐다고 보고했다.
    한계
    • 예/아니오 짝 질문 방식이다. 서술형 보고서의 환각은 간접적으로만 잡는다.
    • 평가 대상이 2024년 시점 모델 11종이다. 이후 모델은 다시 재야 한다.
    • 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
    푸는 문제
    • 영상까지 다루는 멀티모달 LLM이 영상에 없는 내용을 지어낸다. 이걸 영상 환각이라 부른다.
    • 정지 이미지용 환각 측정법(POPE)만으로는 영상의 동작이나 시간 관계 환각을 못 잡는다. 영상 전용 측정 자리가 필요하다.
    우리 기능과의 관계
    • 영상 안전 판단이 "없던 동작을 봤다", "순서를 바꿔 말한다"고 지어내는 오탐을 재는 문제와 같다.
    • POPE가 정지 이미지 물체 존재만 본다면, 이쪽은 시간과 동작까지 본다. 신뢰성 측정을 영상으로 넓히는 자리다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기