연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T12. 영상 이해와 근거 선택 (Vision-Language Model)
- T12-2구조대응2025년 이후
Adaptive Keyframe Sampling for Long Video Understanding
한국어 검토 보기
핵심 구조
- 키프레임 선택을 최적화 문제로 정의한다.
- 두 가지를 같이 본다. 하나는 프롬프트와의 관련도, 다른 하나는 영상 전체에 대한 커버리지(고르게 덮는 정도)다.
- 기존 MLLM 앞단에 끼워 넣는 모듈이다. 모델 본체는 건드리지 않는다.
주요 결과
- 긴 영상 벤치마크에서 고정 토큰 조건으로 영상 질의응답 성능이 올라갔다.
- 저자들은 "영상 기반 MLLM에서 정보 사전 선별이 중요하다"는 점을 강조한다. 코드를 공개했다.
한계
- 관련도와 커버리지의 균형점을 어떻게 잡을지가 하이퍼파라미터에 달렸다.
- 질문이 영상 전체에 흩어진 여러 사건을 요구하면 커버리지 항만으로는 부족할 수 있다.
푸는 문제
- 이미지 한 장이 아니라 긴 영상이 들어오면 시각 토큰이 모델 용량을 크게 넘는다.
- 정해진 토큰 예산 안에서 유용한 정보를 최대로 담아야 한다.
우리 기능과의 관계
- 설비 영상 장시간 녹화에서 이상 구간만 골라 AI 분석에 넘기는 사전 선별 단계에 대응한다.
- T12-1구조대응2025년 이후
Frame-Voyager: Learning to Query Frames for Video Large Language Models
한국어 검토 보기
핵심 구조
- 프레임 "조합"을 고르도록 학습한다. 프레임 하나씩이 아니라 T개 묶음 단위다.
- 학습 라벨 만드는 법이 핵심이다. M개 프레임에서 T개 조합을 여러 개 뽑아 기존 Video-LLM에 넣고, 예측 손실(loss)이 낮은 조합을 좋은 조합으로 순위 매긴다.
- 이 순위를 지도 신호로 써서 선택 모델을 따로 학습한다.
주요 결과
- 영상 질의응답 벤치마크 4종에서, 서로 다른 Video-LLM 2종에 끼워 넣어 모든 설정에서 개선을 보고했다.
- 끼워 넣기만 하면 되는 plug-and-play 방식이다.
한계
- 조합을 훑어서 라벨을 만드는 과정 자체가 비싸다. 조합 수가 늘면 비용이 급격히 는다.
- 라벨의 품질이 기준으로 쓴 Video-LLM 성능에 묶인다.
- 학습된 도메인 밖(공장 CCTV 같은 산업 영상)에서의 성능은 논문 범위 밖이다.
푸는 문제
- 영상 전체를 모델에 넣을 수 없다. 입력 토큰 상한 때문이다.
- 기존 방식인 균등 샘플링(일정 간격으로 뽑기)과 글-프레임 검색은 정보 밀도 차이와 복잡한 지시문을 반영하지 못한다.
우리 기능과의 관계
- 영상 안전 판단에서 "이 장면 중 어느 프레임을 근거로 볼지"를 질문에 맞춰 고르는 구조에 대응한다.
- T12-13유사문제2025년 이후
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
한국어 검토 보기
핵심 구조
- 특징 네 가지를 내세운다. 영역 다양성(시각 영역 6개, 세부 분야 30개), 시간 길이 다양성(11초부터 1시간까지), 입력 다양성(프레임에 자막과 오디오까지), 사람 전문가 주석.
- 규모는 영상 900편, 총 254시간, 질의응답 쌍 2700개다. 모두 사람이 직접 붙였다.
주요 결과
- 상용 모델 중에서는 Gemini 1.5 Pro가 가장 좋았고 공개 모델을 크게 앞섰다.
- 영상이 길어질수록 성능이 떨어지는 공통 약점을 보였다.
- 자막과 오디오를 같이 넣으면 성능이 오른다는 점도 보였다.
한계
- 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
- 객관식 평가라 근거 제시 능력은 직접 재지 않는다.
푸는 문제
- 영상용 멀티모달 LLM을 종합적으로 재는 자리가 없었다.
- 짧은 영상만 재거나, 영역이 한쪽에 치우친 데이터셋이 대부분이었다.
우리 기능과의 관계
- 긴 영상 이해 성능을 재는 최신 국제 기준이다. 후보 모델을 고를 때 비교 근거로 쓸 수 있다.
- T12-3구조대응
Self-Chained Image-Language Model for Video Localization and Question Answering (SeViLA)
한국어 검토 보기
핵심 구조
- BLIP-2 하나에서 두 모듈을 만든다. 위치찾기(Localizer)와 답변(Answerer)이다.
- 앞뒤로 연결한다. Localizer가 질문과 관련 있는 키프레임을 고르면 Answerer가 그걸로 답한다.
- 반대 방향도 쓴다. Answerer가 만든 유사 라벨(pseudo-label)로 Localizer를 스스로 학습시킨다. 사람 구간 라벨이 없어도 된다.
주요 결과
- 영상 질의응답과 사건 예측 벤치마크 5종에서 강한 기준 모델들을 앞섰다고 보고했다.
- 초록이 이름을 밝힌 것은 두 갈래다. 미세조정 최고 성능은 NExT-QA와 STAR, 제로샷 최고 성능은 NExT-QA, STAR, How2QA, VLEP다.
- 다섯 번째 이름은 초록에 없다. 공식 저장소(https://github.com/Yui010206/SeViLA)는 평가 데이터로 NExT-QA, STAR, How2QA, TVQA, VLEP를 쓰고, QVHighlights로는 Localizer를 사전학습한다고 적었다.
한계
- 유사 라벨이 답변 모델의 편향을 그대로 물려받는다.
- 이미지 모델 기반이라 프레임 사이 움직임 정보를 직접 다루지는 않는다.
푸는 문제
- 질문에 답할 근거가 영상의 일부 구간에만 있다. 균등 샘플링은 중요한 단서를 놓친다.
- 시간 위치 찾기와 질의응답을 따로 학습하려면 사람이 붙인 구간 라벨이 비싸다.
우리 기능과의 관계
- 영상 안전 판단에서 "근거 구간 찾기"와 "판단"을 두 단계로 나누고, 사람 라벨 없이 돌리는 구조에 대응한다.
- T12-4구조대응
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
한국어 검토 보기
핵심 구조
- 언어모델을 중심 에이전트로 둔다. 에이전트가 "지금 정보가 충분한가"를 판단하고, 부족하면 어느 구간을 더 볼지 결정한다.
- 시각-언어 모델(VLM)과 검색 모델을 도구로 쓴다. 캡션 생성과 프레임 검색을 도구 호출로 처리한다.
- 반복 추론과 계획을 강조한다. 프레임을 한 번에 정하지 않는다.
주요 결과
- EgoSchema 54.1%, NExT-QA 71.3% 제로샷 정확도.
- 영상당 평균 8.4장, 8.2장만 썼다. 프레임을 훨씬 적게 쓰고도 기존 최고 성능을 넘었다.
한계
- 언어모델 호출이 여러 번 일어나 지연과 비용이 늘어난다. 실시간 판단에는 부담이다.
- 도구(캡셔너, 검색기) 품질에 결과가 크게 좌우된다.
같은 이름 주의
- 2024년에 이름이 똑같은 다른 논문이 있다. VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding이다.
- 여기서 말하는 VideoAgent는 스탠퍼드 팀(Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy)의 arXiv:2403.10517이다. 저자를 같이 적어야 헷갈리지 않는다.
푸는 문제
- 긴 영상을 한 번에 밀어 넣는 대신, 필요한 정보만 반복해서 찾아오는 방식이 가능한가.
우리 기능과의 관계
- 업무 실행 에이전트가 영상 근거를 스스로 더 찾아오며 판단을 다듬는 구조에 대응한다.
- T12-5후보
A Simple LLM Framework for Long-Range Video Question-Answering (LLoVi)
한국어 검토 보기
핵심 구조
- 두 단계다. 먼저 짧은 클립마다 캡션(글 설명)을 만든다. 다음에 언어모델이 그 캡션들을 모아 시간 추론을 한다.
- 프롬프트 설계가 중요하다. 답하기 전에 캡션을 먼저 요약하게 시키면 성능이 크게 오른다.
주요 결과
- EgoSchema 50.3% 정확도. 이전 최고 대비 18.1%p 개선을 보고했다.
- NExT-QA, IntentQA, NExT-GQA에서도 개선을 보고했다.
한계
- 캡션이 놓친 정보는 언어모델이 복구할 수 없다. 캡셔너가 병목이다.
- 미세한 동작이나 수치 판독처럼 글로 옮기기 어려운 단서에 약하다.
푸는 문제
- 긴 영상 질의응답에 반드시 전용 영상 모델이 필요한가. 더 단순한 방법은 없나.
우리 기능과의 관계
- 설비 영상을 글 로그로 바꿔 두고 AI 보고서 단계에서 언어모델로 추론하는 방식의 후보다.
- T12-6유사문제
Can I Trust Your Answer? Visually Grounded Video Question Answering (NExT-GQA)
한국어 검토 보기
핵심 구조
- NExT-QA에 시간 구간 라벨 10.5K개를 붙여 NExT-GQA 데이터셋을 만들었다. 답과 근거 구간을 같이 평가한다.
- 사후 어텐션 분석으로 기존 VLM이 근거를 얼마나 짚는지 측정했다.
- 개선안으로 가우시안 마스크 최적화와 교차 모달 학습을 제안했다.
주요 결과
- 질의응답 성능은 강한데 근거 제시 능력은 매우 약하다는 것을 정량으로 보였다.
- 제안 방법으로 근거 정확도와 질의응답 성능을 함께 올렸다.
한계
- 근거를 시간 구간으로만 본다. 화면 안 어느 위치인지(공간 근거)는 다루지 않는다.
- 일상 영상 중심이다. 산업 현장 영상으로 그대로 옮겨지는지는 미검증이다.
푸는 문제
- 영상 질의응답 모델이 답은 잘 맞히는데, 그 답이 실제 영상 근거에 붙어 있는가.
- 근거 없이 언어 편향이나 우연한 패턴으로 맞히는 경우를 걸러야 한다.
우리 기능과의 관계
- 영상 안전 판단과 AI 보고서에서 "판단 근거를 시간 구간으로 함께 제시하고 검증한다"는 요구와 같은 문제를 다룬다.
- T12-7구조대응
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
한국어 검토 보기
핵심 구조
- 두 가지 모듈을 넣었다. 하나는 프레임의 시각 정보와 타임스탬프(시각 표시)를 묶어 인코딩하는 부분이다.
- 다른 하나는 영상 길이에 따라 표현 개수를 바꾸는 적응형 모듈이다. 짧은 영상과 긴 영상을 같은 방식으로 다루지 않는다.
- 6개 과제, 12.5만 건 규모의 시간 관련 지시 데이터셋(TimeIT)을 만들어 학습했다.
주요 결과
- YouCook2 조밀 캡션에서 F1 +9.2, CIDEr +2.8.
- 하이라이트 검출에서 5.8점 개선.
- 시간 구간 찾기에서 27.5의 상대 개선을 보고했다.
한계
- 학습 데이터가 일상, 요리, 지시 영상 위주다. 제조 현장 영상은 포함되지 않았다.
- 절대 성능은 여전히 낮은 편이다. 개선폭이 크다는 것과 실용 수준은 다르다.
푸는 문제
- 기존 영상 LLM은 전체 요약만 한다. 사건이 몇 초에 일어났는지 못 짚는다.
우리 기능과의 관계
- 설비 영상에서 "몇 시 몇 분에 무슨 일"을 타임스탬프와 함께 뽑아 AI 보고서에 넣는 구조에 대응한다.
- T12-8구조대응
VTimeLLM: Empower LLM to Grasp Video Moments
한국어 검토 보기
핵심 구조
- 경계를 의식한 3단계 학습이다.
- 1단계는 이미지-글 쌍으로 특징 정렬. 2단계는 사건이 여러 개 든 영상으로 경계 민감도 학습. 3단계는 고품질 영상 지시 데이터로 미세조정.
주요 결과
- 시간 구간 찾기와 조밀 영상 캡션에서 기존 영상 LLM을 크게 앞섰다.
- 영상 대화 벤치마크에서도 앞섰다. 시간 이해가 좋아지면 대화 품질도 오른다는 점을 보였다.
한계
- 단계별 학습이라 데이터 준비와 학습 비용이 크다.
- 경계 정밀도는 초 단위다. 밀리초 단위 안전 판단에는 그대로 쓰기 어렵다.
근거 링크 주의
- arXiv 초록 페이지에는 학회 표시가 없다.
- 학회 확인은 위 CVF 오픈액세스 페이지로 한다. 저자와 쪽수가 그 페이지에 그대로 적혀 있다.
푸는 문제
- 영상 LLM이 사건의 시작과 끝 경계를 정확히 못 잡는다.
우리 기능과의 관계
- 영상 안전 판단에서 위험 행동의 시작과 끝 시각을 말로 뱉게 만드는 구조에 대응한다.
- T12-9유사문제
QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries (Moment-DETR)
한국어 검토 보기
핵심 구조
- QVHighlights 데이터셋. 유튜브 영상 1만 편 이상. 사람이 쓴 질의, 관련 구간, 중요도 점수가 함께 있다.
- Moment-DETR 모델. 구간 찾기를 집합 예측(set prediction) 문제로 본다. 별도 후보 구간 생성이나 사전 정의 앵커가 없다.
- 음성 인식 자막(ASR)을 약지도 신호로 써서 사전학습하면 성능이 크게 오른다.
주요 결과
- 유튜브 영상 1만 편 이상에 사람이 쓴 질의, 관련 구간, 5점 척도 중요도 점수를 모두 붙였다. 이 세 가지를 함께 붙인 데이터셋이 그전에 없었다.
- Moment-DETR은 사람이 넣은 사전 지식(후보 구간 생성, 앵커) 없이도 잘 만들어진 기존 구조들과 견줄 성능을 냈다.
- ASR 자막으로 약지도 사전학습을 하면 Moment-DETR이 기존 방법들을 크게 앞선다고 보고했다.
- 부분 제거 실험(ablation)과 시각화를 함께 실었다.
한계
- LLM 이전 세대 구조다. 자유로운 지시문 이해나 근거 설명 생성은 못 한다.
- 유튜브 브이로그와 뉴스 도메인이다. 산업 영상과 분포가 다르다.
푸는 문제
- 자연어 질의로 영상 속 구간을 찾고, 그 구간의 중요도를 매기는 문제다.
- 기존 데이터셋은 질의당 구간이 하나라는 가정이 많았다.
우리 기능과의 관계
- 영상 안전 판단에서 "질의로 구간 찾기 + 중요도 점수"라는 평가 틀 자체가 우리와 같은 문제다.
- T12-11구조대응
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
한국어 검토 보기
핵심 구조
- 이미지 인코더와 언어모델을 둘 다 얼려 둔다(frozen). 가중치를 고치지 않는다는 뜻이다.
- 그 사이에 가벼운 Querying Transformer(Q-Former)를 끼운다. 이 작은 모듈만 학습한다.
- 학습은 2단계다. 1단계는 얼린 이미지 인코더에서 시각-언어 표현을 뽑는 학습. 2단계는 얼린 언어모델로 글을 만들어 내는 학습.
주요 결과
- 학습해야 할 파라미터가 기존 방법보다 훨씬 적은데도 여러 시각-언어 과제에서 당시 최고 성능을 보고했다.
- 제로샷 VQAv2에서 Flamingo80B를 8.7% 앞섰다. 학습 파라미터는 54배 적다.
- 지시문을 따라 이미지를 글로 옮기는 제로샷 능력이 나타났다고 보고했다.
한계
- 정지 이미지 기준 구조다. 프레임 사이 시간 관계는 다루지 않는다.
- 얼린 언어모델의 편향과 환각을 그대로 물려받는다.
- 산업 현장 영상에 대한 별도 평가는 없다.
푸는 문제
- 이미지와 글을 같이 학습시키는 비용이 너무 커졌다. 큰 모델을 처음부터 끝까지 같이 학습시켜야 했기 때문이다.
- 이미 잘 학습된 이미지 인코더와 언어모델을 그대로 두고 쓸 방법이 필요하다.
우리 기능과의 관계
- 이 문서 3번 SeViLA가 바로 BLIP-2 하나에서 Localizer와 Answerer 두 모듈을 떼어 만든 구조다. 그래서 기반 부품 자리에 함께 놓아야 앞뒤가 맞는다.
- 큰 모델을 다시 학습시키지 않고 작은 연결 모듈만 붙여 현장 과제에 맞추는 방식에 대응한다.
- T12-12유사문제
EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding
한국어 검토 보기
핵심 구조
- Ego4D 영상에서 만든 객관식 질의응답 데이터셋이다. 사람이 다듬은 문제 5000개 이상, 영상 250시간 이상.
- 문제 하나마다 3분짜리 영상 클립이 붙고 보기 5개 중 하나를 고른다.
- "시간 증명 집합(temporal certificate set)"이라는 지표를 새로 제안했다. 답을 확정하려면 최소 몇 초 분량을 봐야 하는지를 잰다.
주요 결과
- 이 지표로 재면 EgoSchema의 시간 난이도가 2위 데이터셋의 약 5.7배다.
- 당시 최고 수준 VLM이 33% 미만 정확도에 그쳤다. 찍기 기준은 20%다.
- 사람은 약 76%를 맞혔다. 격차가 크다는 것을 보였다.
한계
- 1인칭 착용 카메라 영상 위주다. 고정 CCTV 시점과 화면 구성이 다르다.
- 객관식이라 근거 구간 자체는 평가하지 않는다.
푸는 문제
- 긴 영상을 정말로 이해했는지 재는 자리가 없었다. 기존 데이터셋은 한 장면만 봐도 답이 나오는 문제가 많았다.
- 얼마나 긴 시간을 봐야 답할 수 있는지를 수치로 재는 기준이 필요하다.
우리 기능과의 관계
- 이 문서 안 VideoAgent, LLoVi, Frame-Voyager가 모두 이 벤치마크로 숫자를 낸다. 비교의 공통 자다.
- 긴 설비 영상 이해 성능을 우리가 잴 때 참고할 수 있는 문제 설계다.
- T12-14유사문제
Evaluating Object Hallucination in Large Vision-Language Models (POPE)
한국어 검토 보기
핵심 구조
- 물체 환각을 체계적으로 측정한 첫 연구다.
- POPE라는 평가법을 제안한다. "이 이미지에 X가 있나요"를 예/아니오로 묻는 투표식 질의다.
- 없는 물체를 고르는 방식을 세 가지로 나눈다. 무작위, 자주 나오는 물체, 실제 물체와 자주 같이 나오는 물체다.
주요 결과
- 여러 시각-언어 모델이 물체 환각을 심하게 일으킨다는 것을 보였다.
- 학습 데이터에 자주 나오거나 실제 물체와 같이 자주 등장하는 물체일수록 더 많이 지어낸다.
- 기존 캡션 기반 평가보다 안정적이고 유연하다는 점을 보였다. 코드와 데이터를 공개했다.
한계
- 정지 이미지의 물체 존재 여부만 본다. 영상의 동작이나 시간 관계 환각은 범위 밖이다.
- 예/아니오 질문이라 서술형 답변의 환각은 간접적으로만 잡는다.
푸는 문제
- 시각-언어 모델이 화면에 없는 물체를 있다고 말한다. 이걸 물체 환각이라 부른다.
- 근거를 대라고 시키는 시스템에서 이 문제는 곧바로 오탐으로 이어진다.
우리 기능과의 관계
- 영상 안전 판단이 "없는 위험을 봤다"고 말하는 오탐을 재는 방식에 대응한다.
- NExT-GQA가 근거 구간의 정확성을 본다면, 이 논문은 존재하지 않는 대상을 지어내는 쪽을 본다. 신뢰성 축을 둘로 나눠 볼 수 있다.
- 위 한계 중 영상 쪽 빈자리는 아래 15번 VideoHallucer가 메운다. 둘을 같이 봐야 한다.
- T12-15유사문제
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
한국어 검토 보기
핵심 구조
- 영상-언어 모델의 환각을 종합적으로 재는 첫 벤치마크라고 밝혔다.
- 환각을 크게 둘로 나눈다. 내재(intrinsic)와 외재(extrinsic)다. 다시 세부로 나눈다. 물체-관계, 시간, 의미 세부, 외재 사실, 외재 비사실 다섯 가지다.
- 측정 방식은 짝지은 예/아니오 질문이다. 기본 질문 하나와 환각을 유도하는 질문 하나를 짝으로 만들어 둘 다 맞혀야 통과시킨다.
주요 결과
- 영상-언어 모델 11종을 평가했다.
- 지금 모델 대부분이 환각 문제가 심각하다는 것을 보였다.
- 데이터와 파라미터를 키우면 기본 시각 단서와 반사실 판별은 좋아진다. 그런데 외재 사실 환각 잡기에는 도움이 거의 없다.
- 지금 모델은 사실을 알아보는 쪽은 잘하지만 환각을 잡아내는 쪽은 약하다.
- 부산물로 self-PEP 프레임워크를 내놨다. 모든 구조에서 환각 저항력이 평균 5.38% 올랐다고 보고했다.
한계
- 예/아니오 짝 질문 방식이다. 서술형 보고서의 환각은 간접적으로만 잡는다.
- 평가 대상이 2024년 시점 모델 11종이다. 이후 모델은 다시 재야 한다.
- 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
푸는 문제
- 영상까지 다루는 멀티모달 LLM이 영상에 없는 내용을 지어낸다. 이걸 영상 환각이라 부른다.
- 정지 이미지용 환각 측정법(POPE)만으로는 영상의 동작이나 시간 관계 환각을 못 잡는다. 영상 전용 측정 자리가 필요하다.
우리 기능과의 관계
- 영상 안전 판단이 "없던 동작을 봤다", "순서를 바꿔 말한다"고 지어내는 오탐을 재는 문제와 같다.
- POPE가 정지 이미지 물체 존재만 본다면, 이쪽은 시간과 동작까지 본다. 신뢰성 측정을 영상으로 넓히는 자리다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기