연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T12. 영상 이해와 근거 선택 (Vision-Language Model)
- T12-13유사문제2025년 이후
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
한국어 검토 보기
핵심 구조
- 특징 네 가지를 내세운다. 영역 다양성(시각 영역 6개, 세부 분야 30개), 시간 길이 다양성(11초부터 1시간까지), 입력 다양성(프레임에 자막과 오디오까지), 사람 전문가 주석.
- 규모는 영상 900편, 총 254시간, 질의응답 쌍 2700개다. 모두 사람이 직접 붙였다.
주요 결과
- 상용 모델 중에서는 Gemini 1.5 Pro가 가장 좋았고 공개 모델을 크게 앞섰다.
- 영상이 길어질수록 성능이 떨어지는 공통 약점을 보였다.
- 자막과 오디오를 같이 넣으면 성능이 오른다는 점도 보였다.
한계
- 일반 영상 도메인이다. 제조 현장 영상은 포함되지 않는다.
- 객관식 평가라 근거 제시 능력은 직접 재지 않는다.
푸는 문제
- 영상용 멀티모달 LLM을 종합적으로 재는 자리가 없었다.
- 짧은 영상만 재거나, 영역이 한쪽에 치우친 데이터셋이 대부분이었다.
우리 기능과의 관계
- 긴 영상 이해 성능을 재는 최신 국제 기준이다. 후보 모델을 고를 때 비교 근거로 쓸 수 있다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기