연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T12. 영상 이해와 근거 선택 (Vision-Language Model)
- T12-2구조대응2025년 이후
Adaptive Keyframe Sampling for Long Video Understanding
한국어 검토 보기
핵심 구조
- 키프레임 선택을 최적화 문제로 정의한다.
- 두 가지를 같이 본다. 하나는 프롬프트와의 관련도, 다른 하나는 영상 전체에 대한 커버리지(고르게 덮는 정도)다.
- 기존 MLLM 앞단에 끼워 넣는 모듈이다. 모델 본체는 건드리지 않는다.
주요 결과
- 긴 영상 벤치마크에서 고정 토큰 조건으로 영상 질의응답 성능이 올라갔다.
- 저자들은 "영상 기반 MLLM에서 정보 사전 선별이 중요하다"는 점을 강조한다. 코드를 공개했다.
한계
- 관련도와 커버리지의 균형점을 어떻게 잡을지가 하이퍼파라미터에 달렸다.
- 질문이 영상 전체에 흩어진 여러 사건을 요구하면 커버리지 항만으로는 부족할 수 있다.
푸는 문제
- 이미지 한 장이 아니라 긴 영상이 들어오면 시각 토큰이 모델 용량을 크게 넘는다.
- 정해진 토큰 예산 안에서 유용한 정보를 최대로 담아야 한다.
우리 기능과의 관계
- 설비 영상 장시간 녹화에서 이상 구간만 골라 AI 분석에 넘기는 사전 선별 단계에 대응한다.
- T12-1구조대응2025년 이후
Frame-Voyager: Learning to Query Frames for Video Large Language Models
한국어 검토 보기
핵심 구조
- 프레임 "조합"을 고르도록 학습한다. 프레임 하나씩이 아니라 T개 묶음 단위다.
- 학습 라벨 만드는 법이 핵심이다. M개 프레임에서 T개 조합을 여러 개 뽑아 기존 Video-LLM에 넣고, 예측 손실(loss)이 낮은 조합을 좋은 조합으로 순위 매긴다.
- 이 순위를 지도 신호로 써서 선택 모델을 따로 학습한다.
주요 결과
- 영상 질의응답 벤치마크 4종에서, 서로 다른 Video-LLM 2종에 끼워 넣어 모든 설정에서 개선을 보고했다.
- 끼워 넣기만 하면 되는 plug-and-play 방식이다.
한계
- 조합을 훑어서 라벨을 만드는 과정 자체가 비싸다. 조합 수가 늘면 비용이 급격히 는다.
- 라벨의 품질이 기준으로 쓴 Video-LLM 성능에 묶인다.
- 학습된 도메인 밖(공장 CCTV 같은 산업 영상)에서의 성능은 논문 범위 밖이다.
푸는 문제
- 영상 전체를 모델에 넣을 수 없다. 입력 토큰 상한 때문이다.
- 기존 방식인 균등 샘플링(일정 간격으로 뽑기)과 글-프레임 검색은 정보 밀도 차이와 복잡한 지시문을 반영하지 못한다.
우리 기능과의 관계
- 영상 안전 판단에서 "이 장면 중 어느 프레임을 근거로 볼지"를 질문에 맞춰 고르는 구조에 대응한다.
- T12-3구조대응
Self-Chained Image-Language Model for Video Localization and Question Answering (SeViLA)
한국어 검토 보기
핵심 구조
- BLIP-2 하나에서 두 모듈을 만든다. 위치찾기(Localizer)와 답변(Answerer)이다.
- 앞뒤로 연결한다. Localizer가 질문과 관련 있는 키프레임을 고르면 Answerer가 그걸로 답한다.
- 반대 방향도 쓴다. Answerer가 만든 유사 라벨(pseudo-label)로 Localizer를 스스로 학습시킨다. 사람 구간 라벨이 없어도 된다.
주요 결과
- 영상 질의응답과 사건 예측 벤치마크 5종에서 강한 기준 모델들을 앞섰다고 보고했다.
- 초록이 이름을 밝힌 것은 두 갈래다. 미세조정 최고 성능은 NExT-QA와 STAR, 제로샷 최고 성능은 NExT-QA, STAR, How2QA, VLEP다.
- 다섯 번째 이름은 초록에 없다. 공식 저장소(https://github.com/Yui010206/SeViLA)는 평가 데이터로 NExT-QA, STAR, How2QA, TVQA, VLEP를 쓰고, QVHighlights로는 Localizer를 사전학습한다고 적었다.
한계
- 유사 라벨이 답변 모델의 편향을 그대로 물려받는다.
- 이미지 모델 기반이라 프레임 사이 움직임 정보를 직접 다루지는 않는다.
푸는 문제
- 질문에 답할 근거가 영상의 일부 구간에만 있다. 균등 샘플링은 중요한 단서를 놓친다.
- 시간 위치 찾기와 질의응답을 따로 학습하려면 사람이 붙인 구간 라벨이 비싸다.
우리 기능과의 관계
- 영상 안전 판단에서 "근거 구간 찾기"와 "판단"을 두 단계로 나누고, 사람 라벨 없이 돌리는 구조에 대응한다.
- T12-4구조대응
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
한국어 검토 보기
핵심 구조
- 언어모델을 중심 에이전트로 둔다. 에이전트가 "지금 정보가 충분한가"를 판단하고, 부족하면 어느 구간을 더 볼지 결정한다.
- 시각-언어 모델(VLM)과 검색 모델을 도구로 쓴다. 캡션 생성과 프레임 검색을 도구 호출로 처리한다.
- 반복 추론과 계획을 강조한다. 프레임을 한 번에 정하지 않는다.
주요 결과
- EgoSchema 54.1%, NExT-QA 71.3% 제로샷 정확도.
- 영상당 평균 8.4장, 8.2장만 썼다. 프레임을 훨씬 적게 쓰고도 기존 최고 성능을 넘었다.
한계
- 언어모델 호출이 여러 번 일어나 지연과 비용이 늘어난다. 실시간 판단에는 부담이다.
- 도구(캡셔너, 검색기) 품질에 결과가 크게 좌우된다.
같은 이름 주의
- 2024년에 이름이 똑같은 다른 논문이 있다. VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding이다.
- 여기서 말하는 VideoAgent는 스탠퍼드 팀(Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy)의 arXiv:2403.10517이다. 저자를 같이 적어야 헷갈리지 않는다.
푸는 문제
- 긴 영상을 한 번에 밀어 넣는 대신, 필요한 정보만 반복해서 찾아오는 방식이 가능한가.
우리 기능과의 관계
- 업무 실행 에이전트가 영상 근거를 스스로 더 찾아오며 판단을 다듬는 구조에 대응한다.
- T12-7구조대응
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
한국어 검토 보기
핵심 구조
- 두 가지 모듈을 넣었다. 하나는 프레임의 시각 정보와 타임스탬프(시각 표시)를 묶어 인코딩하는 부분이다.
- 다른 하나는 영상 길이에 따라 표현 개수를 바꾸는 적응형 모듈이다. 짧은 영상과 긴 영상을 같은 방식으로 다루지 않는다.
- 6개 과제, 12.5만 건 규모의 시간 관련 지시 데이터셋(TimeIT)을 만들어 학습했다.
주요 결과
- YouCook2 조밀 캡션에서 F1 +9.2, CIDEr +2.8.
- 하이라이트 검출에서 5.8점 개선.
- 시간 구간 찾기에서 27.5의 상대 개선을 보고했다.
한계
- 학습 데이터가 일상, 요리, 지시 영상 위주다. 제조 현장 영상은 포함되지 않았다.
- 절대 성능은 여전히 낮은 편이다. 개선폭이 크다는 것과 실용 수준은 다르다.
푸는 문제
- 기존 영상 LLM은 전체 요약만 한다. 사건이 몇 초에 일어났는지 못 짚는다.
우리 기능과의 관계
- 설비 영상에서 "몇 시 몇 분에 무슨 일"을 타임스탬프와 함께 뽑아 AI 보고서에 넣는 구조에 대응한다.
- T12-8구조대응
VTimeLLM: Empower LLM to Grasp Video Moments
한국어 검토 보기
핵심 구조
- 경계를 의식한 3단계 학습이다.
- 1단계는 이미지-글 쌍으로 특징 정렬. 2단계는 사건이 여러 개 든 영상으로 경계 민감도 학습. 3단계는 고품질 영상 지시 데이터로 미세조정.
주요 결과
- 시간 구간 찾기와 조밀 영상 캡션에서 기존 영상 LLM을 크게 앞섰다.
- 영상 대화 벤치마크에서도 앞섰다. 시간 이해가 좋아지면 대화 품질도 오른다는 점을 보였다.
한계
- 단계별 학습이라 데이터 준비와 학습 비용이 크다.
- 경계 정밀도는 초 단위다. 밀리초 단위 안전 판단에는 그대로 쓰기 어렵다.
근거 링크 주의
- arXiv 초록 페이지에는 학회 표시가 없다.
- 학회 확인은 위 CVF 오픈액세스 페이지로 한다. 저자와 쪽수가 그 페이지에 그대로 적혀 있다.
푸는 문제
- 영상 LLM이 사건의 시작과 끝 경계를 정확히 못 잡는다.
우리 기능과의 관계
- 영상 안전 판단에서 위험 행동의 시작과 끝 시각을 말로 뱉게 만드는 구조에 대응한다.
- T12-11구조대응
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
한국어 검토 보기
핵심 구조
- 이미지 인코더와 언어모델을 둘 다 얼려 둔다(frozen). 가중치를 고치지 않는다는 뜻이다.
- 그 사이에 가벼운 Querying Transformer(Q-Former)를 끼운다. 이 작은 모듈만 학습한다.
- 학습은 2단계다. 1단계는 얼린 이미지 인코더에서 시각-언어 표현을 뽑는 학습. 2단계는 얼린 언어모델로 글을 만들어 내는 학습.
주요 결과
- 학습해야 할 파라미터가 기존 방법보다 훨씬 적은데도 여러 시각-언어 과제에서 당시 최고 성능을 보고했다.
- 제로샷 VQAv2에서 Flamingo80B를 8.7% 앞섰다. 학습 파라미터는 54배 적다.
- 지시문을 따라 이미지를 글로 옮기는 제로샷 능력이 나타났다고 보고했다.
한계
- 정지 이미지 기준 구조다. 프레임 사이 시간 관계는 다루지 않는다.
- 얼린 언어모델의 편향과 환각을 그대로 물려받는다.
- 산업 현장 영상에 대한 별도 평가는 없다.
푸는 문제
- 이미지와 글을 같이 학습시키는 비용이 너무 커졌다. 큰 모델을 처음부터 끝까지 같이 학습시켜야 했기 때문이다.
- 이미 잘 학습된 이미지 인코더와 언어모델을 그대로 두고 쓸 방법이 필요하다.
우리 기능과의 관계
- 이 문서 3번 SeViLA가 바로 BLIP-2 하나에서 Localizer와 Answerer 두 모듈을 떼어 만든 구조다. 그래서 기반 부품 자리에 함께 놓아야 앞뒤가 맞는다.
- 큰 모델을 다시 학습시키지 않고 작은 연결 모듈만 붙여 현장 과제에 맞추는 방식에 대응한다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기