연구자료실
설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.
연구자료 검색
논문 목록
T12. 영상 이해와 근거 선택 (Vision-Language Model)
- T12-5후보
A Simple LLM Framework for Long-Range Video Question-Answering (LLoVi)
한국어 검토 보기
핵심 구조
- 두 단계다. 먼저 짧은 클립마다 캡션(글 설명)을 만든다. 다음에 언어모델이 그 캡션들을 모아 시간 추론을 한다.
- 프롬프트 설계가 중요하다. 답하기 전에 캡션을 먼저 요약하게 시키면 성능이 크게 오른다.
주요 결과
- EgoSchema 50.3% 정확도. 이전 최고 대비 18.1%p 개선을 보고했다.
- NExT-QA, IntentQA, NExT-GQA에서도 개선을 보고했다.
한계
- 캡션이 놓친 정보는 언어모델이 복구할 수 없다. 캡셔너가 병목이다.
- 미세한 동작이나 수치 판독처럼 글로 옮기기 어려운 단서에 약하다.
푸는 문제
- 긴 영상 질의응답에 반드시 전용 영상 모델이 필요한가. 더 단순한 방법은 없나.
우리 기능과의 관계
- 설비 영상을 글 로그로 바꿔 두고 AI 보고서 단계에서 언어모델로 추론하는 방식의 후보다.
연구에서 제품 적용까지
운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.
보유기술 보기