연구자료실

설비 연결, 품질 검사, 생산 분석과 제조 업무에 관련된 외부 논문입니다.

연구자료 검색

논문 목록

T12. 영상 이해와 근거 선택 (Vision-Language Model)

  1. T12-5후보

    A Simple LLM Framework for Long-Range Video Question-Answering (LLoVi)

    저자
    Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius
    연도
    2023 (arXiv), 2024 (학회)
    발표처
    EMNLP 2024 main
    한국어 검토 보기
    핵심 구조
    • 두 단계다. 먼저 짧은 클립마다 캡션(글 설명)을 만든다. 다음에 언어모델이 그 캡션들을 모아 시간 추론을 한다.
    • 프롬프트 설계가 중요하다. 답하기 전에 캡션을 먼저 요약하게 시키면 성능이 크게 오른다.
    주요 결과
    • EgoSchema 50.3% 정확도. 이전 최고 대비 18.1%p 개선을 보고했다.
    • NExT-QA, IntentQA, NExT-GQA에서도 개선을 보고했다.
    한계
    • 캡션이 놓친 정보는 언어모델이 복구할 수 없다. 캡셔너가 병목이다.
    • 미세한 동작이나 수치 판독처럼 글로 옮기기 어려운 단서에 약하다.
    푸는 문제
    • 긴 영상 질의응답에 반드시 전용 영상 모델이 필요한가. 더 단순한 방법은 없나.
    우리 기능과의 관계
    • 설비 영상을 글 로그로 바꿔 두고 AI 보고서 단계에서 언어모델로 추론하는 방식의 후보다.

연구에서 제품 적용까지

운영 중인 기능, 시범 적용과 개발 중인 기술을 구분해 정리했습니다.

보유기술 보기