Research library

Search papers on equipment connectivity, quality inspection, production analysis, and manufacturing work.

Search and filter

Paper list

T12. Video understanding and evidence selection with vision-language models

Research on explaining what a camera saw and pointing back to the evidence frame.

  1. T12-2Structural parallelSince 2025

    Adaptive Keyframe Sampling for Long Video Understanding

    Authors
    Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye
    Year
    2025
    Venue
    CVPR 2025

    Korean review of T12-2

  2. T12-1Structural parallelSince 2025

    Frame-Voyager: Learning to Query Frames for Video Large Language Models

    Authors
    Sicheng Yu, Chengkai Jin, Huanyu Wang, Zhenghao Chen, Sheng Jin, Zhongrong Zuo, Xiaolei Xu, Zhenbang Sun, Bingni Zhang, Jiawei Wu, Hao Zhang, Qianru Sun
    Year
    2025
    Venue
    ICLR 2025

    Korean review of T12-1

  3. T12-13Similar problemSince 2025

    Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

    Authors
    Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen
    Year
    2025
    Venue
    CVPR 2025, pp. 24108-24118

    Korean review of T12-13

  4. T12-3Structural parallel

    Self-Chained Image-Language Model for Video Localization and Question Answering (SeViLA)

    Authors
    Shoubin Yu, Jaemin Cho, Prateek Yadav, Mohit Bansal
    Year
    2023
    Venue
    NeurIPS 2023

    Korean review of T12-3

  5. T12-4Structural parallel

    VideoAgent: Long-form Video Understanding with Large Language Model as Agent

    Authors
    Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy
    Year
    2024
    Venue
    ECCV 2024. Computer Vision - ECCV 2024, LNCS, pp. 58-76

    Korean review of T12-4

  6. T12-5Candidate approach

    A Simple LLM Framework for Long-Range Video Question-Answering (LLoVi)

    Authors
    Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, Gedas Bertasius
    Year
    2024
    Venue
    EMNLP 2024 main

    Korean review of T12-5

  7. T12-6Similar problem

    Can I Trust Your Answer? Visually Grounded Video Question Answering (NExT-GQA)

    Authors
    Junbin Xiao, Angela Yao, Yicong Li, Tat-Seng Chua
    Year
    2024
    Venue
    CVPR 2024 (Highlight)

    Korean review of T12-6

  8. T12-7Structural parallel

    TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding

    Authors
    Shuhuai Ren, Linli Yao, Shicheng Li, Xu Sun, Lu Hou
    Year
    2024
    Venue
    CVPR 2024

    Korean review of T12-7

  9. T12-8Structural parallel

    VTimeLLM: Empower LLM to Grasp Video Moments

    Authors
    Bin Huang, Xin Wang, Hong Chen, Zihan Song, Wenwu Zhu
    Year
    2024
    Venue
    CVPR 2024, pp. 14271-14280

    Korean review of T12-8

  10. T12-9Similar problem

    QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries (Moment-DETR)

    Authors
    Jie Lei, Tamara L. Berg, Mohit Bansal
    Year
    2021
    Venue
    NeurIPS 2021

    Korean review of T12-9

  11. T12-11Structural parallel

    BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

    Authors
    Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi
    Year
    2023
    Venue
    ICML 2023. PMLR vol. 202 pp. 19730-19742

    Korean review of T12-11

  12. T12-12Similar problem

    EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

    Authors
    Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik
    Year
    2023
    Venue
    NeurIPS 2023, Datasets and Benchmarks Track

    Korean review of T12-12

  13. T12-14Similar problem

    Evaluating Object Hallucination in Large Vision-Language Models (POPE)

    Authors
    Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, Ji-Rong Wen
    Year
    2023
    Venue
    EMNLP 2023

    Korean review of T12-14

  14. T12-15Similar problem

    VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

    Authors
    Yuxuan Wang, Yueqian Wang, Dongyan Zhao, Cihang Xie, Zilong Zheng
    Year
    2024
    Venue
    arXiv

    Korean review of T12-15

From research to product use

Operating capabilities, pilots, and technologies in development are identified separately.

View technology