Temporal Video Understanding

Latest papers 220

All topics
CardsList
  1. LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

    Jun 4, 2026Shiqiang Lang, Jing Liu, Haoyang He +6Visual Spatial ReasoningMultimodal Large Language Models

  2. NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

    Jun 3, 2026Yong Cao, Chuqiao Li, Xianghui Xie +2VLM EvaluationTemporal Video Understanding

  3. Benchmarking Visual State Tracking in Multimodal Video Understanding

    Jun 2, 2026Sihyun Yu, Nanye Ma, Pinzhi Huang +8Multimodal Large Language ModelsVideo Reasoning

  4. Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

    Jun 1, 2026Xiaolin Liu, Yilun Zhu, Xiangyu Zhao +9VLM EvaluationVideo QA

  5. Question-Aware Evidence Ledgers for Video Relational Reasoning

    Jun 1, 2026Yilin Ou, Mengshi Qi, Huadong MaVisual Spatial ReasoningRelational Reasoning

  6. PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

    Jun 1, 2026Yusong Zhao, Yuejin Xie, Youliang Yuan +4Traffic Accident AnticipationVideo-Language Models

  7. Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

    Jun 1, 2026Boyu Han, Qianqian Xu, Shilong Bao +3Egocentric Video UnderstandingTemporal Video Understanding

  8. CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

    May 31, 2026Xin Dong, Wenjia Geng, Wenfeng Deng +1Temporal Video GroundingVideo Representation Learning

  9. Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Video QAStructured Reasoning

  10. Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

    May 30, 2026Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma +2Vision-Language GroundingVideo Reasoning

  11. ConTrans: Learning Text-enhanced Local-global Temporal Representations for Zero-shot Temporal Action Localization

    May 29, 2026Kanchan Keisham, Thenukan Pathmanathan, Thangarajah AkilanZero-Shot LearningHybrid CNN-Transformer Architectures

  12. Masked Diffusion Vision-Language Models for Temporal Action Localization

    May 28, 2026Fengshun Wang, Zhengbo Zhang, Zhigang TuHuman Activity RecognitionVideo-Language Models

  13. Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification

    May 27, 2026Xiao Wang, Minglei Yang, Bin Yang +4Temporal Video Understanding

  14. VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

    May 27, 2026Rui Lin, Chuanming Wang, Huadong MaVLM AdaptationVideo Representation Learning

  15. ST-ColoNet: Spatio-Temporal Colon Segment Recognition via Hybrid Attention and Edge-Guided Feature Learning

    May 27, 2026Crystal Cai, Ziyi Wang, Zhengjie Zhang +3Temporal AttentionTemporal Video Understanding

  16. Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

    May 26, 2026Kabir Swain, Sijie Han, Daniel Karl I. Weidele +2Memory-Augmented Neural NetworksMemory-Augmented Language Models

  17. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  18. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Cross-Modal LearningMultimodal Large Language Models

  19. TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

    May 23, 2026Zixu Li, Yupeng Hu, Zhiwei Chen +4Learning to RankCross-Modal Retrieval

  20. U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025

    May 22, 2026Duc-Nhuan Le, Hoang-Phuc Nguyen, Thanh-Duy Lam +2Multimodal IRInformation Retrieval

  21. The TIME Machine: On The Power of Motion for Efficient Perception

    May 21, 2026Mantas Skackauskas, Xinyue Hao, Laura Sevilla-LaraRepresentation LearningVideo Representation Learning

  22. Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

    May 21, 2026Jongseo Lee, Hyuntak Lee, Sunghun Kim +3Video-Language ModelsTemporal Video Understanding

  23. Improving Viewpoint-Invariance and Temporal Consistency for Action Detection

    May 21, 2026Yannick Porto, Renato Martins, Thomas Chalumeau +1Video Action RecognitionInvariant Representation Learning

  24. Swift Sampling: Selecting Temporal Surprises via Taylor Series

    May 21, 2026Dahye Kim, Bhuvan Sachdeva, Karan Uppal +3Video Frame SelectionLong-Video QA