Temporal Video Understanding

Latest papers 220

All topics
CardsList
  1. TempCloze: Can Video-LLMs Identify the Missing Middle?

    Sep 1, 2026Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4Video-Language Model EvaluationVideo-Language Models

  2. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language Model EvaluationVideo-Language Models

  3. DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

    Aug 30, 2026Bomiao Wang, Zekai Shao, Jiexiang Lan +3Video UnderstandingVideo-Language Model Evaluation

  4. EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

    Aug 13, 2026Weitao Chen, Hu Jiaxin, Xie Tianyidan +15Egocentric Video QAVideo-Language Model Evaluation

  5. FUSE: Frame-Unified Stress Estimation from Facial Video

    Aug 11, 2026Stefanos Gkikas, Thomas Kassiotis, Yang Guo +2Emotion RecognitionTemporal Video Understanding

  6. Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

    Aug 9, 2026Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid +2Temporal Video Understanding

  7. VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

    Aug 9, 2026Dong Xing, Jiaxin Chen, Hang Yang +3Video-Language ModelsVLM Hallucination Mitigation

  8. CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition

    Aug 7, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +3Edge InferenceEfficient ViTs

  9. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

    Aug 6, 2026Sarvesh Baskar, Zikui Cai, Shayan Shabihi +5Video-Language Model EvaluationTemporal Video Understanding

  10. ChronoVision: Temporal Reasoning via Latent State Reconstruction

    Aug 6, 2026Yifan Shen, Jian Xu, Boyi Li +6Multimodal Large Language ModelsLatent Visual Reasoning

  11. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  12. SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

    Aug 5, 2026Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin +6Surgical Video UnderstandingGenerative Retrieval

  13. TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition

    Aug 5, 2026Fang Li, Shihao Zou, Weixin Si +3Surgical Video UnderstandingRelational Deep Learning

  14. REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding

    Aug 5, 2026Boyang Li, Chenhui Gou, Jianfei CaiTemporal Video GroundingZero-Shot Learning

  15. Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

    Aug 5, 2026Quynh Vo, Thong Nguyen, Vinh-Hien Do +2Cross-Modal RetrievalVideo Prediction

  16. AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding

    Aug 4, 2026Yuxiang Duan, Huining Li, Ao Li +6Multi-Agent SystemsVideo Anomaly Detection

  17. Multi-Task Multi-Frame Visual Piano Transcription

    Aug 4, 2026Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1Automatic Music TranscriptionTemporal Video Understanding

  18. Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

    Aug 4, 2026Yuxin Cao, Wei Song, Jingling Xue +1Selective PredictionVideo-Language Model Evaluation

  19. Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding

    Aug 3, 2026Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai +3Event-Based VisionVideo Action Recognition

  20. VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

    Jul 30, 2026Haiyue Zhang, Yi Bin, Xun Jiang +5Large Vision-Language ModelsLong-Video Understanding

  21. HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

    Jul 30, 2026Xiangbo Wang, Jiasheng Zhang, Xingtong Yu +2Fake News DetectionAutomated Fact-Checking

  22. Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

    Jul 28, 2026Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan +2Multimodal ReasoningMultimodal Emotion Recognition

  23. FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

    Jul 28, 2026Ghazal Kaviani, Ghassan AlRegibEfficient Multimodal InferenceMultimodal Large Language Models

  24. LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

    Jul 27, 2026Ce Zhang, Jinxi He, Katia Sycara +1Multimodal Large Language ModelsLong-Video Understanding

  25. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

    Jul 27, 2026Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu +2Visual Question AnsweringVideo Understanding

  26. WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

    Jul 25, 2026Yuhui Zeng, Wang Chen, Jinfa Huang +5Efficient VLM InferenceVideo Token Compression