Temporal Video Understanding

Latest papers 220

All topics
CardsList
  1. SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

    Oct 6, 2026Hairong Yin, Huangying Zhan, Shin-Fang Chng +2Vision-Language ModelsSpatiotemporal Reasoning

  2. EC-RAG: Event Chain Retrieval-Augmented Generation for Long Video Understanding

    Oct 6, 2026Yuhao Qin, Junbo Wang, Yuke Li +1Multimodal RAGVideo-Language Models

  3. Multi-Label Perceptual Bug Detection in Video Games using Deep Learning on Gameplay Footage

    Oct 6, 2026Nahian Rifaat, Felix Morosov, Loutfouz ZamanAutomated Software TestingMulti-Label Classification

  4. Joint Class-Time Learning for Video Classification with Multi-Instance Partial-Label Learning

    Oct 5, 2026Lingyu Shen, Wei Tang, Fakhri Karray +1Weakly Supervised LearningMultiple Instance Learning

  5. Cog-VADU: A Training-Free Cognitive Reasoning Framework for Video Anomaly Detection and Understanding

    Oct 1, 2026Mohd Ubaid Wani, Sara Atito, Josef Kittler +1CoT ReasoningInterpretable Anomaly Detection

  6. Video-Index: A Curated Meta-Benchmark for Video Understanding

    Oct 1, 2026Enxin Song, Yinuo Xu, Shusheng Yang +2Video UnderstandingVideo-Language Model Evaluation

  7. RESUME: Recurrent State Updates from Motion and Residual Signals for Efficient Video Language Modeling

    Sep 30, 2026Can Zhang, Xiaotian Han, Junyuan Shang +5Video-Language ModelsVideo Representation Learning

  8. TSMD: Temporal-Stream Modality Dropout for Robust Video Highlight Detection

    Sep 30, 2026Bo-Yuan Cheng, Kuan-Yu Chen, Po-Han Huang +2Missing-Modality LearningMultimodal Robustness

  9. SYNCR: Diagnosing and Learning Cross-Video Reasoning from Simulation

    Sep 29, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Video-Language Model EvaluationVideo Reasoning

  10. EGSD: Event-Grounded Self-Distillation for Streaming Video Understanding

    Sep 29, 2026Yuwei Miao, Xuesheng Zhang, Wenhao Zou +5Streaming Video UnderstandingSelf-Distillation

  11. RoboChrono: A Real Robot Benchmark for Streaming Task Understanding

    Sep 29, 2026Yuzhou Wu, Longteng Fan, Zimeng Li +22Next-Action PredictionRobot Manipulation Benchmarks

  12. Foresight at the Event Boundary: Evaluating Physical Prediction in Video World Models

    Sep 29, 2026Estela Monserrat Arriaga Santana, Julian Rosas Scull, Ehécatl Sacamch'en Núñez Rico +1Physical Consistency in Video GenerationWorld Model Evaluation

  13. ReVA: A Scene-Centric Dataset Beyond Repetition for Remote Sensing Video Question Answering

    Sep 28, 2026Zhen Yao, Likai Wang, Yuming Yang +9Remote Sensing VQAVideo QA

  14. ActionLens: Diagnosing Spatial-Temporal Binding Failures in Vision-Language Models

    Sep 28, 2026Gueter Josmy Faure, Min-Hung Chen, Hao Ping Wang +3Video-Language Model EvaluationTemporal Video Understanding

  15. A Hierarchy-Aware Video-Language Model Evaluation and Hyperbolic Baseline for Surgery

    Sep 22, 2026Ana Manzano Rodríguez, Pascal Mettes, Marlies P. Schijven +1Video-Language Model EvaluationHierarchical Representation Learning

  16. Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models

    Sep 15, 2026Rwiddhi Chakraborty, Yinong, Wang +7Video-Language Model EvaluationVideo QA

  17. BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender

    Sep 14, 2026Yolo Y. Tang, Daiki Shimada, Jiayue Meng +14AI Agent BenchmarksTemporal Video Understanding

  18. CapsuleMotion: A Lightweight Real-Time Visual Motion Predictor for Capsule Endoscopy

    Sep 14, 2026Oliver Bause, Julia Werner, Oliver BringmannEndoscopyMedical Imaging

  19. OphBiWSSD: Scaling Temporal Action Localization in Ophthalmic Surgeries with Bidirectional Weight-tied State Space Duality

    Sep 14, 2026Yang Liu, Qionghong Ma, Joongwon Chae +10Surgical Video UnderstandingTemporal Action Detection

  20. Zero-shot video highlight detection based on text descriptions and synthetic images

    Sep 13, 2026Michal Byra, Alberto Presta, Grzegorz Stefanski +1Video UnderstandingTemporal Video Understanding

  21. LiveProBench: Can Streaming Video Models Really Interact Like Humans?

    Sep 11, 2026Kaixuan Du, Xin Wan, Hang Zhang +4Streaming Video UnderstandingVideo-Language Model Evaluation

  22. MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

    Sep 8, 2026Dhairya Bhatia, Bishoy Galoaa, Oliver Fritsche +7Video-Language Model EvaluationVideo-Language Models

  23. EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning

    Sep 8, 2026Jingpu Yang, Fengxian Ji, Mingxuan Cui +4Visual Spatial ReasoningEgocentric Video QA

  24. Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

    Sep 8, 2026Ruibo Ming, Lei Sun, Deheng Zhang +8Video-Language Model EvaluationVideo-Language Models

  25. STSG-VQA: Evidence-Grounded Temporal Question Answering from Surgical Spatio-Temporal Scene Graphs

    Sep 8, 2026Jing Li, Duygu SarikayaMedical VQAQuestion Answering

  26. Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision

    Sep 3, 2026Shravan Venkatraman, Wenshuai Zhao, Mohammad Hassan Vali +1Self-Supervised LearningState Tracking

  27. TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval

    Sep 2, 2026Uicheol Jung, Juyoung Hong, Hojung Kwon +1Temporal Video UnderstandingMixture of Experts

  28. TempCloze: Can Video-LLMs Identify the Missing Middle?

    Sep 1, 2026Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4Video-Language Model EvaluationVideo-Language Models

  29. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language Model EvaluationVideo-Language Models

  30. DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

    Aug 30, 2026Bomiao Wang, Zekai Shao, Jiexiang Lan +3Video UnderstandingVideo-Language Model Evaluation

  31. EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

    Aug 13, 2026Weitao Chen, Hu Jiaxin, Xie Tianyidan +15Egocentric Video QAVideo-Language Model Evaluation

  32. FUSE: Frame-Unified Stress Estimation from Facial Video

    Aug 11, 2026Stefanos Gkikas, Thomas Kassiotis, Yang Guo +2Emotion RecognitionTemporal Video Understanding

  33. Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

    Aug 9, 2026Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid +2Temporal Video Understanding

  34. VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

    Aug 9, 2026Dong Xing, Jiaxin Chen, Hang Yang +3Video-Language ModelsVLM Hallucination Mitigation

  35. CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition

    Aug 7, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +3Edge InferenceEfficient ViTs

  36. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

    Aug 6, 2026Sarvesh Baskar, Zikui Cai, Shayan Shabihi +5Video-Language Model EvaluationTemporal Video Understanding

  37. ChronoVision: Temporal Reasoning via Latent State Reconstruction

    Aug 6, 2026Yifan Shen, Jian Xu, Boyi Li +6Multimodal Large Language ModelsLatent Visual Reasoning

  38. DynaPix: Can Vision-Language Models Identify the Exact Future?

    Aug 6, 2026Thong Nguyen, Vinh-Hien Do, Quynh Vo +2VLM EvaluationVision-Language Models

  39. SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

    Aug 5, 2026Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin +6Surgical Video UnderstandingGenerative Retrieval

  40. TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition

    Aug 5, 2026Fang Li, Shihao Zou, Weixin Si +3Surgical Video UnderstandingRelational Deep Learning

  41. REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding

    Aug 5, 2026Boyang Li, Chenhui Gou, Jianfei CaiTemporal Video GroundingZero-Shot Learning

  42. Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

    Aug 5, 2026Quynh Vo, Thong Nguyen, Vinh-Hien Do +2Cross-Modal RetrievalVideo Prediction

  43. AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding

    Aug 4, 2026Yuxiang Duan, Huining Li, Ao Li +6Multi-Agent SystemsVideo Anomaly Detection

  44. Multi-Task Multi-Frame Visual Piano Transcription

    Aug 4, 2026Yonghyun Kim, Hoyeol Sohn, Juhan Nam +1Automatic Music TranscriptionTemporal Video Understanding

  45. Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

    Aug 4, 2026Yuxin Cao, Wei Song, Jingling Xue +1Selective PredictionVideo-Language Model Evaluation

  46. Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding

    Aug 3, 2026Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai +3Event-Based VisionVideo Action Recognition

  47. VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

    Jul 30, 2026Haiyue Zhang, Yi Bin, Xun Jiang +5Large Vision-Language ModelsLong-Video Understanding

  48. HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection

    Jul 30, 2026Xiangbo Wang, Jiasheng Zhang, Xingtong Yu +2Fake News DetectionAutomated Fact-Checking

  49. Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

    Jul 28, 2026Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan +2Multimodal ReasoningMultimodal Emotion Recognition

  50. FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

    Jul 28, 2026Ghazal Kaviani, Ghassan AlRegibEfficient Multimodal InferenceMultimodal Large Language Models

  51. LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

    Jul 27, 2026Ce Zhang, Jinxi He, Katia Sycara +1Multimodal Large Language ModelsLong-Video Understanding

  52. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

    Jul 27, 2026Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu +2Visual Question AnsweringVideo Understanding

  53. WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

    Jul 25, 2026Yuhui Zeng, Wang Chen, Jinfa Huang +5Efficient VLM InferenceVideo Token Compression