Temporal Video Understanding

Latest papers 220

All topics
CardsList
  1. T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

    Jul 23, 2026Linlin Wang, Xue Yang, Zhihuang Zhou +3Video UnderstandingScene Graph Generation

  2. ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

    Jul 23, 2026Han Li, Si Liu, Zehao Huang +6VLM EvaluationSpatial Reasoning Benchmarks

  3. PercepCap: Video Captioner with Structured Spatio-Temporal Perception

    Jul 22, 2026Yifan Xu, Zihao Wang, Zhixiao Wang +6Video CaptioningTemporal Video Understanding

  4. ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

    Jul 21, 2026Santiram Tiwari, Nishant Sinha, Kunal KislayMemory-Augmented VLMsKV Caching

  5. Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection

    Jul 20, 2026Amir Hosein Fadaei, Mahyar Maleki, Mohammad-Reza A. DehaqaniTransformerEfficient ViTs

  6. Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

    Jul 17, 2026Wei Feng, Xin Wang, Yu-Wei Zhan +2Temporal Video GroundingVideo-Language Models

  7. VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

    Jul 16, 2026Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu +3Efficient ViTsEfficient Attention

  8. Towards Spatial Supersensing in the Wild

    Jul 15, 2026Tianjun Gu, Tianyu Xin, Kuan Zhang +12Long-Video UnderstandingWorld Model Evaluation

  9. GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

    Jul 15, 2026Kaicong Huang, Weiheng Oh, Ruimin KeZero-Shot LearningVision-Language Grounding

  10. Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

    Jul 14, 2026Jae Joong LeeVLM EvaluationVideo-Language Model Evaluation

  11. Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

    Jul 14, 2026Yifan Lu, Ziqi Zhang, Chunfeng Yuan +3Large Vision-Language ModelsVideo Frame Selection

  12. GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

    Jul 10, 2026Guohuan Xie, Mengqi Lei, Chuan Shi +3Efficient VLM InferenceVideo-Language Models

  13. AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

    Jul 9, 2026Siddharth Damodharan, Radhika Gupta, Ali Alshami +2VLM EvaluationAutonomous Driving Benchmarks

  14. TubeLite: Lightweight Multi-Actor Spatio-Temporal Action Detection

    Jul 6, 2026Ali Soltaninezhad, Melissa Cote, Alejandro Rico Espinosa +2Temporal Action DetectionTemporal Video Understanding

  15. Event Detection in Videos: A Framework for the Development of New Methods

    Jul 5, 2026Anastasia Zakharova, Thierry Bouwmans, Anthony Cioppa +13Video SurveillanceTemporal Video Understanding

  16. A Multi-Task Deep Learning Framework for Real-Time Intelligent Video Surveillance with Temporal Event Validation

    Jul 3, 2026Estera Dumitru, Stelian SpînuVideo Action RecognitionObject Detection

  17. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Jul 2, 2026Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1RL ControlReward Modeling

  18. MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

    Jul 2, 2026Yuan Wang, Shujian Gao, Songtao Jiang +2Video UnderstandingStreaming Video Understanding

  19. Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

    Jul 2, 2026Chen Zhao, Jiajun Ma, Qilong Huang +6Audio-Visual UnderstandingVideo Captioning

  20. OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

    Jul 1, 2026Sakib Reza, Gauri Jagatap, Mohsen Moghaddam +2Knowledge DistillationTemporal Video Understanding

  21. No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

    Jun 30, 2026Haojian Huang, Harold Haodong Chen, Meng Luo +6VLM EvaluationMultimodal Hallucination

  22. Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

    Jun 30, 2026Xiaochuan Guo, Jihao Gu, Haixu Liu +6Few-Shot LearningMultimodal Emotion Recognition