Temporal Video Understanding

Latest papers 220

All topics
CardsList
  1. SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos

    Jun 30, 2026Björn Braun, Christian HolzEgocentric Video UnderstandingTemporal Action Detection

  2. VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

    Jun 29, 2026Xiaoqian Shen, Mohamed ElhoseinyEfficient VLM InferenceAttention Sinks

  3. DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences

    Jun 26, 2026Yankai Yang, Yancheng Long, Bin Wen +4Video UnderstandingVideo-Language Models

  4. HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

    Jun 26, 2026Pulkit Gera, Faegheh Sardari, Asmar Nadeem +4VLM EvaluationSpatial Reasoning Benchmarks

  5. Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

    Jun 26, 2026Shuimu Chen, Yuteng Chen, Yuanshen Guan +7LLM Self-CorrectionLong-Video Understanding

  6. Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

    Jun 26, 2026Hohin Kwan, Hongyu Li, Ray Zhang +5VLM EvaluationMultimodal Large Language Models

  7. TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning

    Jun 26, 2026Enguang Wang, Hao Zhou, Shuo Gao +2Medical DiagnosisUltrasound Imaging

  8. Expresso-AI: Explainable Video-Based Deep Learning Models for Depression Diagnosis

    Jun 24, 2026Felipe Moreno, Sharifa Alghowinem, Hae Won Park +1Depression DetectionNeural Network Interpretability

  9. FeVOS: Foresight Expression Video Object Segmentation

    Jun 24, 2026Kehan Lan, Kaining Ying, Henghui DingVideo Object SegmentationReferring Video Object Segmentation

  10. ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency

    Jun 24, 2026Shih-Po Lee, Reza Ghoddoosian, Faizan Siddiqui +2Online Anomaly DetectionTemporal Video Understanding

  11. UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

    Jun 23, 2026Xiaowei Gao, Pengxiang Li, Yitai Cheng +4VLMs for Autonomous DrivingAutonomous Driving Perception

  12. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  13. DBT-Bleed: Dual-Branch Temporal Modeling with Key-Frame Selection for Surgical Bleeding Detection

    Jun 22, 2026Sudhanshu Mishra, Jialang Xu, Jensen Ang +3Surgical Video UnderstandingVideo Frame Selection

  14. T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

    Jun 19, 2026Di Yang, Mahmoud Ali, Quan Kong +2Skeleton-Based Action RecognitionRepresentation Learning

  15. S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

    Jun 18, 2026Yalun Dai, Hao Li, Shulin Tian +10Visual Spatial Reasoning3D Spatial Reasoning

  16. NEST: Narrative Event Structures in Time for Long Video Understanding

    Jun 18, 2026Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker +6Long-Video UnderstandingTemporal Video Understanding

  17. Native Active Perception as Reasoning for Omni-Modal Understanding

    Jun 17, 2026Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8Audio-Visual UnderstandingActive Perception

  18. Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos

    Jun 16, 2026Bo Gou, Jicheng Zhang, Jianlong Xiong +9EchocardiographyTemporal Video Understanding

  19. InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

    Jun 10, 2026Ziang Yan, Sheng Xia, Jiashuo Yu +10Efficient Multimodal InferenceMultimodal Reasoning

  20. Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

    Jun 10, 2026Biao Tang, Xu Chen, Shuxiang Gou +3Multimodal Large Language ModelsLong-Video Understanding

  21. SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

    Jun 10, 2026Min Yang, Mi Zhou, Limin WangEfficient Neural Network InferenceHuman Activity Recognition

  22. From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

    Jun 10, 2026Yuchen Guan, Xiao Li, Zongyu Guo +4Efficient VLM InferenceLong-Video Understanding

  23. FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration

    Jun 10, 2026Rui Cao, Jiannong Cao, Bo Yuan +2Temporal Video Understanding

  24. Motion Reinforces Appearance: RGB-Skeleton Gated Residual Fusion for Micro-Gesture Online Recognition

    Jun 10, 2026Jialin Liu, Xinwen He, Pengyu Liu +3Gesture RecognitionTemporal Action Detection

  25. 4DP-QA: Scalable QA for 4D Perception in Vision Language Models

    Jun 10, 2026Seokju Cho, Abhishek Badki, Hang Su +5VLM EvaluationVLM Reasoning

  26. Kwai Keye-VL-2.0 Technical Report

    Jun 9, 2026Kwai Keye Team, Bin Wen, Changyi Liu +50Temporal Video GroundingLong-Context Modeling

  27. Interpretable Temporal Facial-Region Motion Analysis for In-the-Wild Parkinson's Disease Video Classification

    Jun 8, 2026Riyadh AlmushrafyVideo UnderstandingMedical Diagnosis

  28. SVHighlights: Towards Extremely Long Sport Video Highlight Detection

    Jun 5, 2026Donggyu Lee, Youngbin Ki, Jeonghun Kang +1Sports Video AnalysisLong-Video Understanding

  29. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

    Jun 5, 2026Yifan Xu, Chao Zhang, Ruifei Ma +4VLM AdaptationVision-Language Alignment