Temporal Video Grounding

Latest papers 109

All topics
CardsList
  1. Towards One-to-Many Temporal Grounding

    Jun 4, 2026Qi Xu, Yue Tan, Shihao Chen +5Temporal Video Grounding

  2. Knowledge-Preserved Model Tuning in Null-Space for Robust Spatio-Temporal Video Grounding

    Jun 2, 2026Haoxuan Chen, Xianqin Liu, Jian-Fang HuTemporal Video Grounding

  3. Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

    Jun 1, 2026Enmin Zhong, Carlos R. del-Blanco, Fernando Jaureguizar +1Temporal Video GroundingEgocentric Video Understanding

  4. Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

    Jun 1, 2026Xiang Fang, Wanlong Fang, Wei Ji +1Temporal Video GroundingMultimodal Fusion

  5. CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

    May 31, 2026Xin Dong, Wenjia Geng, Wenfeng Deng +1Temporal Video GroundingVideo Representation Learning

  6. GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval

    May 30, 2026Shihang Zhang, Mingjin Kuai, Ye Wei +2Temporal Video GroundingReinforcement Learning

  7. Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

    May 29, 2026Xiang Fang, Daizong Liu, Wanlong Fang +4Temporal Video GroundingTransfer Learning

  8. Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language

    May 28, 2026Xiang Fang, Wanlong Fang, Daizong Liu +8Temporal Video GroundingOpen-Set Recognition

  9. Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language

    May 28, 2026Xiang Fang, Daizong Liu, Wanlong Fang +5Cross-Modal LearningTemporal Video Grounding

  10. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  11. Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective

    May 26, 2026Xiang Fang, Zeyu Xiong, Wanlong Fang +7Temporal Video GroundingCooperative Game Theory

  12. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  13. CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

    May 22, 2026Mingfang Zhang, Jingjing Pan, Ashutosh Kumar +7VLM EvaluationTemporal Video Grounding

  14. Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

    May 21, 2026Zelin Zheng, Xinyan Liu, Ruixin Li +4Temporal Video GroundingVideo-Language Models

  15. MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

    May 21, 2026Dazhao Du, Liao Duan, Jian Liu +5Temporal Video GroundingMultimodal Large Language Models

  16. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

    May 20, 2026Aditya Chetan, Eric Cai, Peeyush Kushwaha +5VLM EvaluationTemporal Video Grounding

  17. OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

    May 20, 2026Yisen Feng, Leigang Qu, Haoyu Zhang +5Temporal Video GroundingMultimodal Reranking

  18. FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

    May 19, 2026Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh +2VLM EvaluationTemporal Video Grounding

  19. SurgLQA: Scalable Long-Horizon Surgical Video Question Answering

    May 18, 2026Diandian Guo, Xikai Yang, Ruiyang Li +2Temporal Video GroundingTest-Time Scaling

  20. VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

    May 15, 2026Yiming Zhao, Yu Zeng, Wenxuan Huang +11Temporal Video GroundingTool-Using Vision-Language Agents

  21. Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval

    May 14, 2026Bolin Zhang, Chao Yang, Bin Jiang +2Temporal Video GroundingWeakly Supervised Learning

  22. Video-Zero: Self-Evolution Video Understanding

    May 14, 2026Ruixu Zhang, Deyi Ji, Lanyun Zhu +4Temporal Video GroundingLong-Video Understanding

  23. EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

    May 13, 2026Minjoon Jung, Byoung-Tak Zhang, Lorenzo TorresaniTemporal Video GroundingSelf-Supervised Learning

  24. AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

    May 7, 2026Zhen Zhang, Yuhang Yang, Yunxiang Jiang +5Temporal Video GroundingLong-Video Understanding

  25. MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding

    May 5, 2026Ran Ran, Jiwei Wei, Shuchang Zhou +5Temporal Video GroundingCross-Modal Alignment

  26. Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval

    May 4, 2026Yiming Ding, Siyu Cao, Luyuan Jiao +4Temporal Video GroundingTemporal IR

  27. Static and Dynamic Graph Alignment Network for Temporal Video Grounding

    May 1, 2026Zhanjie Hu, Bolin Zhang, Jianhua Wang +5Temporal Video GroundingTemporal GNNs

  28. ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval

    Apr 30, 2026Ji-Hyeon Kim, Ho-Joong Kim, Seong-Whan LeeTemporal Video GroundingCross-Modal Alignment

  29. OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

    Apr 28, 2026Minghang Zheng, Zihao Yin, Yi Yang +2Temporal Video GroundingLLM Self-Correction

  30. FCMBench-Video: Benchmarking Document Video Intelligence

    Apr 28, 2026Runze Cui, Fangxin Shang, Yehui Yang +3VLM EvaluationDocument Understanding

  31. StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

    Apr 25, 2026Xuanyue Zhong, Yuqiang Xie, Guanqun Bi +2Temporal Video GroundingVideo Understanding

  32. Towards Temporal Compositional Reasoning in Long-Form Sports Videos

    Apr 24, 2026Siyu Cao, Lu Zhang, Ruizhe Zeng +1Temporal Video GroundingTemporal Reasoning

  33. Grounding Video Reasoning in Physical Signals

    Apr 23, 2026Alibay Osmanli, Zixu Cheng, Shaogang GongTemporal Video GroundingVideo QA

  34. ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

    Mar 24, 2026Hyojin Park, Yi Li, Janghoon Cho +8Multimodal RAGMultimodal IR

  35. Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

    Mar 5, 2026Jiaqi Li, Shuntian Zheng, Yixian Shen +4Temporal Video GroundingVision-Language Grounding

  36. Towards Long-Form Spatio-Temporal Video Grounding

    Feb 26, 2026Xin Gu, Bing Fan, Jiali Yao +5Temporal Video GroundingLong-Context Modeling

  37. ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search

    Jan 30, 2026Tao Yu, Haopeng Jin, Hao Wang +19Temporal Video GroundingCross-Modal Retrieval

  38. NeMo: Needle in a Montage for Video-Language Understanding

    Sep 29, 2025Zi-Yuan Hu, Shuo Liang, Duo Zheng +10Temporal Video GroundingVideo-Language Model Evaluation

  39. TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

    Aug 11, 2025Chaohong Guo, Xun Mo, Yongwei Nie +3Temporal Video GroundingVision-Language Models

  40. TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action

    May 2, 2025Jen-Hao Cheng, Yi-Hao Peng, Huapeng Zhou +11Temporal Action SegmentationTemporal Video Grounding

  41. Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models

    Jan 14, 2025Yifang Xu, Yunzhuo Sun, Benxiang Zhai +4Temporal Video GroundingVideo-Language Models