Long Video Question Answering

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 58

All topics
CardsList
  1. LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception

    Sep 30, 2026Juyi Lin, Zhiqiang Lao, Jiali Cui +9Audio-Visual ReasoningLong Video Question Answering

  2. Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

    Sep 29, 2026Hui Ren, Lei Fan, Henry Pao +5Long Video Question AnsweringStreaming Video Understanding

  3. MetaSampling: Making Frame Samplers Efficient for Long-Video Question Answering

    Sep 27, 2026Ashim Dahal, Bikramjit BanerjeeLong Video Question AnsweringMultimodal Large Language Models

  4. TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

    Sep 24, 2026Kaidi Yang, Hualei Wang, Zhaohui Wang +3Temporal GroundingAudio Understanding

  5. CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video

    Sep 15, 2026Dingli Liang, Yiqiao Xie, Yukai Huang +6Long Video Question AnsweringEpisodic Memory

  6. Long-to-Short Video Evidence Reasoning for Grounded Question Answering

    Sep 14, 2026Kaiyan Chen, Junbin Xiao, Xun YangLong Video Question AnsweringVideo Understanding

  7. One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering

    Sep 14, 2026Jian Hu, Zixu Cheng, Da Li +3Long Video Question AnsweringSkills

  8. Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference

    Sep 1, 2026Reza Heidari, Hamed R. Tavakoli, Juho KannalaToken CompressionVision Encoders

  9. R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

    Aug 11, 2026Ke Ma, Yamin Mao, Weiming Li +5Long Video Question AnsweringEgocentric Video

  10. Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

    Aug 4, 2026Haotian Xia, Zilin Xiao, Junbo Zou +2Long Video Question AnsweringVideo Understanding

  11. Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering

    Aug 3, 2026Fan Wei, Siru Zhong, Runmin Dong +3Long Video Question AnsweringQuestion

  12. ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

    Jul 21, 2026Santiram Tiwari, Nishant Sinha, Kunal KislayLong Video Question AnsweringLong-Horizon Task Planning

  13. Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

    Jul 17, 2026Ce Zhang, Ziyang Wang, Yulu Pan +6Long Video Question AnsweringLong Videos

  14. Evidence-Backed Video Question Answering

    Jul 13, 2026Shijie Wang, Honglu Zhou, Ziyang Wang +5Long Video Question AnsweringVideo Understanding

  15. Incentivizing Vision Language Models to Search for Long Video Question Answering

    Jul 3, 2026Harsh Goel, S P Sharan, Sahil Shah +4Long Video Question AnsweringVideo Understanding

  16. ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

    Jul 2, 2026Minkuk Kim, Suyong Yun, Young Tae Kim +3Long Video Question AnsweringKeyframe Selection

  17. From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

    Jun 29, 2026Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim +1Long Video Question AnsweringVisual Evidence

  18. EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

    Jun 23, 2026Linpeng Huang, Weixing Chen, Zexin Chen +2Long Video Question AnsweringTemporal Grounding

  19. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Long Video Question Answering

  20. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangLong Video Question AnsweringChain-of-Thought Reasoning

  21. TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

    Jun 18, 2026Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan +2Long Video Question AnsweringTemporal Grounding

  22. Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

    Jun 8, 2026Zhou Du, Hamid Krim, Xiao Wu +3Long Video Question AnsweringCounterfactual Generation

  23. CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning

    Jun 7, 2026Muge Qi, Rong Fu, Pengbin Feng +7Video Temporal GroundingTemporal Grounding

  24. StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

    Jun 4, 2026Zhengqian Wu, Zhixian Liu, Aodong Chen +6Long Video Question AnsweringVideo Dataset

  25. MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

    Jun 4, 2026Qing Yang, Pengcheng Huang, Xinze Li +6Long Video Question AnsweringPeak Memory

  26. SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

    Jun 2, 2026Zeno Testa, Antonino Furnari, Lorenzo Baraldi +1Gloss-Free Sign Language TranslationSign Language Translation

  27. Question-Aware Evidence Ledgers for Video Relational Reasoning

    Jun 1, 2026Yilin Ou, Mengshi Qi, Huadong MaLong Video Question AnsweringVideo Understanding

  28. Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Long Video Question AnsweringTemporal Reasoning

  29. Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Long Video Question AnsweringVideo Understanding

  30. CASTLE2026 Team WDL Technical Report

    May 30, 2026Zhengyang Li, Zhenglin Du, Yi Wen +3Long Video Question AnsweringEgocentric Video

  31. Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

    May 27, 2026Takuya Murakawa, Toru TamakiLong Video Question AnsweringIn-Context Learning

  32. Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

    May 22, 2026Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang +1Long Video Question AnsweringKeyframe Selection

  33. CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

    May 18, 2026Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi +3Long Video Question AnsweringKeyframe Selection

  34. SurgLQA: Scalable Long-Horizon Surgical Video Question Answering

    May 18, 2026Diandian Guo, Xikai Yang, Ruiyang Li +2Surgical VideosLong Video Question Answering

  35. MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

    May 17, 2026Debashish Chakraborty, Dengjia Zhang, Jialiang Jin +7Multimodal Retrieval Augmented GenerationLong Video Question Answering

  36. VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

    May 12, 2026Chenhao Qiu, Yechao Zhang, Xin Luo +2Long Video Question AnsweringTemporal Grounding

  37. VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA

    May 6, 2026Haibin He, Maoyuan Ye, Jing Zhang +2Long Video Question AnsweringVideo Foundation Models

  38. UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

    Apr 25, 2026Jason Nguyen, Ameet Rao, Alexander Chang +2Long Video Question AnsweringVideo Understanding

  39. ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

    Mar 24, 2026Hyojin Park, Yi Li, Janghoon Cho +8Long Video Question AnsweringVideo Surveillance

  40. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Long Video Question AnsweringVideo Multimodal Large Language Models

  41. FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

    Mar 4, 2026Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov +4Long Video Question AnsweringVideo Understanding

  42. CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes

    Apr 1, 2024Paritosh Parmar, Eric Peh, Ruirui Chen +4Causal ReasoningLong Video Question Answering

  43. StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

    Date pendingJoya Chen, Zeyun Zhong, Mike Zheng ShouStreaming Video UnderstandingLong Video Question Answering