Video QA

QA: Question Answering

Momentum

10 papers in the last four weeks, up 11% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 116

All topics
CardsList
  1. GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

    Aug 6, 2026Qifeng Zhang, Kaixiang Huang, Heng Dong +6VLM EvaluationSpatial Reasoning Benchmarks

  2. MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

    Aug 5, 2026Benlei Cui, Ruize Wang, Junjie Li +9Video QALong-Video Understanding

  3. Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

    Aug 4, 2026Haotian Xia, Zilin Xiao, Junbo Zou +2Video QALatent Visual Reasoning

  4. GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

    Aug 3, 2026Sitong Gong, Caixin Kang, Tianyu Yan +7Streaming Video UnderstandingVideo QA

  5. PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

    Aug 3, 2026Zhongjie Ba, Shengwang Xu, Peng Cheng +4Video-Language Model EvaluationVideo QA

  6. Continual Video-MLLM Adaptation over Evolving Domains

    Jul 21, 2026Rui Cheng, Meixing Shi, Yuxiang Cai +3Video QADomain-Incremental Learning

  7. EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

    Jul 15, 2026Junlong Li, Junxi Li, Yuxiang Yang +3Egocentric Video QAVideo QA

  8. Evidence-Backed Video Question Answering

    Jul 13, 2026Shijie Wang, Honglu Zhou, Ziyang Wang +5Temporal Video GroundingVideo QA

  9. TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

    Jul 13, 2026Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen +2Tool Use in VLMsSports Video Analysis

  10. EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage

    Jul 7, 2026Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky +5Video QAEgocentric Video Understanding

  11. Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation

    Jul 7, 2026Shenxi Liu, Kan Li, Mingyang Zhao +2Multimodal IRTemporal Video Grounding

  12. VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

    Jul 3, 2026Zhenkun Gao, Yicheng Bao, Jinlong Peng +13Multimodal RAGVideo QA

  13. K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

    Jul 2, 2026Khush Attarde, Yusuf Ali, Megha Thukral +3Video UnderstandingMultimodal Large Language Models

  14. ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

    Jul 2, 2026Minkuk Kim, Suyong Yun, Young Tae Kim +3Efficient VLM InferenceVideo QA

  15. Accuracy and Cost Claims Do Not Survive Re-Execution in Agentic VideoQA

    Jul 1, 2026Rama AlHamidi, Aseel Mohamed, Rasul Khanbayov +3AI Agent EvaluationVideo QA

  16. From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

    Jun 29, 2026Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim +1VLM EvaluationVision-Language Models

  17. Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

    Jun 28, 2026Sunqi Fan, Qingle Liu, Runqi Yin +2GUI AgentsVideo QA

  18. Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs

    Jun 24, 2026Agnese Taluzzi, Riccardo Santambrogio, Simone Mentasti +2Egocentric Video QAVideo QA

  19. EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

    Jun 23, 2026Linpeng Huang, Weixing Chen, Zexin Chen +2VLM EvaluationTemporal Video Grounding

  20. ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

    Jun 23, 2026Zhentao Guo, Chen Duan, Tongkun Guan +3Multimodal Large Language ModelsVideo QA

  21. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Efficient VLM InferenceVideo QA

  22. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangVLM EvaluationVideo QA

  23. CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

    Jun 18, 2026Yifan Shen, Pei Tian, Xinzhuo Li +8RL for Language Model ReasoningMixture-of-Experts Inference

  24. VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories

    Jun 15, 2026Svetlana Lukina, Mohamad Al Mdfaa, Gloria Haro +2Egocentric Video QAVideo QA

  25. MSUE: Multi-Modal Soccer Understanding Expert

    Jun 10, 2026Litao Li, Yibo Yu, Yufeng Hu +4Visual Question AnsweringVideo QA

  26. Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

    Jun 8, 2026Zhou Du, Hamid Krim, Xiao Wu +3Causal Representation LearningVideo QA