Video QA

QA: Question Answering

Momentum

10 papers in the last four weeks, up 11% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 116

All topics
CardsList
  1. Perception Test 2026: Challenge Summary and Extension to City-scale Audio-Visual Reasoning

    Oct 8, 2026Fedor Kitashov, João Carreira, Shiry Ginosar +3Spatial Reasoning BenchmarksAudio-Visual Understanding

  2. VAMR: Multi-Question Agentic Reasoning for Efficient Long-Form Video Understanding

    Oct 8, 2026Runquan Gui, Hanzhu Chen, Zehao Wang +3Long-Video QAVideo QA

  3. Less from More: Reinforcing Sparse Video Reasoning from Dense References

    Oct 7, 2026Wenfang Sun, Yingjun Du, Cees G. M. SnoekVideo ReasoningVLM Reasoning

  4. Beyond Anonymous Captions: Grounding Character Identity in Video Captioning and Question Answering

    Oct 7, 2026Anas Filali Razzouki, Killian Steunou, Khalil Guetari +3Video CaptioningVideo QA

  5. A doctrine-grounded visual question answering dataset for Tactical Combat Casualty Care

    Oct 5, 2026Junseob Kim, Jade Chng, Ayman Ali +5Medical VQAVideo QA

  6. InteractionBench: A Real-Time Interaction Benchmark for Streaming Video Systems

    Oct 5, 2026Enxin Song, Suhao Yu, Yifei Xu +7Streaming Video UnderstandingVideo-Language Model Evaluation

  7. Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement Learning

    Sep 29, 2026Ziheng Huang, Yicheng Bao, Xueheng Li +8Streaming Video UnderstandingVideo QA

  8. ReVA: A Scene-Centric Dataset Beyond Repetition for Remote Sensing Video Question Answering

    Sep 28, 2026Zhen Yao, Likai Wang, Yuming Yang +9Remote Sensing VQAVideo QA

  9. CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video

    Sep 15, 2026Dingli Liang, Yiqiao Xie, Yukai Huang +6Memory-Augmented VLMsEgocentric Video QA

  10. Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models

    Sep 15, 2026Rwiddhi Chakraborty, Yinong, Wang +7Video-Language Model EvaluationVideo QA

  11. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning

    Sep 14, 2026Mantek Singh, Jeshwanth Challagundla, Siddharth Raina +1CoT DistillationVLM Distillation

  12. Long-to-Short Video Evidence Reasoning for Grounded Question Answering

    Sep 14, 2026Kaiyan Chen, Junbin Xiao, Xun YangTemporal Video GroundingVideo QA

  13. DementiaCare-Bench: A Modality-Validated Video Benchmark

    Sep 14, 2026Afrouz Sheikholeslami, Yuankai Qi, Xuyun Zhang +4Alzheimer's DiseaseHealthcare

  14. BodyCam-VQA: Enhanced Body-Worn Camera Video Captioning via Multimodal Reasoning and Probe Question Generation

    Sep 11, 2026Karish Gupta, Matthew Alex, Alex Li +6Video QAMultimodal Reasoning

  15. EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning

    Sep 8, 2026Jingpu Yang, Fengxian Ji, Mingxuan Cui +4Visual Spatial ReasoningEgocentric Video QA

  16. StreamScout: Learning When to Look Deeper for Streaming Video Understanding

    Aug 31, 2026Ce Zhang, Jing Bi, Jinxi He +9Adaptive InferenceStreaming Video Understanding

  17. SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

    Aug 31, 2026Zheyu Huang, Zijing Shi, Haozhe Luo +4Video QAMultimodal Reasoning

  18. Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

    Aug 31, 2026Xinru Jiang, Lin Zhao, Xi Xiao +7Memory-Augmented VLMsStreaming Video Understanding

  19. Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

    Aug 26, 2026Kaishen Wang, Dongdi Zhao, Yijun Liang +4On-Policy Self-DistillationVLM Distillation

  20. R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

    Aug 11, 2026Ke Ma, Yamin Mao, Weiming Li +5Egocentric Video QAVideo QA

  21. FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

    Aug 11, 2026Fufangchen Zhao, Jinhu Fu, Jiachen Lei +3Counterfactual EvaluationVideo QA

  22. VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

    Aug 10, 2026Jiajun Xu, Yanghao Zhou, Jingyun Liao +6Web Application GenerationVideo-Language Model Evaluation

  23. REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering

    Aug 9, 2026Caijun Yan, Yang Zhou, Meixing Shi +4Video QALong-Video QA

  24. SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

    Aug 8, 2026Yizhi Li, Jiawei Jiang, Guanhong Wang +2Sports Video AnalysisVideo QA

  25. I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

    Aug 7, 2026Shibo Gao, Chongxiao Wang, Chenglong Huang +10Video QAVision-Language Grounding

  26. DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

    Aug 7, 2026Tianjian He, Yujie Liu, Zhiping Huang +1Temporal Video GroundingVideo Understanding