Video QA

QA: Question Answering

Momentum

10 papers in the last four weeks, up 11% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 116

All topics
CardsList
  1. See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding

    Jun 8, 2026Shuning Wang, Zhiheng Wu, YiNuo Lu +6Video QAVideo-Language Models

  2. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

    Jun 6, 2026Yiheng Wang, Yueqian Lin, Lichen Zhu +3Multimodal Large Language ModelsQuestion Answering

  3. StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

    Jun 4, 2026Zhengqian Wu, Zhixian Liu, Aodong Chen +6Video UnderstandingSynthetic Data Generation

  4. MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

    Jun 4, 2026Qing Yang, Pengcheng Huang, Xinze Li +6Video SummarizationVideo QA

  5. VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

    Jun 3, 2026Lin Fu, Zheyuan Yang, Yang Wang +3Video UnderstandingVideo QA

  6. SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

    Jun 2, 2026Zeno Testa, Antonino Furnari, Lorenzo Baraldi +1Sign Language TranslationVideo QA

  7. VidMsg: A Benchmark for Implicit Message Inference in Short Videos

    Jun 2, 2026Issar Tzachor, Michael Green, Rami Ben-AriVLM EvaluationVideo QA

  8. Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

    Jun 1, 2026Xiaolin Liu, Yilun Zhu, Xiangyu Zhao +9VLM EvaluationVideo QA

  9. Question-Aware Evidence Ledgers for Video Relational Reasoning

    Jun 1, 2026Yilin Ou, Mengshi Qi, Huadong MaVisual Spatial ReasoningRelational Reasoning

  10. Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Video QAStructured Reasoning

  11. Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Visual Spatial ReasoningInference-Time Optimization

  12. SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

    May 30, 2026Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx +4Multimodal MemoryEgocentric Video QA

  13. CASTLE2026 Team WDL Technical Report

    May 30, 2026Zhengyang Li, Zhenglin Du, Yi Wen +3Multimodal RAGEgocentric Video QA

  14. An Attribute-Based Measure of Video Complexity

    May 30, 2026Aditya Sarkar, Yi Li, Zihao Wang +6VLM EvaluationVideo QA

  15. Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

    May 27, 2026Takuya Murakawa, Toru TamakiVLM AdaptationVideo QA

  16. EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

    May 23, 2026Zhiwei Chen, Yupeng Hu, Zixu Li +4Test-Time AdaptationVLM Adaptation

  17. CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

    May 22, 2026Mingfang Zhang, Jingjing Pan, Ashutosh Kumar +7VLM EvaluationTemporal Video Grounding

  18. Cambrian-P: Pose-Grounded Video Understanding

    May 21, 2026Jihan Yang, Zifan Zhao, Xichen Pan +5Vision-Language ModelsCamera Pose Estimation

  19. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

    May 21, 2026Junbin Xiao, Jiajun Chen, Tianxiang Sun +2KV CachingVideo QA

  20. FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

    May 19, 2026Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh +2VLM EvaluationTemporal Video Grounding

  21. CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

    May 18, 2026Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi +3Claim VerificationVideo QA

  22. EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos

    May 18, 2026Ruiping Liu, Junwei Zheng, Yufan Chen +7Multimodal MemoryVideo QA