Video Reasoning

Momentum

13 papers in the last four weeks, up 86% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 134

All topics
CardsList
  1. CASE: Cost-Aware Stopping for Efficient Long-Video Agents

    Oct 4, 2026Yiming Du, Chenghao Liu, Zhiyuan Liu +4Efficient VLM InferenceVideo Reasoning

  2. From Reasoning Failures to Composable Video Spatial Intelligence

    Oct 1, 2026Pengzhan Sun, Junbin Xiao, Ramanathan Rajaraman +2Spatial Reasoning BenchmarksVideo Reasoning

  3. VR-JEPA: Learning Contrastive-State Latent Guidance for Generation-based Video Reasoning

    Sep 30, 2026Zehua Ma, Kun Xiang, Yunshuang Nie +9Contrastive LearningPhysical Consistency in Video Generation

  4. OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

    Sep 30, 2026Junming Lin, Yuxuan Wang, Zhenxin Lei +11On-Policy Self-DistillationMultimodal Reasoning

  5. Does Local Video Understanding Transfer Across Encounters? The EgoGears Benchmark

    Sep 29, 2026Yuedong Tan, Lei Qi, Yu Liu +13Video UnderstandingEgocentric Video QA

  6. SYNCR: Diagnosing and Learning Cross-Video Reasoning from Simulation

    Sep 29, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Video-Language Model EvaluationVideo Reasoning

  7. Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement Learning

    Sep 29, 2026Ziheng Huang, Yicheng Bao, Xueheng Li +8Streaming Video UnderstandingVideo QA

  8. Learning via Self-Consistency for Diffusion-based Video Reasoning

    Sep 29, 2026Zhenghao Ni, Weimin Qiu, Meng TangVideo Diffusion ModelsSelf-Consistency Decoding

  9. Scaling Video Generation for Reasoning: At What Cost?

    Sep 29, 2026Weihang Guo, Xiaoyu Wu, Yifei Wang +2Video ReasoningAutoregressive Video Generation

  10. Video-HopChain: Multi-Hop Questions and Confidence-Gated Exploration for Video Reasoning Models

    Sep 22, 2026Trung Nguyen Quang, Yuhao Dong, Shuo Sun +4Group Relative Policy OptimizationVideo Reasoning

  11. Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding

    Sep 8, 2026Zhenxin Qin, Peng Shi, Cong Han +3Temporal Video GroundingVideo Understanding

  12. Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning

    Sep 3, 2026Yijun Yang, Shenghe Zheng, Wenbo Li +8Visual Spatial Reasoning3D Spatial Reasoning

  13. FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos

    Aug 31, 2026Maya Moriya, Sigal Raab, Yael Vinker +1Tool-Using Vision-Language AgentsVideo Reasoning

  14. SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

    Aug 31, 2026Zheyu Huang, Zijing Shi, Haozhe Luo +4Video QAMultimodal Reasoning

  15. Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

    Aug 17, 2026Ao Shen, Yongheng Zhang, Yinghui Li +3VLM DistillationVideo Reasoning

  16. UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

    Aug 13, 2026Peng Li, Qianqian Xu, Shilong Bao +2Pedestrian Intention PredictionIntelligent Transportation Systems

  17. Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

    Aug 12, 2026Xikai Sun, Kebin Liu, Haotian Wang +3Video ReasoningVLM Reasoning

  18. Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

    Aug 11, 2026Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli +1VLM EvaluationVision-Language Models

  19. SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

    Aug 8, 2026Keyang Zhong, Kuo Wang, Peng Liu +5Temporal Video GroundingGroup Relative Policy Optimization

  20. SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

    Aug 8, 2026Yizhi Li, Jiawei Jiang, Guanhong Wang +2Sports Video AnalysisVideo QA

  21. I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

    Aug 7, 2026Shibo Gao, Chongxiao Wang, Chenglong Huang +10Video QAVision-Language Grounding

  22. GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

    Aug 6, 2026Qifeng Zhang, Kaixiang Huang, Heng Dong +6VLM EvaluationSpatial Reasoning Benchmarks

  23. ChronoVision: Temporal Reasoning via Latent State Reconstruction

    Aug 6, 2026Yifan Shen, Jian Xu, Boyi Li +6Multimodal Large Language ModelsLatent Visual Reasoning

  24. From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

    Aug 6, 2026Jiawei Qiu, Yichen Xu, Jianzhe Ma +5LLM Safety BenchmarksLanguage Model Safety Evaluation

  25. Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

    Aug 4, 2026Haotian Xia, Zilin Xiao, Junbo Zou +2Video QALatent Visual Reasoning

  26. AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

    Aug 3, 2026Jingqi Tian, Haoji Zhang, Lin Chen +7Efficient VLM InferenceRL for Language Model Reasoning

  27. RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

    Jul 30, 2026Jingxiang Fan, Junbao Zhuo, Bochao ZouMultimodal MemoryMultimodal Reasoning

  28. EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

    Jul 29, 2026Yuyun Chen, Tianao Li, TianQuan Feng +4Egocentric Video UnderstandingVideo Reasoning

  29. Visual prompt engineering for video models

    Jul 28, 2026Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer +7Video ReasoningVisual Prompt Learning

  30. CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

    Jul 27, 2026Jinlong Yang, Wenhao Zhang, Kuanwei Lin +1Tool Use in VLMsEfficient VLM Inference

  31. DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

    Jul 25, 2026Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao +1Disaster ResponseVideo Reasoning

  32. BasketEvent: Understanding Who Did What and When in Basketball Videos

    Jul 23, 2026Yu Zhang, Jiayuan Rao, Haoning Wu +1Sports Video AnalysisVideo Reasoning

  33. An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

    Jul 21, 2026Nassira Ait Mehdi, Milissa Temmam, Slimane LarabiVision-Language ModelsMental Health

  34. ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

    Jul 20, 2026Ting Huang, Zhenyu Zhang, Wenyuan Huang +2Memory-Augmented VLMsVisual Spatial Reasoning

  35. Thinking in Video: Can Video Generators Really Reason About the Real World?

    Jul 20, 2026Yongheng Zhang, Guang Yang, Ruihan Hou +12Video ReasoningCausal Reasoning in Videos

  36. Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

    Jul 13, 2026Kerui Chen, Jinglu Wang, Xiaoyi Zhang +1Active PerceptionSports Video Analysis

  37. TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

    Jul 13, 2026Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen +2Tool Use in VLMsSports Video Analysis

  38. Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset

    Jul 11, 2026Zhiyan Zhang, Peipei Song, Jinpeng Hu +3Video ReasoningCausal Reasoning in Videos

  39. OpenCoF: Learning to Reason Through Video Generation

    Jul 9, 2026Xinyan Chen, Ziyu Guo, Renrui Zhang +2Video Diffusion ModelsVideo Generation

  40. TimeThink: Reasoning with Time for Video LLMs

    Jul 6, 2026Handong Li, Longteng Guo, Zikang Liu +8Temporal Video GroundingProcess Reward Models

  41. STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

    Jul 3, 2026Syed Ariff Syed Hesham, Yun Liu, Guolei Sun +4Video ReasoningReasoning Segmentation

  42. Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

    Jul 2, 2026Francesca Pistilli, Simone Alberto Peirone, Giuseppe AvertaScene Graph GenerationEgocentric Video Understanding

  43. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  44. EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection

    Jul 1, 2026Wenhao Zhang, Kuanwei Lin, Xuyi Yang +2Long-Video UnderstandingVideo Reasoning

  45. Linguistic Relative Policy Optimization for Video Anomaly Reasoning

    Jul 1, 2026Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo +4VLM AdaptationRL for Language Model Reasoning

  46. HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

    Jun 26, 2026Pulkit Gera, Faegheh Sardari, Asmar Nadeem +4VLM EvaluationSpatial Reasoning Benchmarks

  47. Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

    Jun 26, 2026Shuimu Chen, Yuteng Chen, Yuanshen Guan +7LLM Self-CorrectionLong-Video Understanding

  48. Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

    Jun 26, 2026Hohin Kwan, Hongyu Li, Ray Zhang +5VLM EvaluationMultimodal Large Language Models

  49. Confidence-Aware Tool Orchestration for Robust Video Understanding

    Jun 25, 2026Yangfan He, Yujin Choi, Jaehong YoonVLM RobustnessTool Use in VLMs

  50. FeVOS: Foresight Expression Video Object Segmentation

    Jun 24, 2026Kehan Lan, Kaining Ying, Henghui DingVideo Object SegmentationReferring Video Object Segmentation

  51. SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

    Jun 23, 2026Sheng Xia, Zhengqin Lai, Tianxiang Jiang +4Temporal Video GroundingVideo Reasoning

  52. VideoLatent: Video-Language Learning via Latent Self-Forcing

    Jun 22, 2026Zi-Yuan Hu, Zicong Tang, Shijia Huang +3Multimodal Large Language ModelsLatent Visual Reasoning

  53. HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

    Jun 19, 2026Awais Rauf, Ahmed Hasssan, Greg SlabaughVideo UnderstandingLong-Context Modeling

  54. CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

    Jun 18, 2026Chengwen Liu, Hao Peng, Jisheng Dang +3Reward ShapingVideo Reasoning

  55. Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

    Jun 16, 2026Chengwen Liu, Zhe Huang, Jisheng Dang +3Multimodal Reward ModelingVideo Reasoning