Video-Language Model Evaluation

Latest papers 55

All topics
CardsList
  1. Have I Seen Enough? Frozen Video-Language Models Encode Evidence Readiness

    Oct 6, 2026Dan Ben-Ami, Kobi Cohen, Chaim BaskinStreaming Video UnderstandingVideo-Language Model Evaluation

  2. InteractionBench: A Real-Time Interaction Benchmark for Streaming Video Systems

    Oct 5, 2026Enxin Song, Suhao Yu, Yifei Xu +7Streaming Video UnderstandingVideo-Language Model Evaluation

  3. Video-Index: A Curated Meta-Benchmark for Video Understanding

    Oct 1, 2026Enxin Song, Yinuo Xu, Shusheng Yang +2Video UnderstandingVideo-Language Model Evaluation

  4. SYNCR: Diagnosing and Learning Cross-Video Reasoning from Simulation

    Sep 29, 2026Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy +1Video-Language Model EvaluationVideo Reasoning

  5. Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

    Sep 29, 2026Yanan Wang, Tingsong Li, Kaixun Jiang +3Direct Preference OptimizationVideo-Language Model Evaluation

  6. ActionLens: Diagnosing Spatial-Temporal Binding Failures in Vision-Language Models

    Sep 28, 2026Gueter Josmy Faure, Min-Hung Chen, Hao Ping Wang +3Video-Language Model EvaluationTemporal Video Understanding

  7. CinematicVQA: Benchmarking Film-Grammar Reasoning in Large Vision-Language Models

    Sep 23, 2026Shuo Xing, Pooja Verlani, Balu Adsumilli +1Video UnderstandingVideo-Language Model Evaluation

  8. Can Vision-Language Models Analyze Human-Centered Video? Mapping Model Capabilities and Human-AI Collaborative Workflows

    Sep 23, 2026Xiyuan Shen, Jiuyang Lyu, Seokhyun Hwang +4Video UnderstandingVideo-Language Model Evaluation

  9. A Hierarchy-Aware Video-Language Model Evaluation and Hyperbolic Baseline for Surgery

    Sep 22, 2026Ana Manzano Rodríguez, Pascal Mettes, Marlies P. Schijven +1Video-Language Model EvaluationHierarchical Representation Learning

  10. Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?

    Sep 15, 2026Zhaoyang Wei, Zipeng Wang, Yushe Cao +10Audio-Visual UnderstandingVideo-Language Model Evaluation

  11. Not Another Text Benchmark: Putting the "Visual" Back in Visual Question Answering for Large Video Models

    Sep 15, 2026Rwiddhi Chakraborty, Yinong, Wang +7Video-Language Model EvaluationVideo QA

  12. DementiaCare-Bench: A Modality-Validated Video Benchmark

    Sep 14, 2026Afrouz Sheikholeslami, Yuankai Qi, Xuyun Zhang +4Alzheimer's DiseaseHealthcare

  13. LiveProBench: Can Streaming Video Models Really Interact Like Humans?

    Sep 11, 2026Kaixuan Du, Xin Wan, Hang Zhang +4Streaming Video UnderstandingVideo-Language Model Evaluation

  14. MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

    Sep 8, 2026Dhairya Bhatia, Bishoy Galoaa, Oliver Fritsche +7Video-Language Model EvaluationVideo-Language Models

  15. Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

    Sep 8, 2026Ruibo Ming, Lei Sun, Deheng Zhang +8Video-Language Model EvaluationVideo-Language Models

  16. Do Input-Level Defenses Transfer to Observation-Level Attacks on VideoLLMs?

    Sep 8, 2026Bangshuo Zhu, Wei Song, Yuxin Cao +4VLM RobustnessAdversarial Attacks on VLMs

  17. TempCloze: Can Video-LLMs Identify the Missing Middle?

    Sep 1, 2026Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4Video-Language Model EvaluationVideo-Language Models

  18. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language Model EvaluationVideo-Language Models

  19. TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

    Aug 30, 2026Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3Audio-Visual UnderstandingVideo-Language Model Evaluation

  20. DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

    Aug 30, 2026Bomiao Wang, Zekai Shao, Jiexiang Lan +3Video UnderstandingVideo-Language Model Evaluation

  21. NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

    Aug 13, 2026Yuheng Huang, Jianlang Chen, Jiayang Song +6Video UnderstandingVideo-Language Model Evaluation

  22. EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

    Aug 13, 2026Weitao Chen, Hu Jiaxin, Xie Tianyidan +15Egocentric Video QAVideo-Language Model Evaluation

  23. VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

    Aug 10, 2026Jiajun Xu, Yanghao Zhou, Jingyun Liao +6Web Application GenerationVideo-Language Model Evaluation

  24. Action- and Language-Conditioned Video Assessment for Embodied Control

    Aug 8, 2026Hwanhee Kim, Jaehyun Jang, Seungmin Cha +3Video-Language Model EvaluationLong-Horizon Agent Evaluation

  25. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

    Aug 6, 2026Sarvesh Baskar, Zikui Cai, Shayan Shabihi +5Video-Language Model EvaluationTemporal Video Understanding

  26. Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

    Aug 5, 2026Yang Wang, Yanan Ma, Yiqi Liu +7Video-Language Model EvaluationMultimodal Reasoning

  27. CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

    Aug 5, 2026Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1Video-Language Model EvaluationVideo Captioning

  28. Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

    Aug 4, 2026Yuxin Cao, Wei Song, Jingling Xue +1Selective PredictionVideo-Language Model Evaluation

  29. PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

    Aug 3, 2026Zhongjie Ba, Shengwang Xu, Peng Cheng +4Video-Language Model EvaluationVideo QA

  30. RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

    Aug 3, 2026Hongjie Zhou, Shiqin Wang, Haoyang Chen +5Video-Language Model EvaluationRemote Sensing

  31. Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

    Jul 14, 2026Jae Joong LeeVLM EvaluationVideo-Language Model Evaluation

  32. Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

    Jun 22, 2026Yu Cao, Ziquan Liu, Zhensong Zhang +3VLM EvaluationPhysical Consistency in Video Generation

  33. Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

    Jun 8, 2026Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh +5LLM Fine-TuningSynthetic Data Generation

  34. VCIFBench: Evaluating Complex Instruction Following for Video Understanding

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangVLM EvaluationVideo Understanding

  35. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  36. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  37. EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

    May 11, 2026Zichen Wen, Boxue Yang, Junlong Ke +5Streaming Video UnderstandingSelf-Training

  38. Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

    Feb 11, 2026Sethuraman T, Savya Khosla, Aditi Tiwari +12VLM RobustnessVideo-Language Model Evaluation

  39. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  40. NeMo: Needle in a Montage for Video-Language Understanding

    Sep 29, 2025Zi-Yuan Hu, Shuo Liang, Duo Zheng +10Temporal Video GroundingVideo-Language Model Evaluation

  41. VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

    May 23, 2025Shenghui Chen, Po-han Li, Sandeep Chinchali +1VLM EvaluationVideo Summarization