Video-Language Model Evaluation

Latest papers 55

All topics
CardsList
  1. Action- and Language-Conditioned Video Assessment for Embodied Control

    Aug 8, 2026Hwanhee Kim, Jaehyun Jang, Seungmin Cha +3Video-Language Model EvaluationLong-Horizon Agent Evaluation

  2. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

    Aug 6, 2026Sarvesh Baskar, Zikui Cai, Shayan Shabihi +5Video-Language Model EvaluationTemporal Video Understanding

  3. Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

    Aug 5, 2026Yang Wang, Yanan Ma, Yiqi Liu +7Video-Language Model EvaluationMultimodal Reasoning

  4. CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

    Aug 5, 2026Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1Video-Language Model EvaluationVideo Captioning

  5. Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

    Aug 4, 2026Yuxin Cao, Wei Song, Jingling Xue +1Selective PredictionVideo-Language Model Evaluation

  6. PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

    Aug 3, 2026Zhongjie Ba, Shengwang Xu, Peng Cheng +4Video-Language Model EvaluationVideo QA

  7. RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

    Aug 3, 2026Hongjie Zhou, Shiqin Wang, Haoyang Chen +5Video-Language Model EvaluationRemote Sensing

  8. Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

    Jul 14, 2026Jae Joong LeeVLM EvaluationVideo-Language Model Evaluation

  9. Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

    Jun 22, 2026Yu Cao, Ziquan Liu, Zhensong Zhang +3VLM EvaluationPhysical Consistency in Video Generation

  10. Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

    Jun 8, 2026Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh +5LLM Fine-TuningSynthetic Data Generation

  11. VCIFBench: Evaluating Complex Instruction Following for Video Understanding

    Jun 3, 2026Huangchen Xu, Yuan Wu, Yi ChangVLM EvaluationVideo Understanding

  12. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  13. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  14. EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

    May 11, 2026Zichen Wen, Boxue Yang, Junlong Ke +5Streaming Video UnderstandingSelf-Training

  15. Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

    Feb 11, 2026Sethuraman T, Savya Khosla, Aditi Tiwari +12VLM RobustnessVideo-Language Model Evaluation

  16. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  17. NeMo: Needle in a Montage for Video-Language Understanding

    Sep 29, 2025Zi-Yuan Hu, Shuo Liang, Duo Zheng +10Temporal Video GroundingVideo-Language Model Evaluation

  18. VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

    May 23, 2025Shenghui Chen, Po-han Li, Sandeep Chinchali +1VLM EvaluationVideo Summarization