Video-Language Models

Latest papers 110

All topics
CardsList
  1. VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models

    May 5, 2026JF Bastien, Sam D'AmicoEfficient VLM InferenceVideo-Language Models

  2. HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

    May 4, 2026Haopeng Jin, Hongzhu Yi, Wenlong Zhao +6Video UnderstandingVideo-Language Models

  3. WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

    May 4, 2026Wei Tao, Xiaoyang Qu, Peiqiang Wang +4Mixed-Precision QuantizationVLM Quantization

  4. IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

    Apr 27, 2026Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides +2Intent ClassificationVideo-Language Models

  5. Building a Precise Video Language with Human-AI Oversight

    Apr 22, 2026Zhiqiu Lin, Chancharik Mitra, Siyuan Cen +13Human-in-the-Loop AnnotationVideo Captioning

  6. Leveraging Vision-Language Models to Detect Attention in Educational Videos

    Apr 20, 2026Gabriel Becquet, Sébastien Lallé, Vanda Luengo +1VLM EvaluationEducational Technology

  7. EasyVideoR1: Easier RL for Video Understanding

    Apr 18, 2026Chuanyu Qin, Chenxu Yang, Qingyi Si +6Reinforcement LearningVideo-Language Models

  8. Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

    Apr 16, 2026Yiyang Jiang, Li Zhang, Xiao-Yong Wei +1Sign Language TranslationVideo-Language Models

  9. Do Vision Language Models Understand Human Engagement in Games?

    Mar 19, 2026Ziyi Wang, Qizan Guo, Rishitosh Singh +1VLM EvaluationVideo-Language Models

  10. Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

    Mar 3, 2026Anum Afzal, Yuki Saito, Hiroya Takamura +5Language Model DecodingMultimodal Large Language Models

  11. DynaTokens: Controlling Token Dynamics for Continual Video-Language Understanding

    Mar 2, 2026Toan Nguyen, Yang Liu, Celso De Melo +1Continual LearningVideo QA

  12. Stateful Token Reduction for Long-Video Hybrid VLMs

    Feb 27, 2026Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7Efficient VLM InferenceVideo-Language Models

  13. Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

    Feb 11, 2026Sethuraman T, Savya Khosla, Aditi Tiwari +12VLM RobustnessVideo-Language Model Evaluation

  14. VideoSTF: Stress-Testing Output Repetition in Video Large Language Models

    Feb 11, 2026Yuxin Cao, Wei Song, Shangzhi Xu +2VLM EvaluationVLM Robustness

  15. Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

    Oct 2, 2025Derek Shi, Ruben Glatt, Christine Klymko +5Video-Language ModelsRL Fine-Tuning

  16. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding

  17. VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

    May 23, 2025Shenghui Chen, Po-han Li, Sandeep Chinchali +1VLM EvaluationVideo Summarization

  18. Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models

    Jan 14, 2025Yifang Xu, Yunzhuo Sun, Benxiang Zhai +4Temporal Video GroundingVideo-Language Models

  19. Video2Reaction: Training Foundation Video Models to Predict Audience Reaction

    Date pendingSidong Zhang, Trang Nguyen, Shiv Shankar +4VLM AdaptationVideo-Language Models