Video-Language Models

Latest papers 110

All topics
CardsList
  1. Mid-Training Language Models on Raw Video

    Oct 8, 2026Jaedong Hwang, Xiaoqian Shen, Ernie Chang +9Multimodal Large Language ModelsVideo-Language Models

  2. EC-RAG: Event Chain Retrieval-Augmented Generation for Long Video Understanding

    Oct 6, 2026Yuhao Qin, Junbo Wang, Yuke Li +1Multimodal RAGVideo-Language Models

  3. Have I Seen Enough? Frozen Video-Language Models Encode Evidence Readiness

    Oct 6, 2026Dan Ben-Ami, Kobi Cohen, Chaim BaskinStreaming Video UnderstandingVideo-Language Model Evaluation

  4. Video Encoders Built on Image Representations

    Oct 5, 2026Jusheng Zhang, Wenhao Wang, Longqi Cai +3Video-Language ModelsVideo Representation Learning

  5. MeSD: Multi-Evidence Self-Distillation for VideoLLM

    Oct 5, 2026Weijie Zhu, Han Fang, Hanyu Fu +13On-Policy Self-DistillationVideo-Language Models

  6. Before It Fades: Reinforcing Temporal Representations at Inference Time in VideoLLMs

    Oct 1, 2026Youngwoo Shin, Yusung Ro, Minseo Kim +1Video-Language ModelsActivation Steering

  7. RESUME: Recurrent State Updates from Motion and Residual Signals for Efficient Video Language Modeling

    Sep 30, 2026Can Zhang, Xiaotian Han, Junyuan Shang +5Video-Language ModelsVideo Representation Learning

  8. Comparative study of adapting pre-trained models for driving behavior video captioning

    Sep 30, 2026Sayak Mallick, Philipp Geiger, Augustin KelavaVLM AdaptationAutonomous Driving

  9. MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

    Sep 29, 2026Shengyun Zhong, Xinkang Zhao, Ziyuan Chu +1Reinforcement LearningVideo-Language Models

  10. GleanVID: Complementary Token Selection for Efficient Video Large Language Models

    Sep 29, 2026Shuo Yang, Changbai Li, Rui Tang +3Efficient VLM InferenceVideo-Language Models

  11. Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

    Sep 29, 2026Yanan Wang, Tingsong Li, Kaixun Jiang +3Direct Preference OptimizationVideo-Language Model Evaluation

  12. Rethinking Visual Token Compression for Video Large Language Models: A Simple Yet Strong Baseline

    Sep 28, 2026Xiao Zhang, Wang Zeng, Sheng Jin +3Video UnderstandingVideo-Language Models

  13. CinematicVQA: Benchmarking Film-Grammar Reasoning in Large Vision-Language Models

    Sep 23, 2026Shuo Xing, Pooja Verlani, Balu Adsumilli +1Video UnderstandingVideo-Language Model Evaluation

  14. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning

    Sep 14, 2026Mantek Singh, Jeshwanth Challagundla, Siddharth Raina +1CoT DistillationVLM Distillation

  15. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual UnderstandingEfficient VLM Inference

  16. MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

    Sep 8, 2026Dhairya Bhatia, Bishoy Galoaa, Oliver Fritsche +7Video-Language Model EvaluationVideo-Language Models

  17. Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

    Sep 8, 2026Ruibo Ming, Lei Sun, Deheng Zhang +8Video-Language Model EvaluationVideo-Language Models

  18. TempCloze: Can Video-LLMs Identify the Missing Middle?

    Sep 1, 2026Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu +4Video-Language Model EvaluationVideo-Language Models

  19. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language Model EvaluationVideo-Language Models

  20. The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis

    Aug 13, 2026Danial Sharifrazi, Saadat Behzadi, Julakha Jahan Jui +5Multimodal ClassificationVideo-Language Models

  21. VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

    Aug 9, 2026Dong Xing, Jiaxin Chen, Hang Yang +3Video-Language ModelsVLM Hallucination Mitigation

  22. Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

    Aug 5, 2026Yang Wang, Yanan Ma, Yiqi Liu +7Video-Language Model EvaluationMultimodal Reasoning

  23. GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

    Aug 4, 2026Mengjie Zhang, Qihui Zhu, Tao Zhang +10Efficient VLM InferenceVideo-Language Models

  24. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Efficient VLM InferenceVideo-Language Models