Video-Language Models

Latest papers 55

All topics
CardsList
  1. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Token CompressionVideo-Language Models

  2. RESUME: Recurrent State Updates from Motion and Residual Signals for Efficient Video Language Modeling

    Sep 30, 2026Can Zhang, Xiaotian Han, Junyuan Shang +5Video-Language ModelsRecurrent State

  3. GleanVID: Complementary Token Selection for Efficient Video Large Language Models

    Sep 29, 2026Shuo Yang, Changbai Li, Rui Tang +3Video-Language ModelsLong Videos

  4. A Hierarchy-Aware Video-Language Model Evaluation and Hyperbolic Baseline for Surgery

    Sep 22, 2026Ana Manzano Rodríguez, Pascal Mettes, Marlies P. Schijven +1Surgical VideosSurgery

  5. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning

    Sep 14, 2026Mantek Singh, Jeshwanth Challagundla, Siddharth Raina +1Video-Language ModelsChain-of-Thought Reasoning

  6. Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics

    Sep 8, 2026Ruibo Ming, Lei Sun, Deheng Zhang +8Video-Language ModelsVideo Dataset

  7. Can LLMs Design Video Coding Tools? A Case Study on Planar Mode

    Sep 1, 2026Yingwen Zhang, Meng Wang, Liqiang He +1Video CodingVideo-Language Models

  8. ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

    Sep 1, 2026Sethuraman T, Savya Khosla, Onkar Kishor Susladkar +6Video-Language ModelsImage-Text Alignment

  9. VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

    Aug 9, 2026Dong Xing, Jiaxin Chen, Hang Yang +3Video-Language ModelsVideo Understanding

  10. Conformal Coverage Guarantees for Any Video Temporal Grounder

    Aug 7, 2026Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin +1Temporal GroundingSpatial Coherence

  11. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

    Aug 6, 2026Sarvesh Baskar, Zikui Cai, Shayan Shabihi +5Video-Language ModelsGraph-Coherent Low-Frequency Ones

  12. CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

    Aug 5, 2026Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1Video-Language ModelsLong-Video Benchmarks

  13. GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

    Aug 4, 2026Mengjie Zhang, Qihui Zhu, Tao Zhang +10Visual Token PruningVideo-Language Models

  14. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Token CompressionVideo-Language Models

  15. Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

    Aug 2, 2026Jiayang He, Tianling Xu, Diancheng Kang +4Token CompressionVideo Compression

  16. PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

    Jul 11, 2026Wenyuan Wang, Lianyu Hu, Hao Wang +1Physical PlausibilityVideo-Language Models

  17. Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

    Jul 9, 2026Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda +2Hand-Object Interaction DetectionEgocentric Video

  18. Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

    Jul 9, 2026Lorenzo Pantè, Andrea Fanti, Roberto CapobiancoCurriculum Reinforcement LearningCurriculum

  19. Natural Language Camera Movement Understanding

    Jul 3, 2026Yuwen Tan, Joey Huang, Jin Huang +2Video-Language ModelsCamera Control

  20. Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation

    Jun 29, 2026Bertram Taetz, Hugo Albuquerque Cosme da Silva, Gabriele Bleser-TaetzVideo-Language ModelsText-To-Motion Generation

  21. Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars

    Jun 21, 2026Ramesh Nandipalli, Chandranath AdakSign Language TranslationIndian Languages

  22. The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

    Jun 19, 2026Serdar Ozsoy, Lars Doorenbos, Federico Spurio +2Video-Language ModelsProcedural

  23. Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

    Jun 9, 2026Zihan Meng, Dexiang Hong, Weidong Chen +3Visual Token PruningAudio-Visual Reasoning

  24. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Token CompressionVideo-Language Models

  25. Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

    Jun 1, 2026Xiang Fang, Wanlong Fang, Wei Ji +1Video-Language ModelsMultimodal Fusion

  26. Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

    May 31, 2026Yuyang Sun, Yongliang Wu, Xingyu Zhu +8Long Video Question AnsweringVideo Understanding

  27. Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

    May 29, 2026Bo Peng, YuanJie Lyu, PengGang Qin +1Future Video PredictionVideo-Language Models

  28. PEEK: Picking Essential frames via Efficient Knowledge distillation

    May 29, 2026Killian Steunou, Anas Filali Razzouki, Khalil Guetari +2Video-Language ModelsFrame Rate

  29. SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

    May 29, 2026Xiang Fang, Wanlong FangVideo-Language ModelsLagrangian Methods

  30. Rethinking Video-Language Model from the Language Input Perspective

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +2Video-Language ModelsText-To-Video Generation Model

  31. Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +4Video-Language ModelsComputer Vision

  32. STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

    May 25, 2026Yiming Liang, Yixiao Chen, Yiyang Zhou +8Video-Language ModelsVideo Understanding

  33. Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

    May 21, 2026Dazhao Du, Jian Liu, Jialong Qin +7Video-Language ModelsSpatio-Temporal Reasoning

  34. OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

    May 20, 2026Yisen Feng, Leigang Qu, Haoyu Zhang +5Large Language Model RerankingVideo-Language Models

  35. OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

    May 12, 2026Minseok Kang, Minhyeok Lee, Jungho Lee +6Token CompressionVideo Compression

  36. EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

    May 11, 2026Zichen Wen, Boxue Yang, Junlong Ke +5Video-Language ModelsParameter-Efficient Adaptation

  37. TTF: Temporal Token Fusion for Efficient Video-Language Model

    May 8, 2026Simin Huo, Ning LIVideo-Language ModelsQwen3

  38. HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

    May 4, 2026Haopeng Jin, Hongzhu Yi, Wenlong Zhao +6Video-Language ModelsVideo Understanding

  39. WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization

    May 4, 2026Wei Tao, Xiaoyang Qu, Peiqiang Wang +4Key-Value Cache QuantizationQuantizer

  40. QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

    Apr 27, 2026Woojun Jung, Junyeong KimSummarizationMultimodal Evaluation

  41. IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

    Apr 27, 2026Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides +2Video-Language ModelsInverse Problem

  42. Building a Precise Video Language with Human-AI Oversight

    Apr 22, 2026Zhiqiu Lin, Chancharik Mitra, Siyuan Cen +13Video-Language ModelsCinematic Ideal

  43. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

    Apr 20, 2026Han Li, Zehao Huang, Jiahui Fu +23D Scene UnderstandingVisual Token Pruning

  44. Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

    Apr 20, 2026Ziyao Tang, Pengkun Jiao, Bin Zhu +3Video-Language ModelsWeak Visual Grounding

  45. CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

    Apr 7, 2026Yulin Zou, Wenyan Chen, Yan Chen +6Video-Language ModelsStreaming Video

  46. Stateful Token Reduction for Long-Video Hybrid VLMs

    Feb 27, 2026Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7Hybrid Mamba-Transformer ModelVideo-Language Models

  47. Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

    Feb 11, 2026Sethuraman T, Savya Khosla, Aditi Tiwari +12Video-Language ModelsVisual Evidence