Video-Language Models

Latest papers 110

All topics
CardsList
  1. InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

    Jun 1, 2026Xinxin Liu, Shiwei Gan, Xiao Liu +3Efficient VLM InferenceVideo-Language Models

  2. Jailbreaking Multimodal Large Language Models using Multi-Clip Video

    Jun 1, 2026Choongwon Kang, Seungjong Sun, Hyunmin Jun +1Multimodal RobustnessVideo-Language Models

  3. MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

    Jun 1, 2026Pengyu Wang, Chenkun Tan, Shaojun Zhou +18Streaming Video UnderstandingEfficient VLM Inference

  4. V-LynX: Token Interface Alignment for Video+X LLMs

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnCross-Modal AlignmentMultimodal QA

  5. Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

    May 29, 2026Bo Peng, YuanJie Lyu, PengGang Qin +1Video-Language ModelsLong-Video Understanding

  6. SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

    May 29, 2026Xiang Fang, Wanlong FangVideo-Language ModelsVideo Frame Interpolation

  7. Masked Diffusion Vision-Language Models for Temporal Action Localization

    May 28, 2026Fengshun Wang, Zhengbo Zhang, Zhigang TuHuman Activity RecognitionVideo-Language Models

  8. From Pixels to Words -- Towards Native One-Vision Models at Scale

    May 27, 2026Haiwen Diao, Jiahao Wang, Penghao Wu +18Vision-Language ModelsVideo-Language Models

  9. Rethinking Video-Language Model from the Language Input Perspective

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +2VLM AdaptationVideo-Language Models

  10. Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

    May 27, 2026Xiang Fang, Wanlong Fang, Changshuo Wang +4Missing-Modality LearningVLM Robustness

  11. Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

    May 26, 2026Oscar Chew, Serhii Honcharenko, Qian-Hui Chen +4Temporal Video GroundingVideo-Language Model Evaluation

  12. CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

    May 26, 2026Zihan Lin, Songhe Deng, Shuwei He +6Video CaptioningVideo-Language Models

  13. Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

    May 21, 2026Jongseo Lee, Hyuntak Lee, Sunghun Kim +3Video-Language ModelsTemporal Video Understanding

  14. Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

    May 21, 2026Bingjun Luo, Tony Wang, Hanqi Chen +1Video-Language ModelsMultimodal Token Compression

  15. Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

    May 21, 2026Dazhao Du, Jian Liu, Jialong Qin +7Counterfactual EvaluationVideo-Language Models

  16. Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

    May 21, 2026Zelin Zheng, Xinyan Liu, Ruixin Li +4Temporal Video GroundingVideo-Language Models

  17. RoadTones: Tone Controllable Text Generation from Road Event Videos

    May 20, 2026Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran SarvadevabhatlaControllable Text GenerationVideo Captioning

  18. EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

    May 18, 2026Dongyan Lin, Phillip Rust, Angel Villar Corrales +19VLM EvaluationVision-Language Models

  19. LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

    May 17, 2026Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin +5Efficient VLM InferenceVideo-Language Models

  20. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding

  21. Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

    May 12, 2026Maham Nazir, Muhammad Aqeel, Richong Zhang +1Video SummarizationVideo-Language Models

  22. OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

    May 12, 2026Minseok Kang, Minhyeok Lee, Jungho Lee +6Efficient VLM InferenceVideo-Language Models

  23. EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

    May 11, 2026Zichen Wen, Boxue Yang, Junlong Ke +5Streaming Video UnderstandingSelf-Training

  24. Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

    May 8, 2026Peitao Han, Fei Cheng, Lis K. Pereira +2Vision-Language ModelsTemporal Reasoning in Language Models

  25. VISD: Enhancing Video Reasoning via Structured Self-Distillation

    May 7, 2026Hao Lin, Kunyang Lv, Xu Jiang +5Video-Language ModelsVideo Reasoning

  26. Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

    May 6, 2026Miao Wang, Yuling Shi, Yijiang Li +8Grounded Text GenerationLarge Language Model-Based Role-Play Simulation