Video-Language Models

Latest papers 110

All topics
CardsList
  1. Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

    Jul 30, 2026Bowen Liu, Shuning Wang, Xinpeng Ding +3Video-Language ModelsLong-Video Understanding

  2. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Jul 27, 2026Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20Vision-Language ModelsEfficient VLM Inference

  3. PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

    Jul 22, 2026Zihan Song, Shuo Ye, Bo Zhao +4Video-Language ModelsVideo Frame Selection

  4. Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

    Jul 17, 2026Wei Feng, Xin Wang, Yu-Wei Zhan +2Temporal Video GroundingVideo-Language Models

  5. VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

    Jul 16, 2026Xinhao Li, Yuhan Zhu, Xiangyu Zeng +24Video UnderstandingStreaming Video Understanding

  6. Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

    Jul 14, 2026Jae Joong LeeVLM EvaluationVideo-Language Model Evaluation

  7. SLVMBench: Skill Learning from Video Memory

    Jul 13, 2026Yudong Yang, Guangzhi Sun, Yixuan Li +1Memory-Augmented VLMsVideo-Language Models

  8. GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

    Jul 10, 2026Guohuan Xie, Mengqi Lei, Chuan Shi +3Efficient VLM InferenceVideo-Language Models

  9. Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

    Jul 9, 2026Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda +2Human Activity RecognitionObject-Centric Representation Learning

  10. Natural Language Camera Movement Understanding

    Jul 3, 2026Yuwen Tan, Joey Huang, Jin Huang +2VLM EvaluationVideo-Language Models

  11. Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

    Jul 3, 2026Wenzheng Zeng, Siyi Jiao, Chen Gao +2Temporal Video GroundingVideo Captioning

  12. MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

    Jul 1, 2026Sihan Chen, Jiale Li, Jianghang Lin +1VLM EvaluationHallucination Detection in VLMs

  13. MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

    Jun 28, 2026Weisong Liu, Haochen Wang, Kuan Gao +8Video CaptioningVideo-Language Models

  14. DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences

    Jun 26, 2026Yankai Yang, Yancheng Long, Bin Wen +4Video UnderstandingVideo-Language Models

  15. HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

    Jun 25, 2026Jiajun Wu, Haoyu Kang, Yining Sun +13Video UnderstandingVideo Content Moderation

  16. CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

    Jun 23, 2026Xinyu Mao, Yuhui Zeng, Xiaokun Liu +6Video CaptioningVideo-Language Models

  17. video-SALMONN-R3^3: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

    Jun 23, 2026Yixuan Li, Guangzhi Sun, Yudong Yang +1Efficient VLM InferenceVideo QA

  18. VideoLatent: Video-Language Learning via Latent Self-Forcing

    Jun 22, 2026Zi-Yuan Hu, Zicong Tang, Shijia Huang +3Multimodal Large Language ModelsLatent Visual Reasoning

  19. Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

    Jun 22, 2026Zhichao Fan, Yanhang Li, Zexin ZhuangVLM EvaluationVideo QA

  20. What Should a Streaming Video Model Remember?

    Jun 15, 2026Haonan Ge, Yiwei Wang, Hang Wu +1Streaming Video UnderstandingVideo-Language Models

  21. MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

    Jun 10, 2026Yuansheng Gao, Wenbin Xing, Jiahao Yuan +4Video-Language ModelsMultimodal Foundation Models

  22. Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

    Jun 8, 2026Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh +5LLM Fine-TuningSynthetic Data Generation

  23. See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding

    Jun 8, 2026Shuning Wang, Zhiheng Wu, YiNuo Lu +6Video QAVideo-Language Models

  24. Watch, Remember, Reason: Human-View Video Understanding with MLLMs

    Jun 5, 2026Jiahao Meng, Yue Tan, Qi Xu +12Streaming Video UnderstandingVideo-Language Models

  25. AdaCodec: A Predictive Visual Code for Video MLLMs

    Jun 1, 2026Haowen Hou, Zhen Huang, Zheming Liang +8Predictive CodingEfficient VLM Inference

  26. Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

    Jun 1, 2026Xiaolin Liu, Yilun Zhu, Xiangyu Zhao +9VLM EvaluationVideo QA

  27. PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

    Jun 1, 2026Yusong Zhao, Yuejin Xie, Youliang Yuan +4Traffic Accident AnticipationVideo-Language Models