Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. DiffPrune: differentiable information throttling for token pruning in vision-language models

    Aug 3, 2026Landi He, Mingde Yao, Shawn Young +1Vision-Language ModelsEfficient VLM Inference

  2. Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

    Aug 3, 2026Wenxiao Fan, Jingling Fu, Fang Li +9Vision-Language ModelsVLM Reasoning

  3. SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

    Aug 3, 2026Jing Wu, Jianhua Wu, Jiayi Guan +5Vision-Language ModelsVisual Spatial Reasoning

  4. DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

    Aug 3, 2026Yongkang Zhou, Xiang Xia, Cheng Yan +2Vision-Language ModelsEfficient VLM Inference

  5. Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

    Aug 3, 2026Xiaohao Yang, Aohua Tian, Derek Van Berkel +2VLM EvaluationVision-Language Models

  6. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  7. Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

    Aug 2, 2026Jianmin Chen, Jiaqi Tang, Wei Wei +9Vision-Language ModelsLong-Context Modeling

  8. Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

    Aug 2, 2026Khondoker Ittehadul IslamVLM EvaluationVision-Language Models

  9. MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

    Aug 2, 2026Jiang Wu, Sichao Wu, Yinsong Ma +2Vision-Language ModelsEfficient VLM Inference

  10. Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts

    Aug 1, 2026Ziang Wu, Peng Jin, Qishen Yin +4Expert Load BalancingVision-Language Models

  11. Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

    Aug 1, 2026Shalom Kachko, Raz Lapid, Margarita Vald +2Vision-Language ModelsVLM Interpretability

  12. Attention-Steered Vision-Language Models for Sign Language Translation

    Jul 31, 2026Meibo Hu, Guohao Sun, Annemarie D. Ross +2Sign Language TranslationVision-Language Models

  13. Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

    Jul 31, 2026Rupak Sarkar, Neha Srikanth, Saloni Gupta +3VLM EvaluationVision-Language Models

  14. Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure

    Jul 31, 2026Saleh Sakib Ahmed, M. Sohel RahmanRemote Sensing Image UnderstandingVision-Language Models

  15. ReToken: Improving Long-Context VLMs with Visual Retrieval Token

    Jul 30, 2026Yao Xiao, Reuben Tan, Zhen Zhu +3Vision-Language ModelsVision-Language Retrieval

  16. MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

    Jul 30, 2026Alex Andonian, Samuel G Rodriques, Andrew D White +1Vision-Language ModelsOptical Character Recognition

  17. Scaling Vision-Language Models Is Not Enough to Mitigate Bias

    Jul 30, 2026Ioannis Sarridis, Ioannis Kompatsiaris, Symeon PapadopoulosVLM EvaluationVLM Robustness

  18. MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

    Jul 30, 2026Weihang Wang, Kainan Tu, Jielei Zhang +9VLM EvaluationVision-Language Models

  19. Prior Directions: Why GUI Grounding Gets Locked in the Past

    Jul 29, 2026Weile Gong, Zijian Lu, Mingcai Chen +3Vision-Language ModelsGUI Grounding

  20. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Jul 27, 2026Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20Vision-Language ModelsEfficient VLM Inference

  21. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Jul 25, 2026Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4Vision-Language ModelsEfficient VLM Inference

  22. What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

    Jul 25, 2026Chen-Yi Lu, Yueh-Shao Chen, Somali ChaterjiVision-Language ModelsVLM Adaptation

  23. Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

    Jul 25, 2026Sultan Alshehri, Zhantao Yang, Han Zhang +1Vision-Language ModelsVLM Reasoning

  24. ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    Jul 22, 2026Karan Goyal, Afreen Hossain, Debojyoti Das +1VLM EvaluationVision-Language Models

  25. An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

    Jul 21, 2026Nassira Ait Mehdi, Milissa Temmam, Slimane LarabiVision-Language ModelsMental Health

  26. No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

    Jul 21, 2026Feinan Cheng, Dongliang Xu, Wenli Nong +4Vision-Language ModelsUAV Navigation