Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. Zamba2-VL Technical Report

    May 29, 2026Hassan Shapourian, Kasra Hejazi, Olabode M. Sule +1Vision-Language ModelsEfficient VLM Inference

  2. Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

    May 29, 2026Zijie Zhou, Dandan Zhu, Hangxiangpan Wang +3Vision-Language ModelsLarge Vision-Language Models

  3. Personalize Your Large Vision-language Models With In-context Prompt Tuning

    May 29, 2026Yanshu Li, Jiaqian Li, Kuai Yu +4Vision-Language ModelsLarge Vision-Language Models

  4. "Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models

    May 29, 2026Mihai Masala, Marius Leordeanu, Mihai Dascalu +1VLM EvaluationVision-Language Models

  5. Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

    May 29, 2026Haolin Deng, Xin Zou, Zhiwei Jin +3Vision-Language ModelsDirect Preference Optimization

  6. What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

    May 29, 2026Yusheng He, Jizhe Zhou, Xia Du +3VLM EvaluationVLM Robustness

  7. Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

    May 29, 2026Yijie Tong, Yifan Hou, Shaobo Cui +2VLM EvaluationVision-Language Models

  8. LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

    May 28, 2026Feng Han, Zhixiong Zhang, Zheming Liang +2Cross-Modal LearningVLM Robustness

  9. AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

    May 28, 2026Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan KandemirLLM PruningVision-Language Models

  10. From Pixels to Words -- Towards Native One-Vision Models at Scale

    May 27, 2026Haiwen Diao, Jiahao Wang, Penghao Wu +18Vision-Language ModelsVideo-Language Models

  11. VLMs May Not Globally Enhance Human Alignment over LLMs During Natural Reading

    May 27, 2026Jinzhou Wu, Zhengwu Ma, Jixing Li +2VLM EvaluationVision-Language Models

  12. AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning

    May 27, 2026Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei ZhouClass-Incremental LearningVision-Language Models

  13. When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs

    May 27, 2026Marcell Fekete, Johannes Bjerva, Tamás KáldiVLM EvaluationVisual Question Answering

  14. Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

    May 27, 2026Haozhan Shen, Tiancheng Zhao, Kangjia Zhao +1Vision-Language ModelsVisual Spatial Reasoning

  15. Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

    May 27, 2026Yuang Huang, Yafeng Zhang, Yu ZilanVision-Language ModelsHallucination in Language Models

  16. Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

    May 27, 2026Landi He, Mingde Yao, Shawn Young +1Vision-Language ModelsEfficient VLM Inference

  17. ABot-OCR Technical Report

    May 27, 2026Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng +3Vision-Language ModelsDocument Parsing

  18. Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

    May 26, 2026Yifan Jiang, Ruoxi Ning, Sheng Yao +1VLM EvaluationVision-Language Models

  19. Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

    May 26, 2026Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao +9Vision-Language ModelsVLM Interpretability

  20. Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

    May 26, 2026Joseph Hoche, David Brellmann, Gianni FranchiVision-Language ModelsLarge Vision-Language Models

  21. TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

    May 26, 2026Jiaxiang Li, Yumao Liu, Ke MaVision-Language ModelsVLMs for Autonomous Driving

  22. Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

    May 26, 2026Yuanwei Hu, Bo Peng, Yadan Luo +3Vision-Language ModelsTest-Time Adaptation

  23. DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

    May 26, 2026Jianfei Zhao, Feng Zhang, Xin Sun +3Supervised Fine-TuningVision-Language Models

  24. FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

    May 26, 2026Guixian Xu, Yide Liang, Zeli Su +5VLM EvaluationVision-Language Models