Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 253

All topics
CardsList
  1. Self-Prophetic Decoding to Unlock Visual Search in LVLMs

    May 27, 2026Zhendong He, Qiyuan Dai, Guanbin Li +2Large Vision-Language ModelsVLM Reasoning

  2. Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

    May 27, 2026Yuang Huang, Yafeng Zhang, Yu ZilanVision-Language ModelsHallucination in Language Models

  3. Structure-Guided Visual Perturbation Neutralization for LVLMs

    May 27, 2026Yuanhe Zhang, Xueting Wang, YanBin Ren +6VLM RobustnessAdversarial Attacks on VLMs

  4. Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

    May 26, 2026Joseph Hoche, David Brellmann, Gianni FranchiVision-Language ModelsLarge Vision-Language Models

  5. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  6. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5VLM EvaluationRemote Sensing Image Understanding

  7. Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

    May 25, 2026Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai +6Adversarial Representation LearningVision-Language Models

  8. VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

    May 23, 2026Bo Li, Ronghao Chen, Ningyuan Deng +3VLM AdaptationLarge Vision-Language Models

  9. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  10. CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

    May 22, 2026Liupeng Li, Haoqian Kang, Zhenyu Lu +4Efficient VLM InferenceLarge Vision-Language Models

  11. Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

    May 20, 2026Meng Shen, Minghao Wu, Deepu RajanVision-Language ModelsHallucination in Language Models

  12. Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

    May 20, 2026Zhe Cheng, Wenyu Chen, Fode Zhang +1VLM RobustnessHallucination in Language Models

  13. Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

    May 20, 2026Yutong Xie, Zhenglin Hua, Ran Wang +3Vision-Language ModelsHallucination in Language Models

  14. Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

    May 19, 2026Yi Zhong, Haotong Qin, Xindong Zhang +2Vision-Language ModelsVLM Quantization

  15. Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding

    May 18, 2026Shravan Murlidaran, Ziqi Wen, Sana Shehabi +1Visual AttentionLarge Vision-Language Models

  16. EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

    May 15, 2026Xuanyu Ge, Zhongqi Wang, Jie Zhang +2Large Vision-Language ModelsBackdoor Detection

  17. LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

    May 15, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  18. AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

    May 15, 2026Zhiwei Li, Jiacheng Xue, Weining Wang +4VLM RobustnessAdversarial Robustness

  19. Deep Pre-Alignment for VLMs

    May 14, 2026Tianyu Yu, Kechen Fang, Zihao Wan +5Vision-Language ModelsLarge Vision-Language Models

  20. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Visual ReasoningLarge Vision-Language Models

  21. MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

    May 14, 2026Wei Ding, Yilin Li, Yudong Zhang +4Vision-Language ModelsLLM Hallucination Mitigation

  22. Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

    May 14, 2026Tian Qin, Junzhe Chen, Yuqing Shi +3Efficient VLM InferenceHallucination in Language Models

  23. CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

    May 14, 2026Ailar Mahdizadeh, Puria Azadi, Muchen Li +2Streaming Video UnderstandingKV Caching

  24. To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

    May 14, 2026Chengshuai Zhao, Zhen Tan, Dawei Li +2VLM RobustnessMultimodal Robustness

  25. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models