Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 253

All topics
CardsList
  1. Structure-Guided Visual Perturbation Neutralization for LVLMs

    May 27, 2026Yuanhe Zhang, Xueting Wang, YanBin Ren +6VLM RobustnessAdversarial Attacks on VLMs

  2. Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

    May 26, 2026Joseph Hoche, David Brellmann, Gianni FranchiVision-Language ModelsLarge Vision-Language Models

  3. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  4. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5VLM EvaluationRemote Sensing Image Understanding

  5. Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

    May 25, 2026Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai +6Adversarial Representation LearningVision-Language Models

  6. VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

    May 23, 2026Bo Li, Ronghao Chen, Ningyuan Deng +3VLM AdaptationLarge Vision-Language Models

  7. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  8. CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

    May 22, 2026Liupeng Li, Haoqian Kang, Zhenyu Lu +4Efficient VLM InferenceLarge Vision-Language Models

  9. Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

    May 20, 2026Meng Shen, Minghao Wu, Deepu RajanVision-Language ModelsHallucination in Language Models

  10. Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

    May 20, 2026Zhe Cheng, Wenyu Chen, Fode Zhang +1VLM RobustnessHallucination in Language Models

  11. Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

    May 20, 2026Yutong Xie, Zhenglin Hua, Ran Wang +3Vision-Language ModelsHallucination in Language Models

  12. Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

    May 19, 2026Yi Zhong, Haotong Qin, Xindong Zhang +2Vision-Language ModelsVLM Quantization

  13. Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding

    May 18, 2026Shravan Murlidaran, Ziqi Wen, Sana Shehabi +1Visual AttentionLarge Vision-Language Models

  14. EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

    May 15, 2026Xuanyu Ge, Zhongqi Wang, Jie Zhang +2Large Vision-Language ModelsBackdoor Detection

  15. LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

    May 15, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  16. AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

    May 15, 2026Zhiwei Li, Jiacheng Xue, Weining Wang +4VLM RobustnessAdversarial Robustness

  17. Deep Pre-Alignment for VLMs

    May 14, 2026Tianyu Yu, Kechen Fang, Zihao Wan +5Vision-Language ModelsLarge Vision-Language Models

  18. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Visual ReasoningLarge Vision-Language Models

  19. MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

    May 14, 2026Wei Ding, Yilin Li, Yudong Zhang +4Vision-Language ModelsLLM Hallucination Mitigation

  20. Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

    May 14, 2026Tian Qin, Junzhe Chen, Yuqing Shi +3Efficient VLM InferenceHallucination in Language Models

  21. CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

    May 14, 2026Ailar Mahdizadeh, Puria Azadi, Muchen Li +2Streaming Video UnderstandingKV Caching

  22. To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

    May 14, 2026Chengshuai Zhao, Zhen Tan, Dawei Li +2VLM RobustnessMultimodal Robustness

  23. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models

  24. Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models

    May 12, 2026Furkan Mumcu, Michael J. Jones, Anoop Cherian +1Large Vision-Language ModelsAnomaly Localization

  25. Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

    May 12, 2026Runhe Lai, Xinhua Lu, Yanqi Wu +3Hallucination Detection in VLMsHallucination Detection

  26. VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

    May 12, 2026Chenhao Qiu, Yechao Zhang, Xin Luo +2Large Vision-Language ModelsVideo QA