Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 248

All topics
CardsList
  1. AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

    Jun 17, 2026Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz +8Vision-Language ModelsLarge Vision-Language Models

  2. Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

    Jun 15, 2026Yifan Wang, Peiming Li, Shiyu Li +5Efficient VLM InferenceLarge Vision-Language Models

  3. Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

    Jun 13, 2026Marta Vallejo, Siwen WangVLM EvaluationLarge Vision-Language Models

  4. One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

    Jun 12, 2026Yongru Chen, Kai Zhang, Zeliang Zong +4Efficient VLM InferenceLarge Vision-Language Models

  5. ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

    Jun 10, 2026Jiangtao Kong, Peijun Zhao, Chun-Fu Chen +4Large Vision-Language ModelsIncremental Learning

  6. The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

    Jun 5, 2026Lujun Li, Lama Sleem, Niccolo Gentile +4VLM EvaluationLarge Vision-Language Models

  7. Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

    Jun 5, 2026Shizhe Xiang, Ke An, Wenlong Yu +4Large Vision-Language ModelsMultimodal Reasoning

  8. Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

    Jun 4, 2026Haocheng Luo, Jiahui Liu, Ruicheng Zhang +6Cross-Modal Knowledge DistillationVisual Spatial Reasoning

  9. Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

    Jun 4, 2026Tianxiang Jiang, Linquan Wu, Sheng Xia +5Large Vision-Language ModelsLatent Visual Reasoning

  10. Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

    Jun 2, 2026Wei Ding, Yudong Zhang, Ruobing Xie +3VLM EvaluationVision-Language Models

  11. Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation

    Jun 2, 2026Ruipeng Zhang, Zhihao Li, C. L. Philip Chen +1VLM HallucinationLarge Vision-Language Models

  12. BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

    Jun 1, 2026Ivan Sabolić, Marin Oršić, Josip Šarić +1Supervised Fine-TuningVLM Robustness

  13. ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

    Jun 1, 2026Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang +1Large Vision-Language ModelsAdapter Tuning

  14. EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

    Jun 1, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  15. Self-Improving Small Object Grounding in LVLMs

    Jun 1, 2026Tianze Yang, Yucheng Shi, Ruitong Sun +2Large Vision-Language ModelsVLM Interpretability

  16. An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

    May 31, 2026Bingyu Li, Da Zhang, Tao Huo +3Large Vision-Language ModelsReferring Image Segmentation

  17. ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

    May 30, 2026Yiling Gao, Hongchen Wei, Zhenzhong ChenEfficient VLM InferenceLarge Vision-Language Models

  18. Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

    May 29, 2026Zijie Zhou, Dandan Zhu, Hangxiangpan Wang +3Vision-Language ModelsLarge Vision-Language Models

  19. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    May 29, 2026Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3VLM EvaluationSemantic Correspondence

  20. Personalize Your Large Vision-language Models With In-context Prompt Tuning

    May 29, 2026Yanshu Li, Jiaqian Li, Kuai Yu +4Vision-Language ModelsLarge Vision-Language Models

  21. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  22. Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness

    May 29, 2026Xiang Fang, Wanlong Fang, Wei JiVLM RobustnessLarge Vision-Language Models

  23. ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

    May 28, 2026Zihu Wang, Karthik Somayaji N. S, Peng LiVisual ReasoningLarge Vision-Language Models

  24. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

    May 28, 2026Selim Kuzucu, Alessio Tonioni, Vasile Lup +3Image TokenizationEfficient VLM Inference

  25. Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

    May 28, 2026Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir SinghHallucination in Language ModelsLarge Vision-Language Models

  26. Self-Prophetic Decoding to Unlock Visual Search in LVLMs

    May 27, 2026Zhendong He, Qiyuan Dai, Guanbin Li +2Large Vision-Language ModelsVLM Reasoning

  27. Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

    May 27, 2026Yuang Huang, Yafeng Zhang, Yu ZilanVision-Language ModelsHallucination in Language Models

  28. Structure-Guided Visual Perturbation Neutralization for LVLMs

    May 27, 2026Yuanhe Zhang, Xueting Wang, YanBin Ren +6VLM RobustnessAdversarial Attacks on VLMs

  29. Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

    May 26, 2026Joseph Hoche, David Brellmann, Gianni FranchiVision-Language ModelsLarge Vision-Language Models

  30. LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

    May 25, 2026Xiang An, Yin Xie, Feilong Tang +27VLM EvaluationTemporal Video Grounding

  31. Beyond Appearance: Can Multimodal Large Language Models Exploit Vertical Structure for Remote Sensing Natural Scene Understanding?

    May 25, 2026Jing Huang, Duanchu Wang, Junjie Yang +5VLM EvaluationRemote Sensing Image Understanding

  32. Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

    May 25, 2026Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai +6Adversarial Representation LearningVision-Language Models

  33. VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

    May 23, 2026Bo Li, Ronghao Chen, Ningyuan Deng +3VLM AdaptationLarge Vision-Language Models

  34. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  35. CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

    May 22, 2026Liupeng Li, Haoqian Kang, Zhenyu Lu +4Efficient VLM InferenceLarge Vision-Language Models

  36. Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

    May 20, 2026Meng Shen, Minghao Wu, Deepu RajanVision-Language ModelsHallucination in Language Models

  37. Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

    May 20, 2026Zhe Cheng, Wenyu Chen, Fode Zhang +1VLM RobustnessHallucination in Language Models

  38. Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

    May 20, 2026Yutong Xie, Zhenglin Hua, Ran Wang +3Vision-Language ModelsHallucination in Language Models

  39. Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

    May 19, 2026Yi Zhong, Haotong Qin, Xindong Zhang +2Vision-Language ModelsVLM Quantization

  40. Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding

    May 18, 2026Shravan Murlidaran, Ziqi Wen, Sana Shehabi +1Visual AttentionLarge Vision-Language Models

  41. EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

    May 15, 2026Xuanyu Ge, Zhongqi Wang, Jie Zhang +2Large Vision-Language ModelsBackdoor Detection

  42. LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

    May 15, 2026Hongyu Lu, Feng Zhang, Wenwei Jin +5Efficient VLM InferenceLarge Vision-Language Models

  43. AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

    May 15, 2026Zhiwei Li, Jiacheng Xue, Weining Wang +4VLM RobustnessAdversarial Robustness

  44. Deep Pre-Alignment for VLMs

    May 14, 2026Tianyu Yu, Kechen Fang, Zihao Wan +5Vision-Language ModelsLarge Vision-Language Models

  45. ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

    May 14, 2026Ziyu Guo, Rain Liu, Xinyan Chen +1Visual ReasoningLarge Vision-Language Models

  46. MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

    May 14, 2026Wei Ding, Yilin Li, Yudong Zhang +4Vision-Language ModelsLLM Hallucination Mitigation

  47. Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

    May 14, 2026Tian Qin, Junzhe Chen, Yuqing Shi +3Efficient VLM InferenceHallucination in Language Models

  48. CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

    May 14, 2026Ailar Mahdizadeh, Puria Azadi, Muchen Li +2Streaming Video UnderstandingKV Caching

  49. To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

    May 14, 2026Chengshuai Zhao, Zhen Tan, Dawei Li +2VLM RobustnessMultimodal Robustness

  50. Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

    May 13, 2026Zhaowei Wang, Lishu Luo, Haodong Duan +9Visual Question AnsweringVision-Language Models

  51. Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models

    May 12, 2026Furkan Mumcu, Michael J. Jones, Anoop Cherian +1Large Vision-Language ModelsAnomaly Localization

  52. Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

    May 12, 2026Runhe Lai, Xinhua Lu, Yanqi Wu +3Hallucination Detection in VLMsHallucination Detection

  53. VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

    May 12, 2026Chenhao Qiu, Yechao Zhang, Xin Luo +2Large Vision-Language ModelsVideo QA