Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 248

All topics
CardsList
  1. TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

    Aug 6, 2026Yanqi Wu, Runhe Lai, Xinhua Lu +5VLM EvaluationHallucination Detection in VLMs

  2. When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

    Aug 4, 2026Ke Li, Jiayu Chen, Maoliang Li +5Efficient VLM InferenceLarge Vision-Language Models

  3. UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

    Aug 4, 2026Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia +4Hallucination Detection in VLMsVision-Language Models

  4. OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

    Aug 4, 2026Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas +6Large Vision-Language ModelsFine-Grained Image Classification

  5. Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

    Aug 4, 2026Tianbao Jiang, Weicong Ni, Gerard de Melo +1Large Vision-Language ModelsVLM Reasoning

  6. Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Pruning

    Aug 4, 2026Yuyao Sun, Tao Deng, Shuang Li +3Visual AttentionEfficient VLM Inference

  7. Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

    Aug 3, 2026Xiaohao Yang, Aohua Tian, Derek Van Berkel +2VLM EvaluationVision-Language Models

  8. CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

    Aug 3, 2026Yu Chen, Xiaohong Li, Xiaole Wang +3Efficient VLM InferenceLarge Vision-Language Models

  9. Coverage-Driven Adaptive Keyframe Selection for Video Understanding

    Aug 1, 2026Junyang Zhang, Puhan Luo, Chen Tang +2Efficient VLM InferenceLarge Vision-Language Models

  10. VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

    Jul 30, 2026Haiyue Zhang, Yi Bin, Xun Jiang +5Large Vision-Language ModelsLong-Video Understanding

  11. One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

    Jul 30, 2026Rui Tang, Wentao Yang, Peirong Zhang +4Visual TokenizationScene Text Recognition

  12. RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

    Jul 30, 2026Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou +4Image GenerationLarge Vision-Language Models

  13. Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

    Jul 29, 2026Hao Tan, Jun Lan, Zichang Tan +7VLM DistillationLarge Vision-Language Models

  14. Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

    Jul 29, 2026Mingkuan Feng, Zhengqi Wen, Jianhua TaoVLM AdaptationLarge Vision-Language Models

  15. GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

    Jul 27, 2026Jun Ling, Tao Huang, Junzhuo Liu +2Efficient VLM InferenceLarge Vision-Language Models

  16. Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

    Jul 25, 2026Jouwon Song, Woohyeong Kim, Kyeongbo KongEfficient VLM InferenceLarge Vision-Language Models

  17. GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

    Jul 23, 2026Yimin Fu, Yuefeng Bai, Baicheng Pan +2Remote Sensing Image UnderstandingAdversarial Attacks on VLMs

  18. Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

    Jul 22, 2026Huafu Li, Guo Chen, Jia Xia +5Large Vision-Language ModelsDocument Image Understanding

  19. Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

    Jul 18, 2026Pengxu Chen, Yao Zhu, Guangming Zhu +4Large Vision-Language ModelsVLM Hallucination Mitigation

  20. More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

    Jul 17, 2026Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi +2Remote Sensing Image UnderstandingRemote Sensing VQA

  21. GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

    Jul 17, 2026Yujie Li, Jiancheng Pan, Zhiwei Wei +3Spatiotemporal ReasoningGeospatial Representation Learning

  22. VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

    Jul 16, 2026Yunfeng Liu, Yuandong Yang, Jiarui Han +5VLM EvaluationVideo Understanding

  23. VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

    Jul 14, 2026Yupeng Zheng, Kai Zou, Bin Liu +1Efficient VLM InferenceLarge Vision-Language Models

  24. Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

    Jul 14, 2026Yifan Lu, Ziqi Zhang, Chunfeng Yuan +3Large Vision-Language ModelsVideo Frame Selection

  25. Mixture of Cognitive Experts in Large Vision-Language Models

    Jul 12, 2026Robert Wijaya, Ngai-Man CheungVision-Language ModelsLarge Vision-Language Models

  26. SigLIP-HD by Fine-to-Coarse Supervision

    Jul 10, 2026Lihe Yang, Zhen Zhao, Hengshuang ZhaoEfficient VLM InferenceLarge Vision-Language Models

  27. InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models

    Jul 8, 2026Xin Li, Jiaju Han, Ma Yaqi +5VLM RobustnessAdversarial Patch Attacks

  28. AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

    Jul 7, 2026Younggun Kim, Taeheon Kim, Youngseo Kim +1VLM RobustnessEfficient VLM Inference

  29. Foundation Models for Automatic CAD Generation

    Jul 6, 2026J de Curtò, Victoria Guillén, I. de ZarzàParametric CAD ModelingLarge Vision-Language Models

  30. Repurposing CLIP to Localize at Pixel Level

    Jul 6, 2026Jiaxiang Fang, Shiqiang Ma, Jing Wang +3Large Vision-Language ModelsOpen-Vocabulary Semantic Segmentation

  31. SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

    Jul 5, 2026Kai Tang, Jinhao You, Bohua Zhang +6Large Vision-Language ModelsObject Hallucination in VLMs

  32. HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

    Jul 5, 2026Yinsheng Yao, Yan Liu, Chen YeVLM EvaluationLarge Vision-Language Models

  33. BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

    Jul 3, 2026Geng Li, Yuxin PengLarge Vision-Language ModelsVisual Search

  34. Overloading Large Vision-Language Models for Jailbreaking

    Jul 3, 2026Haoyu Zhang, Yangyang Guo, Mohan KankanhalliVLM RobustnessAdversarial Attacks on VLMs

  35. Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

    Jul 2, 2026Zikai Zhang, Rui Hu, Olivera Kotevska +1Adversarial Attacks on VLMsLarge Vision-Language Models

  36. Towards Robustness against Typographic Attack with Training-free Concept Localization

    Jul 2, 2026Bohan Liu, Wenqian Ye, Guangzhi Xiong +3VLM RobustnessAdversarial Attacks on VLMs

  37. SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

    Jul 2, 2026Qi Lyu, Jiahua Dong, Baichen Liu +7Model CompressionVision-Language Models

  38. Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

    Jul 1, 2026Ziyu Ma, Shidong Yang, Yuxiang Ji +5Large Vision-Language ModelsFine-Grained Visual Perception

  39. Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

    Jun 30, 2026Ziqi Li, Zijian Chen, Tingzhu Chen +1VLM EvaluationDocument Understanding

  40. SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

    Jun 29, 2026Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen +1VLM EvaluationLarge Vision-Language Models

  41. One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

    Jun 29, 2026Chen Liu, Ling Chen, Hanzhang Zhou +5Efficient Multimodal InferenceGUI Grounding

  42. See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

    Jun 29, 2026Yuqing Lei, Wenbo Lyu, Yingjun Du +3Visual AttentionLarge Vision-Language Models

  43. MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

    Jun 28, 2026Hong-Han Wang, Yuntao Wang, Hu DingLarge Vision-Language ModelsVLM Reasoning

  44. FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

    Jun 28, 2026Yichen Guo, Kai Tang, Fenglai Lin +5Vision-Language ModelsLarge Vision-Language Models

  45. On Test-Time Scaling for Vision-Language Models

    Jun 27, 2026Fawaz Sammani, Tzoulio Chamiti, Nikos DeligiannisVLM EvaluationTest-Time Scaling for VLMs

  46. DataComp-VLM: Improved Open Datasets for Vision-Language Models

    Jun 26, 2026Matteo Farina, Vishaal Udandarao, Thao Nguyen +33VLM EvaluationTraining Data Curation

  47. GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models

    Jun 24, 2026Chaoxiang Cai, Minghe Weng, Jie Li +4Efficient VLM InferenceLarge Vision-Language Models

  48. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Efficient Multimodal InferenceLarge Vision-Language Models

  49. An LMM for Precisely Grounding Elements in Documents

    Jun 23, 2026Yijian Lu, Chuangxin Zhao, Kai Sun +3Visual ReasoningLarge Vision-Language Models

  50. MMGist: A Comprehensive Multimodal Benchmark for 2027

    Jun 21, 2026Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong +3VLM EvaluationLarge Vision-Language Models

  51. The Hidden Evolution of Disguised Visual Context inside the VLM

    Jun 18, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Vision-Language ModelsLarge Vision-Language Models