Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 253

All topics
CardsList
  1. Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement

    May 12, 2026Zhenxin Qin, Qiang Li, Qingzhuo Wang +3VLM RobustnessVLM Hallucination

  2. Allegory of the Cave: Measurement-Grounded Vision-Language Learning

    May 12, 2026Kepeng Xu, Li Xu, Gang He +1Large Vision-Language ModelsVision-Language Grounding

  3. Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition

    May 11, 2026David F. Ramirez, Tim L. Overman, Kristen Jaskie +2Remote Sensing Image UnderstandingRemote Sensing VQA

  4. Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

    May 11, 2026Yangneng Chen, Junlin Li, Weijun Yao +4Hallucination in Language ModelsVLM Hallucination

  5. V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

    May 11, 2026Zhiwei Ning, Xuanang Gao, Jiaxi Cao +6Large Vision-Language ModelsMultimodal Reasoning

  6. ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

    May 11, 2026Yuna Lee, Kyoungho Min, Yulhwa KimEfficient VLM InferenceLarge Vision-Language Models

  7. How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

    May 9, 2026YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7Efficient VLM InferenceLarge Vision-Language Models

  8. Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

    May 8, 2026Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan +1Remote Sensing Image UnderstandingLarge Vision-Language Models

  9. Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models

    May 8, 2026Berkehan Ünal, Hauke Dierend, Dren Fazlija +1Zero-Shot LearningLarge Vision-Language Models

  10. LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

    May 8, 2026Jun Wang, Fengpeng Li, Hang Dong +2Remote Sensing Image UnderstandingLarge Vision-Language Models

  11. Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

    May 7, 2026Ying Gu, Mei Chee Leong, Hui Li Tan +3VLM EvaluationLarge Vision-Language Models

  12. Large Vision-Language Models Get Lost in Attention

    May 7, 2026Gongli Xi, Ye Tian, Mengyu Yang +5Transformer FFNsVision-Language Models

  13. DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring

    May 6, 2026Anju Rani, Daniel Ortiz-Arroyo, Petar DurdevicJoint-Embedding Predictive ArchitectureLarge Vision-Language Models

  14. CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

    May 6, 2026Qiming Li, Zekai Ye, Xiaocheng Feng +9Hallucination in Language ModelsLarge Vision-Language Models

  15. Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks

    May 5, 2026JuneHyoung Kwon, MiHyeon Kim, Eunju Lee +3VLM EvaluationVLM Unlearning

  16. VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

    May 3, 2026Jingheng Pan, Xintong Wang, Longyue Wang +3Large Vision-Language ModelsMultimodal Model Evaluation

  17. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Memory-Augmented VLMsVLM Robustness

  18. Make Your LVLM KV Cache More Lightweight

    May 1, 2026Xihao Chen, Yangyang Guo, Roger ZimmermannKV CachingEfficient VLM Inference

  19. Online Self-Calibration Against Hallucination in Vision-Language Models

    May 1, 2026Minghui Chen, Chenxu Yang, Hengjie Zhu +3Vision-Language ModelsHallucination in Language Models

  20. Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

    Apr 30, 2026Xiaomeng Wang, Martha Larson, Zhengyu ZhaoVLM EvaluationVision-Language Models

  21. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

    Apr 28, 2026Chengsheng Zhang, Chenghao Sun, Xinyan Jiang +2Vision-Language ModelsHallucination in Language Models

  22. Dynamic Decision Learning: Test-Time Evolution for Abnormality Grounding in Rare Diseases

    Apr 27, 2026Jun Li, Mingxuan Liu, Jiazhen Pan +4Medical ImagingTest-Time Adaptation

  23. Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

    Apr 27, 2026Yiran Huang, Lukas Thede, Massimiliano Mancini +2Large Vision-Language ModelsStructured Pruning

  24. Evian: Towards Explainable Visual Instruction-tuning Data Auditing

    Apr 22, 2026Zimu Jia, Mingjie Xu, Andrew Estornell +1Large Vision-Language ModelsMultimodal Instruction Tuning

  25. Evaluating Remote Sensing Image Captions Beyond Metric Biases

    Apr 22, 2026Ziyun Chen, Fan Liu, Liang Yao +3VLM EvaluationRemote Sensing Image Understanding

  26. Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

    Apr 22, 2026Xingyu Zhu, Junfeng Fang, Shuo Wang +4Vision-Language ModelsVLM Adaptation

  27. Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

    Apr 21, 2026Chuou Xu, Liya Ji, Qifeng ChenLarge Vision-Language ModelsVLM Reasoning

  28. VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

    Apr 21, 2026Yanbin Huang, Yisen Li, Guiyao Tie +6Large Vision-Language ModelsObject Hallucination in VLMs

  29. ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

    Apr 21, 2026Lin Sha, Haiyun Guo, Tao Wang +4VLMs for Autonomous DrivingEfficient VLM Inference

  30. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  31. Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

    Apr 17, 2026Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem +1VLM EvaluationLarge Vision-Language Models

  32. HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

    Apr 17, 2026Yanbin Wei, Chun Kang, Siwei Li +11VLM EvaluationLarge Vision-Language Models

  33. How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study

    Apr 16, 2026Zhen Yang, Ping Jian, Zhongbin Guo +5Visual Spatial ReasoningLarge Vision-Language Models

  34. When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

    Apr 1, 2026Jiho Choi, Jaemin Kim, Sanghwan Kim +2Large Vision-Language ModelsVLM Interpretability

  35. GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

    Mar 26, 2026Xuran Hu, Zhitong Xiong, Zhongcheng Hong +3Remote Sensing Image UnderstandingLarge Vision-Language Models

  36. Revealing Multi-View Hallucination in Large Vision-Language Models

    Mar 25, 2026Wooje Park, Insu Lee, Soohyun Kim +4Visual Question AnsweringHallucination in Language Models

  37. DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

    Mar 24, 2026Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov +3Large Vision-Language ModelsFew-Shot Object Detection

  38. Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

    Mar 13, 2026Xiangkui Cao, Jie Zhang, Meina Kan +2Large Vision-Language ModelsPrivacy Protection in VLMs

  39. AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models

    Feb 10, 2026Yue Li, Xin Yi, Dongsheng Shi +3Large Vision-Language ModelsRobust Watermarking

  40. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Feb 6, 2026Niccolo Avogaro, Nayanika Debnath, Li Mi +6Visual Question AnsweringEfficient VLM Inference

  41. A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

    Jan 30, 2026Ji Zhou, Yilin Ding, Yongqi Zhao +4VLM EvaluationLarge Vision-Language Models

  42. R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

    Jan 25, 2026Zhuohong Chen, Zhengxian Wu, Zirui Liao +6Multimodal RAGVisual Question Answering

  43. From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

    Jan 15, 2026Cheng Chen, Yuyu Guo, Pengpeng Zeng +4Vision-Language ModelsVLM Adaptation

  44. From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

    Dec 17, 2025Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont +2VLM AdaptationMultispectral Object Detection

  45. Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

    Dec 16, 2025Joseph Hoche, Andrei Bursuc, David Brellmann +4Vision-Language ModelsUncertainty Quantification

  46. Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

    Dec 11, 2025Duo Zheng, Shijia Huang, Yanyang Li +1KV CachingEfficient VLM Inference

  47. Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors

    Dec 10, 2025Tian Liu, Anwesha Basu, James Caverlee +1Large Vision-Language ModelsMultimodal Large Language Models

  48. From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

    Nov 14, 2025Yu Zhao, Ying Zhang, Xuhui Sui +4Visual Question AnsweringCoT Distillation

  49. GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

    Nov 2, 2025Shijie Zhou, Viet Dac Lai, Hao Tan +4Multimodal GroundingGUI Grounding

  50. Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM

    Oct 7, 2025Ryan Solgi, Parsa Madinei, Jiayi Tian +4Model CompressionLLM Compression

  51. VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

    Sep 29, 2025Ravikumar Balakrishnan, Mansi PhuteLanguage Model SteeringLarge Vision-Language Models