Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 253

All topics
CardsList
  1. Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

    Apr 22, 2026Xingyu Zhu, Junfeng Fang, Shuo Wang +4Vision-Language ModelsVLM Adaptation

  2. Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

    Apr 21, 2026Chuou Xu, Liya Ji, Qifeng ChenLarge Vision-Language ModelsVLM Reasoning

  3. VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

    Apr 21, 2026Yanbin Huang, Yisen Li, Guiyao Tie +6Large Vision-Language ModelsObject Hallucination in VLMs

  4. ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

    Apr 21, 2026Lin Sha, Haiyun Guo, Tao Wang +4VLMs for Autonomous DrivingEfficient VLM Inference

  5. DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

    Apr 20, 2026Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao +3Cross-Modal LearningVisual Question Answering

  6. Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

    Apr 17, 2026Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem +1VLM EvaluationLarge Vision-Language Models

  7. HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

    Apr 17, 2026Yanbin Wei, Chun Kang, Siwei Li +11VLM EvaluationLarge Vision-Language Models

  8. How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study

    Apr 16, 2026Zhen Yang, Ping Jian, Zhongbin Guo +5Visual Spatial ReasoningLarge Vision-Language Models

  9. When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

    Apr 1, 2026Jiho Choi, Jaemin Kim, Sanghwan Kim +2Large Vision-Language ModelsVLM Interpretability

  10. GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

    Mar 26, 2026Xuran Hu, Zhitong Xiong, Zhongcheng Hong +3Remote Sensing Image UnderstandingLarge Vision-Language Models

  11. Revealing Multi-View Hallucination in Large Vision-Language Models

    Mar 25, 2026Wooje Park, Insu Lee, Soohyun Kim +4Visual Question AnsweringHallucination in Language Models

  12. DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

    Mar 24, 2026Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov +3Large Vision-Language ModelsFew-Shot Object Detection

  13. Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

    Mar 13, 2026Xiangkui Cao, Jie Zhang, Meina Kan +2Large Vision-Language ModelsPrivacy Protection in VLMs

  14. AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models

    Feb 10, 2026Yue Li, Xin Yi, Dongsheng Shi +3Large Vision-Language ModelsRobust Watermarking

  15. SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

    Feb 6, 2026Niccolo Avogaro, Nayanika Debnath, Li Mi +6Visual Question AnsweringEfficient VLM Inference

  16. A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

    Jan 30, 2026Ji Zhou, Yilin Ding, Yongqi Zhao +4VLM EvaluationLarge Vision-Language Models

  17. R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

    Jan 25, 2026Zhuohong Chen, Zhengxian Wu, Zirui Liao +6Multimodal RAGVisual Question Answering

  18. From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

    Jan 15, 2026Cheng Chen, Yuyu Guo, Pengpeng Zeng +4Vision-Language ModelsVLM Adaptation

  19. From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

    Dec 17, 2025Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont +2VLM AdaptationMultispectral Object Detection

  20. Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

    Dec 16, 2025Joseph Hoche, Andrei Bursuc, David Brellmann +4Vision-Language ModelsUncertainty Quantification

  21. Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

    Dec 11, 2025Duo Zheng, Shijia Huang, Yanyang Li +1KV CachingEfficient VLM Inference

  22. Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors

    Dec 10, 2025Tian Liu, Anwesha Basu, James Caverlee +1Large Vision-Language ModelsMultimodal Large Language Models

  23. From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

    Nov 14, 2025Yu Zhao, Ying Zhang, Xuhui Sui +4Visual Question AnsweringCoT Distillation

  24. GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

    Nov 2, 2025Shijie Zhou, Viet Dac Lai, Hao Tan +4Multimodal GroundingGUI Grounding

  25. Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM

    Oct 7, 2025Ryan Solgi, Parsa Madinei, Jiayi Tian +4Model CompressionLLM Compression

  26. VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

    Sep 29, 2025Ravikumar Balakrishnan, Mansi PhuteLanguage Model SteeringLarge Vision-Language Models