Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 50% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 248

All topics
CardsList
  1. Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

    Oct 5, 2026Suguru Onda, Matthew Bailey, Ryan FarrellVision-Language ModelsVLM Adaptation

  2. What Words Keep of a Place: Zero-Shot Language Reasoning for Cross-View Geo-Localization

    Oct 5, 2026Ayesh Abu Lehyeh, Jay Hwasung Jung, Safwan WshahCross-View Geo-LocalizationLarge Vision-Language Models

  3. Fitting Vision Adapters at Frontier Scales

    Oct 5, 2026Jaehoon Lee, Harry Partridge, Mudith Jayasekara +3Vision-Language ModelsVLM Adaptation

  4. IRSTD-Agent: Agentic Infrared Small Target Detection via Zoom-Guided Interaction Learning

    Oct 4, 2026Jiawen Xi, Yu Zhang, Tianyi Zhao +3Tool Use in VLMsInfrared Small Target Detection

  5. MoLE: Mixture of Latent Experts for Complementary Visual Reasoning

    Oct 1, 2026Yingcheng Liu, Tianyi Jiang, Yujuan Ding +5Large Vision-Language ModelsLatent Visual Reasoning

  6. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  7. Mitigating Object Hallucination in Large Vision-Language Models via False Discovery Controlled Visual Data Splitting

    Sep 30, 2026Chang Liu, Yu Tian, Rui XieFDR ControlLarge Vision-Language Models

  8. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Visual Spatial ReasoningLarge Vision-Language Models

  9. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  10. Selective Channel Restoration for Backdoored Vision-Language Models

    Sep 29, 2026Shuming Liu, Zhifang Zhang, Suqin Yuan +3VLM RobustnessLarge Vision-Language Models

  11. Are In-Context Images Worth 10 Dimensions?

    Sep 29, 2026Adhemar de Senneville, Xavier Bou, Jérémy Anger +2Vision-Language ModelsMultimodal ICL

  12. TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning

    Sep 29, 2026Jing Wang, Zhiping Wu, Dongdong Ren +3Efficient VLM InferenceLarge Vision-Language Models

  13. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Vision-Language ModelsEfficient VLM Inference

  14. DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

    Sep 29, 2026Jae-Ho Lee, Jeong-Eun Lee, Gyeong-Moon ParkVision-Language ModelsLarge Vision-Language Models

  15. Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

    Sep 28, 2026Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren +3Vision Foundation ModelsLarge Vision-Language Models

  16. ReSight-SMC: Two-Stage Power Sampling via Island SMC with Visual Scouts

    Sep 28, 2026Yaowen Zhang, Xiangyu Qiu, Junyi Hu +5Markov Chain Monte CarloLarge Vision-Language Models

  17. Beyond Reconstruction Loss in Post-Training Quantization: Balanced Fitting for Large Vision-Language Models

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seungyeon Sa +3VLM QuantizationLarge Vision-Language Models

  18. Long Time No See: Benchmarking VLMs for Out-of-Sight Spatiotemporal Reasoning in Egocentric Videos

    Sep 28, 2026Fangzhou Ma, Ivo Alexander Ban, Eren Homburg +5Temporal Video GroundingVisual Spatial Reasoning

  19. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Sep 28, 2026Xi Xiao, Tianchen Zhao, Youngeun Kim +10Large Vision-Language ModelsLatent Visual Reasoning

  20. ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs

    Sep 28, 2026Xu Li, Yuxuan Liang, Yi Zheng +6Efficient VLM InferenceLarge Vision-Language Models

  21. Distilling Visual Reasoning into Text Space

    Sep 28, 2026Wenhan Yang, Nilay Naharas, Ali Payani +1CoT DistillationVLM Distillation

  22. MaLiang-Harness: A Programmable Path to Image and Video Generation

    Sep 28, 2026Haoyu Zhao, Zihao Zhang, Xudong Wang +4Image GenerationLarge Vision-Language Models

  23. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  24. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4VLM QuantizationLarge Vision-Language Models

  25. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  26. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  27. IMFD: End-to-end Multi-Face Forgery Detection through Instruction-based Large Vision-Language Models

    Sep 17, 2026Dasom Choi, Sangjun Moon, Hyeongchan Im +5Image Forgery DetectionLarge Vision-Language Models

  28. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2VLM EvaluationLarge Vision-Language Models

  29. Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs

    Sep 9, 2026Haiji Liang, Pengfei Zhou, Zhenglin Wan +3Efficient VLM InferenceLarge Vision-Language Models

  30. SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

    Sep 3, 2026Caoyuan Ma, Tian Gu, Wenpu Liu +11Vision-Language ModelsLarge Vision-Language Models

  31. Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification

    Sep 2, 2026Xuanbing Wen, Boxu Chen, Le Yang +4Hallucination Detection in VLMsHallucination Detection

  32. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals

    Sep 1, 2026Md. Atabuzzaman, Christian Alexander, Chris ThomasVLM EvaluationLarge Vision-Language Models

  33. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

    Aug 31, 2026Yue Zhou, Yuan Wu, Yi ChangVLM EvaluationLarge Vision-Language Models

  34. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Aug 31, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1Hallucination Detection in VLMsVLM Hallucination

  35. Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

    Aug 30, 2026Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3VLM EvaluationVLM Unlearning

  36. RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

    Aug 30, 2026Shanqing Xu, Meng Luo, Mengchen Qian +7Large Vision-Language ModelsLong-Video Understanding

  37. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization

    Aug 30, 2026Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2VLM RobustnessVision-Language Models

  38. Multi-Image Visual Token Pruning in Large Visual Language Models

    Aug 27, 2026Rongyang Zhang, Chengqiang Lu, Cong Li +9Efficient VLM InferenceLarge Vision-Language Models

  39. When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

    Aug 25, 2026Zhengxiang Wang, Owen RambowVLM EvaluationLarge Vision-Language Models

  40. Test-Time Hallucination Control in Large Vision-Language Models

    Aug 11, 2026Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian +3Test-Time Adaptation of VLMsLarge Vision-Language Models

  41. Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

    Aug 11, 2026Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli +1VLM EvaluationVision-Language Models

  42. Where To Look? : Causal Tracing of Vision Encoders in VLM

    Aug 11, 2026Naren Kumar S, Tirth Bhatt, Mayank SinghLarge Vision-Language ModelsVLM Interpretability

  43. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models

  44. Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

    Aug 10, 2026Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar +2VLM DistillationLarge Vision-Language Models

  45. Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

    Aug 10, 2026Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini +4Large Vision-Language ModelsModel Editing

  46. Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

    Aug 8, 2026Ling Lin, Yang Bai, Congcong Zhu +6Visual Spatial ReasoningInference-Time Search

  47. Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

    Aug 7, 2026Zichuan Wang, Songlin Yang, Bo Peng +4Hallucination Detection in VLMsVision-Language Models

  48. RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

    Aug 7, 2026Qiyanhui Lu, Han Wu, Rongjian Xu +6Efficient VLM InferenceLarge Vision-Language Models

  49. TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

    Aug 6, 2026Yanqi Wu, Runhe Lai, Xinhua Lu +5VLM EvaluationHallucination Detection in VLMs

  50. When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

    Aug 4, 2026Ke Li, Jiayu Chen, Maoliang Li +5Efficient VLM InferenceLarge Vision-Language Models

  51. UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

    Aug 4, 2026Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia +4Hallucination Detection in VLMsVision-Language Models

  52. OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

    Aug 4, 2026Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas +6Large Vision-Language ModelsFine-Grained Image Classification