Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 253

All topics
CardsList
  1. Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions

    Oct 7, 2026Bojun Yang, Haochen Zhou, Zhifang Zhang +3VLM RobustnessLarge Vision-Language Models

  2. Mixture of Layers: Dynamic Layer Routing for Visual Reasoning

    Oct 7, 2026Jeonghwan Kim, Sofia Stoica, Jiwan Chung +5VLM ReasoningLarge Vision-Language Models

  3. Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

    Oct 5, 2026Suguru Onda, Matthew Bailey, Ryan FarrellVision-Language ModelsVLM Adaptation

  4. What Words Keep of a Place: Zero-Shot Language Reasoning for Cross-View Geo-Localization

    Oct 5, 2026Ayesh Abu Lehyeh, Jay Hwasung Jung, Safwan WshahCross-View Geo-LocalizationLarge Vision-Language Models

  5. Fitting Vision Adapters at Frontier Scales

    Oct 5, 2026Jaehoon Lee, Harry Partridge, Mudith Jayasekara +3Vision-Language ModelsVLM Adaptation

  6. IRSTD-Agent: Agentic Infrared Small Target Detection via Zoom-Guided Interaction Learning

    Oct 4, 2026Jiawen Xi, Yu Zhang, Tianyi Zhao +3Tool Use in VLMsInfrared Small Target Detection

  7. MoLE: Mixture of Latent Experts for Complementary Visual Reasoning

    Oct 1, 2026Yingcheng Liu, Tianyi Jiang, Yujuan Ding +5Large Vision-Language ModelsLatent Visual Reasoning

  8. VETO: Video Efficient Token Optimization for Vision Language Models

    Oct 1, 2026Gueter Josmy Faure, Hao Ping Wang, Min-Hung Chen +1Efficient VLM InferenceLarge Vision-Language Models

  9. Mitigating Object Hallucination in Large Vision-Language Models via False Discovery Controlled Visual Data Splitting

    Sep 30, 2026Chang Liu, Yu Tian, Rui XieFDR ControlLarge Vision-Language Models

  10. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Visual Spatial ReasoningLarge Vision-Language Models

  11. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  12. Selective Channel Restoration for Backdoored Vision-Language Models

    Sep 29, 2026Shuming Liu, Zhifang Zhang, Suqin Yuan +3VLM RobustnessLarge Vision-Language Models

  13. Are In-Context Images Worth 10 Dimensions?

    Sep 29, 2026Adhemar de Senneville, Xavier Bou, Jérémy Anger +2Vision-Language ModelsMultimodal ICL

  14. TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning

    Sep 29, 2026Jing Wang, Zhiping Wu, Dongdong Ren +3Efficient VLM InferenceLarge Vision-Language Models

  15. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Vision-Language ModelsEfficient VLM Inference

  16. DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

    Sep 29, 2026Jae-Ho Lee, Jeong-Eun Lee, Gyeong-Moon ParkVision-Language ModelsLarge Vision-Language Models

  17. Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

    Sep 28, 2026Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren +3Vision Foundation ModelsLarge Vision-Language Models

  18. ReSight-SMC: Two-Stage Power Sampling via Island SMC with Visual Scouts

    Sep 28, 2026Yaowen Zhang, Xiangyu Qiu, Junyi Hu +5Markov Chain Monte CarloLarge Vision-Language Models

  19. Beyond Reconstruction Loss in Post-Training Quantization: Balanced Fitting for Large Vision-Language Models

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seungyeon Sa +3VLM QuantizationLarge Vision-Language Models

  20. Long Time No See: Benchmarking VLMs for Out-of-Sight Spatiotemporal Reasoning in Egocentric Videos

    Sep 28, 2026Fangzhou Ma, Ivo Alexander Ban, Eren Homburg +5Temporal Video GroundingVisual Spatial Reasoning

  21. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Sep 28, 2026Xi Xiao, Tianchen Zhao, Youngeun Kim +10Large Vision-Language ModelsLatent Visual Reasoning

  22. ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs

    Sep 28, 2026Xu Li, Yuxuan Liang, Yi Zheng +6Efficient VLM InferenceLarge Vision-Language Models

  23. Distilling Visual Reasoning into Text Space

    Sep 28, 2026Wenhan Yang, Nilay Naharas, Ali Payani +1CoT DistillationVLM Distillation

  24. MaLiang-Harness: A Programmable Path to Image and Video Generation

    Sep 28, 2026Haoyu Zhao, Zihao Zhang, Xudong Wang +4Image GenerationLarge Vision-Language Models

  25. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  26. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4VLM QuantizationLarge Vision-Language Models

  27. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models