Large Vision-Language Models

Also known as LVLM

Momentum

30 papers in the last four weeks, up 36% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 256

All topics
CardsList
  1. Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

    Sep 26, 2026Junxian Li, Ruixuan Yang, Tianao Zhang +3Efficient VLM InferenceVLM Distillation

  2. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4VLM QuantizationLarge Vision-Language Models

  3. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuEfficient VLM InferenceLarge Vision-Language Models

  4. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  5. IMFD: End-to-end Multi-Face Forgery Detection through Instruction-based Large Vision-Language Models

    Sep 17, 2026Dasom Choi, Sangjun Moon, Hyeongchan Im +5Image Forgery DetectionLarge Vision-Language Models

  6. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2VLM EvaluationLarge Vision-Language Models

  7. Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs

    Sep 9, 2026Haiji Liang, Pengfei Zhou, Zhenglin Wan +3Efficient VLM InferenceLarge Vision-Language Models

  8. SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

    Sep 3, 2026Caoyuan Ma, Tian Gu, Wenpu Liu +11Vision-Language ModelsLarge Vision-Language Models

  9. RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models

    Sep 2, 2026Canjie Liu, Jiawen Kang, Jinbo Wen +1Hallucination MitigationLarge Vision-Language Models

  10. Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification

    Sep 2, 2026Xuanbing Wen, Boxu Chen, Le Yang +4Hallucination Detection in VLMsHallucination Detection

  11. IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals

    Sep 1, 2026Md. Atabuzzaman, Christian Alexander, Chris ThomasVLM EvaluationLarge Vision-Language Models

  12. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

    Aug 31, 2026Yue Zhou, Yuan Wu, Yi ChangVLM EvaluationLarge Vision-Language Models

  13. VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

    Aug 31, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +1Hallucination Detection in VLMsVLM Hallucination

  14. Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

    Aug 30, 2026Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan +3VLM EvaluationVLM Unlearning

  15. RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

    Aug 30, 2026Shanqing Xu, Meng Luo, Mengchen Qian +7Large Vision-Language ModelsLong-Video Understanding

  16. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization

    Aug 30, 2026Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2VLM RobustnessVision-Language Models

  17. Multi-Image Visual Token Pruning in Large Visual Language Models

    Aug 27, 2026Rongyang Zhang, Chengqiang Lu, Cong Li +9Efficient VLM InferenceLarge Vision-Language Models

  18. When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

    Aug 25, 2026Zhengxiang Wang, Owen RambowVLM EvaluationLarge Vision-Language Models

  19. Test-Time Hallucination Control in Large Vision-Language Models

    Aug 11, 2026Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian +3Test-Time Adaptation of VLMsLarge Vision-Language Models

  20. Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

    Aug 11, 2026Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli +1VLM EvaluationVision-Language Models

  21. Where To Look? : Causal Tracing of Vision Encoders in VLM

    Aug 11, 2026Naren Kumar S, Tirth Bhatt, Mayank SinghLarge Vision-Language ModelsVLM Interpretability

  22. When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

    Aug 11, 2026Congyang Ou, Ruike Song, Yang Zhou +3Efficient VLM InferenceLarge Vision-Language Models

  23. Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

    Aug 10, 2026Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar +2VLM DistillationLarge Vision-Language Models

  24. Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

    Aug 10, 2026Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini +4Large Vision-Language ModelsModel Editing