Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

    Jul 21, 2026Zijie Liu, Jinhao Duan, Gaowen Liu +2VLM UnlearningVision-Language Models

  2. Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

    Jul 20, 2026Yi Tang, Xinyi Shang, Jiacheng Cui +12Vision-Language ModelsImage Forgery Detection

  3. FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

    Jul 18, 2026Yi Yang, Xiaokun Zhang, Yuxuan Li +3Remote Sensing Image UnderstandingVision-Language Models

  4. Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

    Jul 17, 2026Zhengbo Zhou, Jiren Li, Dooman Arefan +2Radiology VLMsVision-Language Models

  5. Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

    Jul 17, 2026Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan +1Visual Question AnsweringVision-Language Models

  6. GeoDetect: Geometric Adversarial Detection for VLPs

    Jul 16, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +2VLM RobustnessAdversarial Attacks on VLMs

  7. SportD: How do VLMs physically strategize?

    Jul 16, 2026Jasin Cekinmez, Addison J. Wu, Haotian Xia +6VLM EvaluationVision-Language Models

  8. SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

    Jul 16, 2026Yi Wu, Junjie An, Xiao Liu +6Vision-Language ModelsEmbodied Navigation

  9. Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

    Jul 15, 2026Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang +4Vision-Language ModelsEfficient VLM Inference

  10. What Keeps Vision-Language Models Looking at the Image?

    Jul 14, 2026Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3Vision-Language ModelsVLM Interpretability

  11. MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

    Jul 14, 2026Pedro Orvalho, Guillem Alenyà, Felip ManyàVision-Language ModelsVLM Reasoning

  12. When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

    Jul 13, 2026Quynh Vo, Phuc Dao, Cong-Duy Nguyen +1Vision-Language ModelsVisual Spatial Reasoning

  13. SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

    Jul 13, 2026Mingyuan Wu, Jingcheng Yang, Shengyi Qian +11Vision-Language ModelsMultimodal Reasoning

  14. Mixture of Cognitive Experts in Large Vision-Language Models

    Jul 12, 2026Robert Wijaya, Ngai-Man CheungVision-Language ModelsLarge Vision-Language Models

  15. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Jul 11, 2026Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4VLM EvaluationVision-Language Models

  16. WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

    Jul 11, 2026Xianzhi Ma, Shujun Wang, Xiaohan Li +3Remote Sensing Image UnderstandingVision-Language Models

  17. The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

    Jul 10, 2026Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh +2Vision-Language ModelsVLM Interpretability

  18. MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

    Jul 9, 2026Hantao Zhang, Jinru Sui, Ed Li +2VLM EvaluationVision-Language Models

  19. FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

    Jul 9, 2026Xueke Zhu, Qingyan Meng, Liutao Yu +4Vision-Language ModelsUAV Navigation

  20. Dive Into the Implicit Biases of Low-rank Vision-language Alignment

    Jul 9, 2026Mingjia Shi, Shuo Wang, Xiaobo Wang +7Vision-Language ModelsLow-Rank Adaptation

  21. When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

    Jul 8, 2026Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe +2Vision-Language ModelsVLM Adaptation

  22. BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

    Jul 8, 2026Jiacheng Yang, Tongying Xiao, Yunkai Dang +7Vision-Language ModelsVLM Reasoning

  23. HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

    Jul 6, 2026Gengluo Li, Xingyu Wan, Shangpin Peng +20Vision-Language ModelsEfficient VLM Inference