Vision-Language Models

Also known as VLM

Latest papers 480

All topics
CardsList
  1. Low-Rank Prompt Learning for Vision-Language Models with Fixed-Token Bases

    Sep 8, 2026Tanvir Muntakim Tonoy, Sajjad Ghiasvand, Mahnoosh Alizadeh +1Vision-Language ModelsPrompt Learning

  2. Layer Selection in VLMs for Zero-Shot OOD Detection via Multi-Resolution Entropy Estimation

    Sep 8, 2026Shyam Nandan Rai, Francesco Di Salvo, Sebastian Doerrich +1Vision-Language ModelsMedical VLMs

  3. SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

    Sep 3, 2026Caoyuan Ma, Tian Gu, Wenpu Liu +11Vision-Language ModelsLarge Vision-Language Models

  4. Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment

    Sep 2, 2026Zihao Wang, Xi Xiang, Yuwen Sun +5Vision-Language ModelsMultimodal Model Evaluation

  5. TrajMind: Chaining Role-Specialized LoRAs for Fast-and-Slow Collective Trajectory Anomaly Diagnosis

    Sep 2, 2026Jiahao Wu, Zhenqun Yang, Chen Jason Zhang +1Anomaly DetectionAgent Trajectory Analysis

  6. EdiTikZ: Scientific Figure Editing from Revision Trajectories

    Sep 1, 2026Christian Greisinger, Zhixue Zhao, Steffen EgerVision-Language Models

  7. Reliability Challenges in Diffusion Vision-Language Models

    Sep 1, 2026Md. Atabuzzaman, Chris ThomasVLM EvaluationVLM Robustness

  8. Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis

    Sep 1, 2026Minsik Choi, Geewook Kim, Young Geun KimVision-Language ModelsVLM Adaptation

  9. (V)LMs generalize beyond surface co-occurrence: Evidence from cross-modal number agreement

    Aug 31, 2026Zach Studdiford, Kanishka MisraVision-Language Models

  10. Frontier vision-language models have overtaken young adults at detecting AI-generated portraits -- but not their calibration

    Aug 31, 2026Sunwhi Kim, Sunyul Kim, Meounggun Jo +1VLM EvaluationVision-Language Models

  11. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization

    Aug 30, 2026Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2VLM RobustnessVision-Language Models

  12. Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

    Aug 26, 2026Luca Bux, Thiago Rios, Ingo Scholtes +2VLM EvaluationVision-Language Models

  13. CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

    Aug 19, 2026Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe +4Vision-Language ModelsVision-Language Alignment

  14. TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

    Aug 13, 2026Fnu Pramono, John Cai, Sourabh KulkarniVLM EvaluationVision-Language Models

  15. Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

    Aug 13, 2026Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo +5Vision-Language ModelsMultimodal Reranking

  16. Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

    Aug 13, 2026Junyi Hu, Tian Bai, Fengyi Wu +7Vision-Language ModelsVision-Language Grounding

  17. Click2Poly: A VLM for vector mapping buildings and walls

    Aug 11, 2026Nicolas Girard, Jawher Ben Abdallah, Arno Gobbin +2Vision-Language ModelsBuilding Footprint Extraction

  18. Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

    Aug 11, 2026Tao Lin, Gaojie Jin, Zongxin Liu +2Adversarial Attacks on VLMsVision-Language Models

  19. Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

    Aug 11, 2026Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli +1VLM EvaluationVision-Language Models

  20. MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

    Aug 11, 2026Shuai Wang, Wangyuan Ding, Yixian Shen +5Image CaptioningVision-Language Models

  21. Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

    Aug 11, 2026Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3Memory-Augmented VLMsVision-Language Models

  22. GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

    Aug 10, 2026Jiahui Cui, Yan Zhao, Kan Wei +4Vision-Language ModelsFine-Grained Image Retrieval

  23. TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

    Aug 9, 2026Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da QuachVision-Language ModelsPlant Disease Classification

  24. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Vision-Language ModelsEfficient VLM Inference