Vision-Language Models

Also known as VLM

Latest papers 491

All topics
CardsList
  1. ExpertHTR: Unified Handwritten Text Recognition with Multi-Task Learning and Sparse Mixture-of-Experts

    Sep 11, 2026Dang Hoai Nam, Nguyen Duy Hieu, Quang Huu Hieu +1Vision-Language ModelsSparse Mixture-of-Experts

  2. Can Edge-Deployable Vision-Language Models Identify Species?

    Sep 10, 2026William Zhou, Mayukha Siripuram, Xiao Yan +2VLM EvaluationVLM Robustness

  3. Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

    Sep 10, 2026Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3Vision-Language Models

  4. From Pixels to Hierarchical Sequences: Quadtree Mask Encoding for Vision-Language Binary Change Detection

    Sep 9, 2026Xiao An, Ruikang Zhang, Chen Zhong +4Vision-Language ModelsRemote Sensing Change Detection

  5. Low-Rank Prompt Learning for Vision-Language Models with Fixed-Token Bases

    Sep 8, 2026Tanvir Muntakim Tonoy, Sajjad Ghiasvand, Mahnoosh Alizadeh +1Vision-Language ModelsPrompt Learning

  6. VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models

    Sep 8, 2026Zaid Pervaiz Bhat, Nimra Nayyar, Arihant Jain +6VLM EvaluationVision-Language Models

  7. Layer Selection in VLMs for Zero-Shot OOD Detection via Multi-Resolution Entropy Estimation

    Sep 8, 2026Shyam Nandan Rai, Francesco Di Salvo, Sebastian Doerrich +1Vision-Language ModelsMedical VLMs

  8. SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

    Sep 3, 2026Caoyuan Ma, Tian Gu, Wenpu Liu +11Vision-Language ModelsLarge Vision-Language Models

  9. Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment

    Sep 2, 2026Zihao Wang, Xi Xiang, Yuwen Sun +5Vision-Language ModelsMultimodal Model Evaluation

  10. TrajMind: Chaining Role-Specialized LoRAs for Fast-and-Slow Collective Trajectory Anomaly Diagnosis

    Sep 2, 2026Jiahao Wu, Zhenqun Yang, Chen Jason Zhang +1Anomaly DetectionAgent Trajectory Analysis

  11. EdiTikZ: Scientific Figure Editing from Revision Trajectories

    Sep 1, 2026Christian Greisinger, Zhixue Zhao, Steffen EgerVision-Language Models

  12. Reliability Challenges in Diffusion Vision-Language Models

    Sep 1, 2026Md. Atabuzzaman, Chris ThomasVLM EvaluationVLM Robustness

  13. Text Capability Loss in Vision-Language Adaptation: An Attention-Sink Diagnosis

    Sep 1, 2026Minsik Choi, Geewook Kim, Young Geun KimVision-Language ModelsVLM Adaptation

  14. (V)LMs generalize beyond surface co-occurrence: Evidence from cross-modal number agreement

    Aug 31, 2026Zach Studdiford, Kanishka MisraVision-Language Models

  15. Frontier vision-language models have overtaken young adults at detecting AI-generated portraits -- but not their calibration

    Aug 31, 2026Sunwhi Kim, Sunyul Kim, Meounggun Jo +1VLM EvaluationVision-Language Models

  16. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization

    Aug 30, 2026Aditi Sarker, Rafi Ibn Sultan, Hui Zhu +2VLM RobustnessVision-Language Models

  17. Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

    Aug 26, 2026Luca Bux, Thiago Rios, Ingo Scholtes +2VLM EvaluationVision-Language Models

  18. CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

    Aug 19, 2026Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe +4Vision-Language ModelsVision-Language Alignment

  19. StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

    Aug 13, 2026Joya Chen, Zeyun Zhong, Mike Zheng ShouMemory-Augmented VLMsStreaming Video Understanding

  20. TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

    Aug 13, 2026Fnu Pramono, John Cai, Sourabh KulkarniVLM EvaluationVision-Language Models

  21. TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

    Aug 13, 2026Peng Cai, Zhaofan Zou, Shifa Liu +7Vision-Language ModelsDocument Parsing

  22. Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

    Aug 13, 2026Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo +5Vision-Language ModelsMultimodal Reranking

  23. Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

    Aug 13, 2026Junyi Hu, Tian Bai, Fengyi Wu +7Vision-Language ModelsVision-Language Grounding

  24. Click2Poly: A VLM for vector mapping buildings and walls

    Aug 11, 2026Nicolas Girard, Jawher Ben Abdallah, Arno Gobbin +2Vision-Language ModelsBuilding Footprint Extraction