Recent Vision-Language Models

Latest papers 656

All topics
CardsList
  1. Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

    Oct 1, 2026Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc +2Multimodal Large Language ModelsRecent Vision-Language Models

  2. Task-Adaptive Grounded 3D-Programmers Using 2D VLMs

    Oct 1, 2026Arman Raayatsanati, Sombit Dey, Anna-Maria Halacheva +33D Visual Grounding3D Scene Understanding

  3. Anti-Persona: Disrupting Unauthorized Identity Binding and Recognition in Personalized Vision--Language Models

    Oct 1, 2026Abhishek Basu, Fahad Shamshad, Karthik NandakumarRecent Vision-Language Models

  4. MoLE: Mixture of Latent Experts for Complementary Visual Reasoning

    Oct 1, 2026Yingcheng Liu, Tianyi Jiang, Yujuan Ding +5Latent Visual ReasoningVisual Reasoning

  5. LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification

    Oct 1, 2026Haochen Zhang, Laura Yao, Zachary Plotkin +2Video CaptioningReinforcement Learning With Verifiable Reward

  6. Towards Reliable Vision-Language Models for Autonomous Driving

    Oct 1, 2026Manasa Mariam Mammen, Priyanka Mary Mammen, Zafer Kayatas +1Recent Vision-Language ModelsAutonomous Driving

  7. Geometric Similarity in VLM Low-Level Vision Representations

    Oct 1, 2026Shao-Jun Xia, Huixin Zhang, Zhen Lei +3Recent Vision-Language ModelsDiffusion Transformers

  8. STARS: From Spatiotemporal Dynamics to Social Representations in Human-Robot Interaction

    Sep 30, 2026Nathan Tsoi, Michael J. Munje, Tejas Oberoi +5Vision-Language NavigationRobot Navigation

  9. Mitigating Object Hallucination in Large Vision-Language Models via False Discovery Controlled Visual Data Splitting

    Sep 30, 2026Chang Liu, Yu Tian, Rui XieHallucination MitigationRecent Vision-Language Models

  10. Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

    Sep 30, 2026Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen +1Safety AlignmentRefusals

  11. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Spatial ReasoningRecent Vision-Language Models

  12. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Recent Vision-Language ModelsTransformer Architectures

  13. Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    Sep 29, 2026L. D. M. S. Sai Teja, Ufaq Khan, N. Siva Gopala Krishna +5TextvqaRecent Vision-Language Models

  14. NeuronEye: Query-Guided Visual Concept Activation for Vision-Language Reasoning

    Sep 29, 2026Ruiyu Yan, Bowen Chen, Shaowen Wan +1Recent Vision-Language ModelsVisual Representations

  15. TReVS: Integrating Textual Relevance and Visual Saliency for Efficient Vision-Language Model Token Pruning

    Sep 29, 2026Jing Wang, Zhiping Wu, Dongdong Ren +3Visual Token PruningRecent Vision-Language Models

  16. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Recent Vision-Language ModelsVisual Hallucinations

  17. Spatial-OPSD: Self-Improving Spatial Reasoning via Label-Free Self-Distillation

    Sep 29, 2026Zhenyu Liu, Zhangquan Chen, Keyi Chen +4Spatial ReasoningRecent Vision-Language Models

  18. Xiaomi-OCR-0 Technical Report

    Sep 28, 2026Xin Chen, Anan Du, Feng Feng +7Lingdt-Vl-OcrDocument Parsing

  19. EdgeVLN: Runtime-Aware Deployment Ready Quantized Vision Language Navigation Model

    Sep 28, 2026Rithvik Jonna, Man Namgung, Aakash Gurram +1Vision-Language NavigationResource-Constrained Edge Devices

  20. THEIA: A Multimodal Dataset and Benchmark for Vision-Language Analysis of Layout

    Sep 28, 2026Giuseppe Chiari, Michele Piccoli, Federico Viola +1Analog DesignLayouts

  21. ReSight-SMC: Two-Stage Power Sampling via Island SMC with Visual Scouts

    Sep 28, 2026Yaowen Zhang, Xiangyu Qiu, Junyi Hu +5Recent Vision-Language ModelsMultimodal Learning

  22. P4Q: Co-designing Token Pruning and Quantization for Vision-Language Model Acceleration

    Sep 28, 2026Haizhao Jing, Zhenhao Shang, Haokui Zhang +2Visual Token PruningLarge Language Model Quantization

  23. When Text Matters: Design Principles for Visual Token Pruning in Vision-Language Model

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seoyoung Cho +2Visual Token PruningRecent Vision-Language Models

  24. WM-VLM: Probing Internal World Models for Interleaved Visual-Textual Reasoning

    Sep 28, 2026Yuheng Zha, Yilei Wang, Qiyue Gao +5Recent Vision-Language ModelsVlm-To-Vla Capability Transfer

  25. From Perception to Integration: Revisiting the Internal Dynamics of Reasoning in Vision-Language Models

    Sep 28, 2026Rong Yu Xu, Prayag Tiwari, Shaolei ZhangRecent Vision-Language ModelsVisual Reasoning

  26. Beyond Reconstruction Loss in Post-Training Quantization: Balanced Fitting for Large Vision-Language Models

    Sep 28, 2026Minchan Kang, Kyeonghye Park, Seungyeon Sa +3Post-Training QuantizationRecent Vision-Language Models

  27. PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation

    Sep 28, 2026Zhen Wang, Changpeng Wang, Zhe Liu +5Vision-Language NavigationRecent Vision-Language Models

  28. Reinforcement Learning from Intermediate Renders for Image-to-Code Generation

    Sep 28, 2026Omri Kaduri, Kate Feingold, Phillip Isola +1Image-To-Code GenerationRecent Vision-Language Models

  29. ActionLens: Diagnosing Spatial-Temporal Binding Failures in Vision-Language Models

    Sep 28, 2026Gueter Josmy Faure, Min-Hung Chen, Hao Ping Wang +3Recent Vision-Language ModelsLens

  30. SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis

    Sep 28, 2026Hangyul Yoon, Hyungyung Lee, Edward Choi +1Chest X-RayRecent Vision-Language Models

  31. Distilling Visual Reasoning into Text Space

    Sep 28, 2026Wenhan Yang, Nilay Naharas, Ali Payani +1Recent Vision-Language ModelsMultimodal Reasoning Benchmarks

  32. RoboICL: Embodied In-Context Learning with GPT-6 Astra

    Sep 28, 2026Fangcheng Liu, Yeqing Shen, Anda Cheng +7Scalable Robot LearningRobocasa

  33. ConvCue: Complementary Visual Inductive Biases for Vision-Language Models

    Sep 28, 2026Zixuan Lan, Shichu SunRecent Vision-Language ModelsVision Encoders

  34. SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

    Sep 28, 2026Ahmadreza Jeddi, Enming Zhang, Jasper Gerigk +12Visual Token PruningRecent Vision-Language Models

  35. Program-Verified Self-Evolution for Vision-Language Models

    Sep 27, 2026Ahmed Heakl, Sungik Choi, Moontae Lee +1Recent Vision-Language ModelsQwen3

  36. Where Hallucinations Live: A Cross-Architecture Circuit in VQ-Tokenized Vision-Language Models

    Sep 24, 2026Shamanthak Hegde, Xiangrui Liu, Maitreya Patel +1Recent Vision-Language ModelsObject Hallucination

  37. Small yet Assistive: Spatially-Aware Post-Training for Low Vision

    Sep 23, 2026Rishabh Choudhary, Shreyansh Raj, Umesh Goyal +6Recent Vision-Language ModelsAssistive Agents

  38. FFM-CP: Cross-Backbone Fusion of Vision-Language Foundation Models for Few-Shot Computational Pathology

    Sep 23, 2026Anh-Tien Nguyen, Trung DQ. Dang, Nghiem Tuong Diep +9Pathology Foundation ModelsComputational Pathology

  39. NV-Reason-CT: 3D Visual Language Model for CT Analysis

    Sep 23, 2026Andriy Myronenko, Dong Yang, Yucheng Tang +13Medical Vision-Language ModelsRadiology Report Generation

  40. Generalizing Manipulation Skills with a Local Coding Agent

    Sep 22, 2026Raman Talwar, Elias Nijs, Andreas Verleysen +1Scalable Robot LearningCoding Agents

  41. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5Unsupervised On-Policy Self-DistillationRecent Vision-Language Models

  42. RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents

    Sep 22, 2026Chang Guo, Yukun Xie, Bohan Tan +6Embodied AgentsRobocasa

  43. VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

    Sep 21, 2026Guangchuan Lv, Dianxing Shi, Dingjie FuVisual Token PruningRecent Vision-Language Models

  44. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Fine-Grained PerceptionRecent Vision-Language Models

  45. All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

    Sep 21, 2026Xingsong Ye, Yongkun Du, Jiaxin Zhang +6Scene Text RecognitionLingdt-Vl-Ocr

  46. Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification

    Sep 17, 2026Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar +1Vision-Language NavigationLow-Latency Latent Planning

  47. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Fine-Grained PerceptionRecent Vision-Language Models

  48. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment

    Sep 16, 2026Henry O. Velesaca, David Freire-Obregon, Luigi Miranda +1AthleticismOpen-Vocabulary Action Recognition

  49. MUSE: Benchmarking Large Vision-Language Models on Multi-Modal Understanding in Situated Education

    Sep 16, 2026Luyao Zhu, Xun Wei Yee, Wei Li +2Multimodal BenchmarksMultimodal Understanding

  50. Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

    Sep 16, 2026Xinxin Song, Siyuan Li, Tingxiong Xiao +1Recent Vision-Language ModelsReinforcement Learning With Verifiable Reward