Vision-Language Foundation Models

Latest papers 150

All topics
CardsList
  1. GateSPINE: Gated Cross-View Fusion for Lumbar Spine MRI Report Generation

    Sep 30, 2026Hoang Nguyen Van, Cuong Vuong Tuan, Trang Mai Xuan +3Magnetic Resonance Imaging DatasetMagnetic Resonance Imaging

  2. ASENA: Self-evolving Agents for Embodied Navigation

    Sep 30, 2026An-Chieh Cheng, Isabella Liu, Edmund Bu +7Embodied AgentsVision-Language Navigation

  3. VLM4Cluster: Benchmarking Deep Clustering In the Era of Vision-Language Pre-training

    Sep 29, 2026Yuanwei Hu, Bo Peng, Yuheng Jia +3Vision-Language Foundation ModelsVision Datasets

  4. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4Large Language Model BenchmarksWireless Foundation Models

  5. THEIA: A Multimodal Dataset and Benchmark for Vision-Language Analysis of Layout

    Sep 28, 2026Giuseppe Chiari, Michele Piccoli, Federico Viola +1Analog DesignLayouts

  6. When VLMs Trust Context: Evaluating Scene Text Recognition under Misleading Context

    Sep 28, 2026Yuxing Cheng, Yuan Wu, Yi ChangScene Text RecognitionVision-Language Foundation Models

  7. Revitalizing Medical Time Series with Vision-Informed Retrieval: A Vision-Language Perspective

    Sep 28, 2026Guoqi Yu, Juncheng Wang, Shujun WangTime SeriesWaveforms

  8. VL-AcneSeg: A Vision-Language Framework for Region-Aware Acne Lesion Segmentation

    Sep 28, 2026Sukju Oh, Soo Ick Cho, Dae Hun Suh +1Lesion SegmentationVision-Language Foundation Models

  9. A Visual Classification Dataset and Model Evaluation for Historical Manuscript Illustrations

    Sep 27, 2026Yoav Evron, Michal Bar-Asher Siegal, Michael FireVision DatasetsHistorical Manuscripts

  10. FFM-CP: Cross-Backbone Fusion of Vision-Language Foundation Models for Few-Shot Computational Pathology

    Sep 23, 2026Anh-Tien Nguyen, Trung DQ. Dang, Nghiem Tuong Diep +9Pathology Foundation ModelsComputational Pathology

  11. Beyond Balanced Accuracy: A Resolution and Parity-Controlled Benchmark for Vision-Language and Vision-Only Defect Assessment in UAV Power-Line Inspection

    Sep 23, 2026Linghao Zhang, Siyu Xiang, Junwei Kuang +1Vision-Language Foundation ModelsSelf-Supervised Vision Transformers

  12. What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior

    Sep 21, 2026Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak +4Vision-Language NavigationVision-Language Foundation Models

  13. BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring

    Sep 20, 2026Liuyang Song, Yi Zhang, Zhongyi Deng +2Vision-Language Foundation ModelsFrozen Encoder

  14. HOIBlender: Blending Lightweight Detection with Vision-Language Priors for Efficient Human-Object Interaction Detection

    Sep 20, 2026Junwen Chen, Keiji YanaiArticulated ObjectsVision-Language Model Grounding

  15. Vroom-Vroom at SHROOM-Visions: A Multi-Judge Committee for Detecting Hallucinated Spans in Vision-Language Outputs

    Sep 15, 2026Toqeer Ehsan, Nico Penttilä, Richard Schmidt +2Vision-Language Foundation ModelsHallucination Detection

  16. A Vision-Language Foundation Model for Precise and Comprehensive Brain Tumor Diagnosis from Preoperative Multimodal Data

    Sep 15, 2026Yinong Wang, Jianwen Chen, Zhou Chen +28Brain Tumor ClassificationVlm-To-Vla Capability Transfer

  17. SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

    Sep 14, 2026Anubhav Khanal, Prabigya Acharya, Roshni Poudel +53D Spatial Reasoning3D Generation

  18. Foundation Models for Generalizable Semantic and Goal-Oriented Communication

    Sep 7, 2026Boliang Liu, Wint Yi Poe, Riccardo Trivisonno +1Vision-Language Foundation ModelsFoundation Model

  19. DroneGround: Open-Vocabulary Drone Payload Characterization Using Synthetic Data and Grounded Vision-Language Models

    Sep 7, 2026Ami Pandat, Rajasekhar Punna, Gopika Vinod +1Drone DetectionAutonomous Drones

  20. AlphaRAD: Grounded Zero-Shot Classification in Chest Radiology via αα-Corrected Binary Cross Entropy and Factorized Latent Supervision

    Sep 1, 2026Jianzhong You, Yuan Gao, Chris McIntoshChest X-RayMedical Vision-Language Models

  21. Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

    Aug 31, 2026Xin Zhou, Zongchuang Zhao, Zhibo Yang +13Autonomous DrivingHuman Driving

  22. How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

    Aug 13, 2026Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee +4Scientific FigureVision-Language Foundation Models

  23. Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

    Aug 13, 2026Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik +3Medical Visual Question AnsweringMultiple-Choice Visual Question Answering

  24. Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

    Aug 11, 2026Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli +4Remote Sensing Image SegmentationRecent Vision Foundation Models

  25. SABRE: Scalable and Automated Benchmarking of VLMs under Stress

    Aug 7, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1Vision-Language Foundation ModelsDouble-Edged Sword

  26. Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

    Aug 7, 2026Haoyang Yuan, Boyang Li, Yingqian Wang +7Infrared Small Target DetectionScene Reasoning

  27. Vision-Language Model Confidence Is Not a Property of the Answer

    Aug 6, 2026Reza Khanmohammadi, Erfan Miahi, Ivan Brugere +4Confidence CalibrationVision-Language Foundation Models

  28. Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

    Aug 5, 2026Zach Eidex, Yu-nong Lin, Mojtaba Safari +4Brain Tumor SegmentationVision-Language Foundation Models

  29. Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

    Aug 5, 2026Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian +1Medical Vision-Language ModelsVision-Language Foundation Models

  30. VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

    Aug 5, 2026Jihoon Oh, Kento Kawaharazuka, Kei OkadaScalable Robot LearningEgocentric Video

  31. Multi-Branch Policy Optimization for Multimodal Large Language Models

    Aug 5, 2026Shuai Lyu, Yuning Gong, Ruiling Gao +7Multimodal ReasoningMultimodal Large Language Models

  32. Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models

    Aug 3, 2026Xuanhui Lin, Junhao Dong, Mingrong Gong +3Vision-Language Foundation ModelsAdversarial Training

  33. FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

    Aug 3, 2026Yaning Zhang, Jiao Wu, Zan Gao +1Deepfake DetectionFace Forgery Detection

  34. MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

    Aug 2, 2026Jiang Wu, Sichao Wu, Yinsong Ma +2Vision-Language Foundation ModelsSafety-Critical Scenarios

  35. SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

    Jul 31, 2026Muhayy Ud Din, Irfan HussainRobotic GraspingVision-Language Foundation Models

  36. A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

    Jul 30, 2026Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik +1Multi-UavDisaster Response

  37. Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

    Jul 28, 2026Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà +3Vision-Language Foundation ModelsLarge Language Model Backbones

  38. Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring

    Jul 28, 2026Adam Scicluna, Gavin Paul, Alen AlempijevicVision-Language NavigationObject Goal Navigation

  39. scMIR: a vision-language foundation model for single-cell light microscopy image representation

    Jul 21, 2026Yifan Shang, Jiahui Tan, Xiangxiang Zeng +1Vision-Language Foundation ModelsUnified Representation

  40. Vision-Language Assistant for Emotional Reactions to Risky Driving

    Jul 17, 2026Harine Choi, Eun Hak Lee, Zhengzhong TuHuman DrivingAutonomous Driving

  41. GeoDetect: Geometric Adversarial Detection for VLPs

    Jul 16, 2026Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie +2Adversarial ExamplesWhite-Box Spectral-Subspace-Guided Attack

  42. What Keeps Vision-Language Models Looking at the Image?

    Jul 14, 2026Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi +3Vision-Language Foundation ModelsChain-of-Thought Reasoning

  43. Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

    Jul 13, 2026Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides +3Robot NavigationSafe Navigation

  44. Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

    Jul 10, 2026Shravan Murlidaran, Miguel P. EcksteinVision-Language Foundation ModelsComplex Societies

  45. APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

    Jul 9, 2026Emily Jin, Joy Hsu, Yiqing Xu +3Long-Horizon PlanningPlanning

  46. Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models

    Jul 8, 2026Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen +4Replay-Based Continual LearningSelf-Supervised Learning

  47. BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

    Jul 8, 2026Jiacheng Yang, Tongying Xiao, Yunkai Dang +7Recent Vision-Language ModelsVision-Language Foundation Models

  48. Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

    Jul 7, 2026Zeyuan Ding, Wenhai Liu, Yang Xu +6Action PredictionPhotometric Supervision

  49. PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

    Jul 7, 2026Xiaopei Wu, Chenshu Hou, Liang Peng +93D Scene UnderstandingVoxel