Recent Vision Foundation Models

Latest papers 107

All topics
CardsList
  1. Enhancing Autoregressive Video Generation via Representation Adversarial Distillation

    Sep 30, 2026Fangyu Lin, Xingtong Ge, Lunjie Zhu +8Autoregressive Video GenerationVideo Generation

  2. FAST: Flow Any Scene Transformer

    Sep 30, 2026Yongjian Zhang, Longguang Wang, Zhuo Song +3Harder Better Faster Denser Feature MatchingRecent Vision Foundation Models

  3. SplatLabel: Pseudo-Labelling through 4D Gaussian Splatting

    Sep 24, 2026Nitya Nanvani, Andras Palffy, Holger Caesar3D Semantic Occupancy PredictionOpen-Vocabulary 3D Segmentation

  4. LIBERO-VPro: Benchmarking Closed-Loop Visual Robustness of Robotic Foundation Models

    Sep 21, 2026Huiqiong Li, Zhiting Mei, Anirudha Majumdar +3Libero Manipulation BenchmarkRecent Vision Foundation Models

  5. Bridging Vision Foundation Model Priors with CLIP for Spatial-aware Few-shot Anomaly Detection in Medical Images

    Sep 14, 2026Juzheng Miao, Yuchen Yuan, Cheng Chen +1Medical ImagesLesion

  6. 3D Point Splatting for mmWave Radar Novel View Synthesis

    Sep 11, 2026Adnan Armouti, Yixuan Gao, Rajalakshmi NandakumarRadarNovel View Synthesis

  7. Cross-modal learning for SAR target recognition using optical vision foundation models

    Sep 7, 2026Lucas Hirsch, James R. Hopgood, Javid Khan +2Synthetic Aperture RadarRecent Vision Foundation Models

  8. CrACK: Adversarial Attacks on Cross-Model Consistency in Collaborative Vision Foundation Models

    Sep 7, 2026Feifei Liu, Jintao Cheng, Chi Man Vong +1Adversarial ExamplesContrastive Language-Image Pre-Training Model

  9. Uncertainty of Vision Medical Foundation Models

    Aug 31, 2026Haoxu Huang, Narges RazavianUncertainty QuantificationRecent Vision Foundation Models

  10. Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

    Aug 12, 2026Davide Cozzolino, Giovanni Poggi, Luisa VerdolivaAi-Generated Image DetectionUnsupervised Detection

  11. Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

    Aug 11, 2026Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli +4Remote Sensing Image SegmentationRecent Vision Foundation Models

  12. Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

    Aug 11, 2026Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas +1Acute Myeloid LeukemiaMitotic Figures

  13. GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

    Aug 11, 2026Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang +4Open-Vocabulary SegmentationRemote Sensing Image Segmentation

  14. GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models

    Aug 10, 2026Zhihang Liu, Mei-Po Kwan, Jinlin Wu +1LandslidesGeospatial Foundation Models

  15. RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

    Aug 10, 2026Zhihao Zhang, Gengwei Zhang, Tianlong Chen +13D Object DetectionMonocular

  16. Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

    Aug 10, 2026Xuanyu Liu, Zheng Fang, Hongyang He +2Vision-Language Model AdaptationRecent Vision Foundation Models

  17. Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation

    Aug 8, 2026Haozhe Wang, Jintao Cheng, Weibin Li +1Open-Vocabulary SegmentationSemantic Segmentation

  18. AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

    Aug 8, 2026Xu Zhang, Xinqing Li, Jianpeng Xie +3Change DetectionRemote Sensing

  19. Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

    Aug 7, 2026Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans +7Recent Vision Foundation ModelsMedical Image Generation

  20. Adapting Vision Foundation Models with Cascaded Semantics

    Aug 5, 2026Xi Xiao, Xingjian Li, Cheng Han +8Self-Supervised Vision TransformersRecent Vision Foundation Models

  21. EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

    Aug 5, 2026Zhenyu Yi, Jianwei Xu, Yue Hu +6Vision-Language AlignmentColonoscopy

  22. Representation Transfer of Foundation Models for Ultra-Widefield Retinal Imaging

    Aug 1, 2026Mingya Alexa Gong, Da Ma, Lovre Antonio Budimir +7Recent Vision Foundation ModelsRetinal Imaging

  23. Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

    Jul 31, 2026Karim El Khoury, Benoît Gérin, Benoît Macq +1Remote SensingTransductive Learning

  24. Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

    Jul 29, 2026Peter Lorenz, Anjith George, Sébastien MarcelRecent Vision Foundation ModelsCross-Dataset Benchmark

  25. Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

    Jul 24, 2026Yuqi Li, Xi Xiao, Yunbei Zhang +6Recent Vision Foundation ModelsFrozen Vision-Language Models

  26. Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

    Jul 20, 2026Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb +8Synthetic-To-Real Domain GapTomato Diseases

  27. Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics

    Jul 13, 2026Yi Tang Soon, Jun-Wei HsiehOpen-Vocabulary Object DetectionOpen-Vocabulary

  28. Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

    Jul 12, 2026Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete +9Robotic PerceptionRecent Vision Foundation Models

  29. TestMate: Test-Time Domain Adaptation Aided by Lightweight Vision Foundation Model

    Jul 4, 2026Dimitrios Fotiou, Vasileios Mygdalis, Ioannis PitasDomain AdaptationFew-Shot Segmentation

  30. GeoSAM-Lite: A Lightweight Foundation Model for Onboard Remote Sensing Segmentation

    Jul 4, 2026Yongcong Wang, Jie Zhang, Rui Jiang +3Remote Sensing Image SegmentationGeospatial Foundation Models

  31. MuSViT: A Foundation Vision Model for Sheet Music Representation

    Jun 30, 2026Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez +4Symbolic Music GenerationRecent Vision Foundation Models

  32. SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

    Jun 28, 2026Hang Su, Chao Sun, Zhaofan Li +3Clinical Ultrasound DatasetPrenatal Ultrasound

  33. Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models

    Jun 24, 2026Qinzhe Yang, Keyan Chen, Jia Xu +2Remote Sensing Image SegmentationRemote Sensing

  34. LEVIRDet: A Million-Scale 159-Category Dataset and Foundation Model for Universal Remote Sensing Object Detection

    Jun 24, 2026Qinzhe Yang, Dongyu Wang, Haohan Niu +3Remote SensingObject Detection

  35. Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching

    Jun 23, 2026Sujun Sun, Mingwu Ren, Haofeng ZhangFew-Shot SegmentationRecent Vision Foundation Models

  36. FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

    Jun 23, 2026Kim Youwang, Zhengyu Yang, Liuhao Ge +8Animatable 3D Human AvatarsAvatars

  37. Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation

    Jun 20, 2026Qing Xu, Xiangjian He, Wenting Duan +2Recent Vision Foundation ModelsVision Foundation Models

  38. μμMatch: Foundation Models for Semi-supervised Learning and Domain Adaptation in EM

    Jun 19, 2026Marei Freitag, Olesia Korchevaia, Luca Freckmann +2Recent Vision Foundation ModelsWireless Foundation Models

  39. Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

    Jun 15, 2026Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding +5ColonoscopyRecent Vision Foundation Models

  40. VISTA: Scale-Aware Visual Navigation via Action History Conditioning

    Jun 15, 2026Maeva Guerrier, Koki Kobayashi, Simon Roy +2Recent Vision Foundation ModelsDynamic Environments

  41. Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning

    Jun 14, 2026Donghyun Han, Yuseok Bae, Jung Uk Kim +1Recent Vision Foundation ModelsDense Prediction

  42. EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

    Jun 13, 2026Zhuo Deng, Ruiheng Zhang, Ziheng Zhang +23Fundus ImagesGlaucoma Detection

  43. IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

    Jun 9, 2026Yitong Chen, Zijie Diao, Junke Wang +5Autoregressive Image GenerationAutoencoder Architectures

  44. Vision-Assisted Foundation Model for Solving Multi-Task Vehicle Routing Problems

    Jun 9, 2026Shuangchun Gui, Zhiguang Cao, Wen Song +1Vehicle Routing ProblemMulti--Task Learning

  45. Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

    Jun 8, 2026Silas Kwabla Gah, Ebenezer OwusuFew-Shot SegmentationOpen-Vocabulary

  46. Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have

    Jun 3, 2026Elouan Gardès, Seung Eun Yi, Kartik Ahuja +6Domain AdaptationRecent Vision Foundation Models

  47. Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

    Jun 3, 2026Shuwen Yu, Zhanxuan Hu, Yi Zhao +2Recent Vision Foundation ModelsLatent Representation Alignment

  48. Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning

    May 31, 2026Jixuan He, Xueting Li, Chieh Hubert Lin +1Spatial ReasoningSpatial Memory

  49. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    May 29, 2026Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3Recent Vision Foundation ModelsVision Foundation Models

  50. Clustering Guided Domain-Specific Pretrained Foundation Model for Very High-Resolution Arctic Remote Sensing

    May 28, 2026Amal S. Perera, Chandi Witharana, Elias Manos +2Recent Vision Foundation ModelsRemote Sensing

  51. RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

    May 25, 2026Wenhui ChuRobotic PerceptionRecent Vision Foundation Models

  52. Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation

    May 25, 2026Chunzheng Zhu, Yijun Wang, Jianxin Lin +5UltrasoundSelf-Supervised Learning