Vision Foundation Models

Momentum

8 papers in the last four weeks, down 33% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 89

All topics
CardsList
  1. One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

    Oct 8, 2026Adrian Bulat, Yassine Ouali, Georgios TzimiropoulosEfficient ViTsMixture of Experts

  2. DisParQ: Self-Supervised Part Concepts for Interpretable Vision Foundation Models

    Oct 7, 2026Adam Pardyl, Siddhartha Gairola, Sukrut Rao +4Explainable Image ClassificationVision Foundation Models

  3. SPACE-CLIPv2: Decoding Local Geometry from Frozen CLIP for Monocular Depth Estimation

    Oct 4, 2026Hyun Song, Taewan Cho, Kangmin Kim +1Vision-Language ModelsVision Foundation Models

  4. Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

    Sep 28, 2026Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren +3Vision Foundation ModelsLarge Vision-Language Models

  5. UltraBench 2: Towards Robust Evaluation of Vision Foundation Models on Ultrasound

    Sep 23, 2026Ashwath Radhachandran, Adam Tupper, Christian Gagné +1Ultrasound Image SegmentationMedical Imaging Foundation Models

  6. Towards robust multimodal 3D object detection via visual foundation models

    Sep 20, 2026Ziying Song, Lin Liu, Hongyu Pan +4Multimodal RobustnessVision Foundation Models

  7. Exploring 2D backbone effects for indoor semantic occupancy prediction

    Sep 15, 2026Shizhang Fanga, Wanling Yea, Qi ZhengVision Foundation ModelsSemantic Occupancy Mapping

  8. "World Knowledge" in the Weights: Reading Concept Circuits of Vision Transformers

    Sep 8, 2026Yanlin Chen, Tang Li, Xi PengTransformer InterpretabilityVision Foundation Models

  9. CrACK: Adversarial Attacks on Cross-Model Consistency in Collaborative Vision Foundation Models

    Sep 7, 2026Feifei Liu, Jintao Cheng, Chi Man Vong +1Vision Foundation ModelsAdversarial Robustness

  10. VidaForge: Open Research Infrastructure for Video Pretraining Data Recipes

    Sep 6, 2026Yan Ma, Jiadi Su, Zhulin Hu +4Vision Foundation ModelsTraining Data Curation

  11. What Do Scan-Derived Class Prototypes Add? Disentangling Supervision, Prototype Content and Query Protocol in Recognition over Frozen Foundation Features

    Sep 3, 2026Chenxi Tao, Hong-In Won, Seung-Kyum ChoiPrototype-Based ClassificationVision Foundation Models

  12. What, Where, and How: Probing Spatiotemporal Representations in Video Foundation Models

    Sep 1, 2026Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan +3Vision Foundation ModelsVideo Representation Learning

  13. Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models

    Sep 1, 2026Ashiq Shukoor Iqbal, Wilson Wongso, Flora D. SalimVision Foundation ModelsGeospatial Foundation Models

  14. Restrict, Don't Retrain: Inference-Time VLM Guidance for Zero-Shot Aerial Segmentation

    Sep 1, 2026Teresa DiMeola, Charles Walter, Hong XiaoRemote Sensing Image SegmentationVision Foundation Models

  15. Evaluating 2D and 3D-Aware Vision Foundation Models for Vehicle Attribute Recognition

    Aug 30, 2026Alexandre V. Delazeri, Gabriel E. Lima, Eduil Nascimento +2Vision Foundation ModelsFine-Grained Visual Perception

  16. WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition

    Aug 21, 2026Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin +10Vision Foundation ModelsVideo Action Recognition

  17. Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

    Aug 12, 2026Davide Cozzolino, Giovanni Poggi, Luisa VerdolivaVision Foundation ModelsAI-Generated Image Detection

  18. P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

    Aug 10, 2026Amoon Jamzad, Dilakshan Srikanthan, Faranak Akbarifar +2Vision Foundation ModelsRepresentation Probing

  19. LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection

    Aug 10, 2026Peter Lorenz, Anjith George, Marcel SébastienVision Foundation ModelsVision Foundation Model Adaptation

  20. Foundation Models are Implicit Deepfake Detectors

    Aug 10, 2026Stefan Smeu, Dragos-Alexandru Boldisor, Elisabeta Oneata +1Vision Foundation ModelsDeepfake Detection

  21. Damage Classification for 3D Point Cloud Data via 3D Data Analysis and Vision Foundation Model-based 2D Projections

    Aug 9, 2026Evan Perez, Kalelo Dukuray, Erika Ardiles-Cruz +1Point Cloud Anomaly DetectionVision Foundation Models

  22. Invisible Shortcuts: Why Vision Encoders Know Your Camera

    Aug 5, 2026Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos +2Vision Foundation ModelsShortcut Learning

  23. Foveated Probes Recover Localized Binding Information in Vision Foundation Models

    Aug 1, 2026Mateusz Michalkiewicz, Mahsa Baktashmotlagh, Guha BalakrishnanVisual Representation LearningVision Foundation Models

  24. Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection

    Aug 1, 2026Jun Nie, Yonggang Zhang, Tongliang Liu +3Vision Foundation ModelsAI-Generated Image Detection

  25. Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

    Jul 29, 2026Peter Lorenz, Anjith George, Sébastien MarcelVision Foundation ModelsLinear Probing

  26. A Scale-adaptive Vision Model Links C. elegans Neuronal Morphology to Behavior for Neurotoxicity Assessment

    Jul 25, 2026Haochao Ying, Shenchong Lv, Yutao Sun +8Vision Foundation ModelsToxicity Detection

  27. Do Vision Encoders Exhibit Human-like Color Thresholds?

    Jul 17, 2026Engy Ehab, Pablo Hernández-Cámara, Nahla Belal +3Vision Foundation Models