Visual Prompt Learning

Latest papers 78

All topics
CardsList
  1. Seeing the Invisible: Physics-Guided Visual Prompting for Temperature- and Radiation-Aware VLA Navigation

    Oct 6, 2026Hojoon Son, Fan ZhangSafe Robot NavigationVision-Language Navigation

  2. Reprogramming Vision-Language Models via Structured Prompt Reparameterization

    Sep 29, 2026Zizhao Li, Chengyi Cai, Mohammed Yaqoob Ansari +3VLM AdaptationFew-Shot Image Classification

  3. You Only Reprogram Once: Rethinking Prolonged Training for Visual Reprogramming

    Sep 29, 2026Zizhao Li, Mohammed Yaqoob Ansari, Xinyu Su +3VLM AdaptationVision Foundation Model Adaptation

  4. Gaze Prompts: Temporally Dense Human Attention for Vision-Language-Action Fine-Tuning

    Sep 28, 2026Yihan Zhou, Rui Yan, Mingcong Li +4Visuomotor Policy LearningRobotic Manipulation

  5. PETR: Prompt Ensembling with Training-free Routing for Vision-Language Models

    Sep 20, 2026Weihan Cai, Hao Tan, Xinping Gao +2Zero-Shot LearningVLM Adaptation

  6. GAPrompt++: Multi-Granular Geometry-Aware Point Cloud Prompt for 3D Vision Model

    Sep 17, 2026Zixiang Ai, Zhenyu Cui, Yufei Guo +4Point Cloud LearningVision Foundation Model Adaptation

  7. TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models

    Sep 15, 2026Zeyi Shao, Haowen Hua, Jiaxin Zhang +3Prompt LearningNoisy-Label Learning

  8. PSMP-CLIP: Patch-Prompt SAM and Multi-Semantic Prompting for CLIP-Based Zero-Shot Anomaly Detection

    Sep 15, 2026Xuezhi Xiang, Guanghao Wu, Heqi Xiang +4Promptable Image SegmentationAnomaly Localization

  9. Low-Rank Prompt Learning for Vision-Language Models with Fixed-Token Bases

    Sep 8, 2026Tanvir Muntakim Tonoy, Sajjad Ghiasvand, Mahnoosh Alizadeh +1Vision-Language ModelsPrompt Learning

  10. Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

    Aug 12, 2026Xikai Sun, Kebin Liu, Haotian Wang +3Video ReasoningVLM Reasoning

  11. Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

    Aug 11, 2026Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli +4Remote Sensing Image SegmentationPromptable Image Segmentation

  12. ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

    Aug 8, 2026Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh +1VLM AdaptationZeroth-Order Optimization

  13. Adapting Vision Foundation Models with Cascaded Semantics

    Aug 5, 2026Xi Xiao, Xingjian Li, Cheng Han +8Vision Foundation Model AdaptationVisual Prompt Learning

  14. UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

    Aug 4, 2026Kunquan Zhang, Peilang Li, Xikun Hu +4Remote Sensing Image SegmentationTest-Time Adaptation

  15. SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

    Aug 4, 2026Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu +1VLM AdaptationCross-Modal Retrieval

  16. USP-Mamba: Unmixing-Derived Spectral and Structural Prompting for Hyperspectral Image Super-Resolution

    Aug 3, 2026Shi Chen, Jie Zhang, Yicong ZhouMambaHyperspectral Image Super-Resolution

  17. Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

    Aug 3, 2026Qianlong Yang, Bowen Ye, Xianda Guo +4VLM RobustnessMultimodal Large Language Models

  18. ViP-Rig: Visual-Prompted Controllable Rigging

    Jul 30, 2026Zihan Qin, Mingze Sun, Yifan Mao +6Visual Prompt Learning

  19. Visual prompt engineering for video models

    Jul 28, 2026Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer +7Video ReasoningVisual Prompt Learning

  20. Rethinking Expert Training for Model Merging with Prompt Learning

    Jul 27, 2026Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno +3VLM AdaptationMulti-Task Learning

  21. Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

    Jul 24, 2026Yuqi Li, Xi Xiao, Yunbei Zhang +6Information BottleneckVision Foundation Model Adaptation

  22. DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

    Jul 23, 2026Pierre Gallin-Martel, Mika Feng, Koichi Ito +1Vision Foundation Model AdaptationFace Presentation Attack Detection

  23. Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

    Jul 16, 2026Javad Khoramdel, Farhad Hoseyni, Amirhossein NikoofardClass-Imbalanced LearningVision Foundation Model Adaptation

  24. U-shaped Multi-granularity Learning for Vision-Language Models

    Jul 16, 2026Biao Chen, Yunqian Yu, Xiangxu Zhao +3VLM AdaptationVisual Prompt Learning

  25. MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation

    Jul 16, 2026Yinhan Zhang, Dinwei Tan, Xianghao Kong +3Video Diffusion ModelsDiffusion Model Fine-Tuning

  26. ViPSAM: Visual Prompting Medical Image Segmentation Using Segment Anything Model

    Jul 15, 2026San Lee, Nalee Kim, Jeong Il Yu +2Cross-Modality Medical Image SegmentationPromptable Image Segmentation

  27. Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

    Jul 10, 2026Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen +1Animal Re-IdentificationDistribution Shift

  28. Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

    Jul 10, 2026Haotong Cheng, Yuxuan Li, Zijie CuiMultimodal FusionVisual Prompt Learning

  29. Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

    Jul 7, 2026Xinda Liu, Qinyu Zhang, Weiqing Min +2VLM AdaptationFine-Grained Image Classification

  30. SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

    Jul 7, 2026Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi +3Sharpness-Aware MinimizationVLM Adaptation

  31. Learning Probabilistic Prompt for Continual Learning

    Jul 6, 2026Hyekang Park, Sanghoon Lee, Geon Lee +2Class-Incremental LearningPrompt Learning

  32. Hidden-Shot: Towards One-Shot Task Generalization for Low-Level Vision Generalist Models

    Jul 1, 2026Shao-Jun Xia, Xianzheng Ma, Zichong MengVision Foundation Model AdaptationFew-Shot Learning

  33. CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

    Jul 1, 2026Haoyuan Zhang, Xiangyu Zhu, Li Gao +3VLM AdaptationDomain Generalization

  34. Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

    Jun 29, 2026Taixi Chen, Nancy GuoMissing-Modality LearningPrompt Learning

  35. Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

    Jun 24, 2026Yanzhe Tang, Xinyu Shao, Yuxuan Hu +6Language-Conditioned Robot ManipulationVision-Language Grounding

  36. BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

    Jun 23, 2026Jiaxiang Liu, Tianxiang Hu, Juwei Guan +5VLM AdaptationMedical VLMs

  37. BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

    Jun 22, 2026Feifei Wang, Shiyuan Yang, Xiaoyu Li +1Image EditingVisual Prompt Learning

  38. Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

    Jun 10, 2026Michal Chudoba, Sergey Alyaev, Petra Galuscakova +1LLM Fine-TuningMultimodal Large Language Models

  39. Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision

    Jun 8, 2026Mateo Diaz-Bone, Daniel Caraballo, Florian Scheidegger +11Anomaly LocalizationReconstruction-Based Anomaly Detection

  40. Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

    Jun 6, 2026Zekai Zhang, Qinghui Chen, Maomao Xiong +6VLM AdaptationIndustrial Anomaly Detection

  41. Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

    Jun 6, 2026Zekai Zhang, Jinglin Zhang, Qinghui Chen +8Open-Vocabulary Object DetectionVLM Adaptation

  42. Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

    Jun 3, 2026Tran Dinh Tien, Zhiqiang ShenVLM AdaptationVLM Distillation

  43. Imagine Before You Draw: Visual Prompt Engineering for Image Generation

    Jun 3, 2026Liyu Jia, Fengda Zhang, Jiachun Pan +7Conditional Image GenerationT2I Generation

  44. Beyond Low-Rank: Low-Rank Sparse Prompting via Spiking Neural Network and Prompt Factorization

    Jun 1, 2026Yumiao Zhao, Bo Jiang, Beibei Wang +3Vision Foundation Model AdaptationLow-Rank Adaptation

  45. Personalize Your Large Vision-language Models With In-context Prompt Tuning

    May 29, 2026Yanshu Li, Jiaqian Li, Kuai Yu +4Vision-Language ModelsLarge Vision-Language Models

  46. BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

    May 29, 2026Ziqing Yang, Rui Wen, Xinlei He +3Adversarial AttacksBackdoor Attacks

  47. FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models

    May 27, 2026Xucong Wang, Pengkun Wang, Zhe Zhao +3Multi-Label ClassificationVLM Adaptation

  48. LV-OSD: Language-Vision-Complementary Open-Set Object Detection

    May 27, 2026Yupeng Zhang, Ruize Han, Wei Feng +2Open-Vocabulary Object DetectionObject Detection

  49. Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking

    May 26, 2026Zhengbo Zhang, Zhigang Tu, Junsong Yuan +2Visual Object TrackingVisual Prompt Learning

  50. HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

    May 26, 2026Senyuan Shi, Hao Tan, Zichang Tan +4Image Forgery DetectionVLM Adaptation

  51. Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation

    May 23, 2026Biaoyu Ren, Qingsheng Wang, Cun Xu +2Remote Sensing Image SegmentationReferring Image Segmentation

  52. LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition

    May 19, 2026Jiaxin Wang, Muwei Jian, Hui Yu +2VLM AdaptationFacial Expression Recognition

  53. Dual-Prompt CLIP with Hybrid Visual Encoders for Occluded Person Re-Identification

    May 19, 2026Zhangjian Ji, Shaotong Qiao, Kai Feng +1Visual Prompt LearningPerson Re-Identification

  54. Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architectures

    May 19, 2026Zeyao Liu, Zhendong Zhao, Xiaojun Chen +3Adversarial AttacksVision Transformer

  55. WOW-Seg: A Word-free Open World Segmentation Model

    May 16, 2026Danyang Li, Tianhao Wu, Bin Li +5Image SegmentationOpen-Set Recognition

  56. Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models

    May 12, 2026Boyang Guo, Liang Li, Lin Peng +3Long-Tail LearningVLM Adaptation