Fine-Grained Visual Perception

Latest papers 111

All topics
CardsList
  1. ContourVLA: A Closed-Loop Perception-Action Contour Policy for Generalized Referring Expression Segmentation

    Oct 8, 2026Ruicheng Zhang, Kaiwen Shen, Jiaqi Hou +6Referring Expression SegmentationReferring Image Segmentation

  2. Mixture of Layers: Dynamic Layer Routing for Visual Reasoning

    Oct 7, 2026Jeonghwan Kim, Sofia Stoica, Jiwan Chung +5VLM ReasoningLarge Vision-Language Models

  3. Unlocking Fine-Grained Perception in CLIP via Structurally-Aware Latent Masked Modeling

    Oct 6, 2026Juntong Li, Lingwei Dang, Haomin Wu +3VLM AdaptationDense Prediction

  4. EviRover: Reinforcing Agentic Perception Beyond a Glance

    Sep 30, 2026Kaixuan Fan, Kaituo Feng, Tianshuo Peng +4Tool-Using Vision-Language AgentsActive Visual Perception

  5. GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

    Sep 30, 2026Qize Yu, Lianrui Fan, Boyu Chen +23Vision-Language GroundingVLMs for Robotics

  6. EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

    Sep 29, 2026Yaoxin Niu, Zhangquan Chen, Yang Zhang +5VLM AdaptationEfficient ViTs

  7. Why MLLMs Struggle to Count: Overcoming Individuation and Aggregation Bottlenecks with ConvStack

    Sep 29, 2026Liwei Che, Yihao Quan, Sen Fang +4Object CountingMultimodal Large Language Models

  8. Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision

    Sep 28, 2026Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren +3Vision Foundation ModelsLarge Vision-Language Models

  9. VD-DeepStack: Bridging Visual Comparison and Language Reasoning for Few-Shot Anomaly Detection

    Sep 28, 2026Mengyang Zhao, Zhuolin He, Haiyang Yu +9Few-Shot Anomaly DetectionVisual Reasoning

  10. Evidence-Aligned Multimodal On-Policy Self-Distillation for Fine-Grained Visual Understanding

    Sep 28, 2026Nanxing Hu, Qiwei Yan, Jinchao Zhang +1On-Policy Self-DistillationVLM Distillation

  11. Not All Confusion Is Equal: A Source-Aware Uncertainty Diagnosis for Fine-Grained Aircraft Detection

    Sep 24, 2026Hai Huang, Helmut MayerObject DetectionFine-Grained Visual Perception

  12. BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception

    Sep 22, 2026Zihan Chen, Hengguang Zhou, Yuan Kang +5VLM DistillationMultimodal Large Language Models

  13. Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning

    Sep 21, 2026Santi Ram Tiwari, Nihal Naik, Devbrat Pandey +1Vision-Language GroundingVLM Reasoning

  14. Region-Level Policy Optimization for Fine-grained MLLM Perception

    Sep 17, 2026Yuheng Shi, Xiaohuan Pei, Minjing Dong +1Efficient VLM InferenceLarge Vision-Language Models

  15. CoralscapesV2: Panoptic and Fine-Grained Visual Scene Understanding in Coral Reefs

    Sep 14, 2026Jonathan Sauder, Thomas Ruckli, Gabrielė Strodomskytė +17Panoptic SegmentationInstance Segmentation

  16. HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition

    Sep 11, 2026João Pedro C. A. de Sá, Odemir Martinez BrunoVisual Representation LearningVision Transformer

  17. ConCA: Concentration-Aware Channel Attention for Fine-Grained Visual Recognition

    Aug 31, 2026Yu-Sheng Liu, Yu-Chen TungChannel AttentionFine-Grained Image Classification

  18. Evaluating 2D and 3D-Aware Vision Foundation Models for Vehicle Attribute Recognition

    Aug 30, 2026Alexandre V. Delazeri, Gabriel E. Lima, Eduil Nascimento +2Vision Foundation ModelsFine-Grained Visual Perception

  19. More Accurate, Less Human: Gestalt Grouping in Vision Models

    Aug 10, 2026Sudhanva Manjunath Athreya, Sai Phani Kumar MalladiVLM EvaluationData Visualization

  20. GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

    Aug 10, 2026Jiahui Cui, Yan Zhao, Kan Wei +4Vision-Language ModelsFine-Grained Image Retrieval

  21. Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

    Aug 2, 2026Xinheng Han, Jianfei Wang, Yu Chen +4Multimodal GroundingGroup Relative Policy Optimization

  22. Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

    Aug 2, 2026Myeongkyun Kang, Yanting Yang, Xiaoxiao LiMedical Imaging Foundation ModelsMedical Image Grounding

  23. Foveated Probes Recover Localized Binding Information in Vision Foundation Models

    Aug 1, 2026Mateusz Michalkiewicz, Mahsa Baktashmotlagh, Guha BalakrishnanVisual Representation LearningVision Foundation Models

  24. EEG-EditBench: Probing Visual Information in EEG-Image Retrieval Models with Controlled Image Edits

    Jul 30, 2026Kaifan Zhang, Lihuo He, Yuqi Ji +4EEG DecodingEEG-Based Visual Decoding

  25. Fine-Grained Food Image Understanding via Target-Aware Data Alignment

    Jul 28, 2026Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn +2Fine-Grained Image RetrievalFine-Grained Image Classification

  26. Fine-grained CLIP fine-tuning with self-annotated region alignment

    Jul 15, 2026Chenyang Zhao, Wei Lin, Antoni B. Chan +1VLM AdaptationVision-Language Grounding

  27. Beyond Color Geometry: Evaluating Human-Like Color Representations in Vision Models

    Jul 15, 2026Ayan Igali, Pakizar ShamoiVisual Representation LearningFine-Grained Visual Perception