Fine-Grained Visual Perception

Latest papers 111

All topics
CardsList
  1. P2^2-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

    Jun 2, 2026Ruipeng Zhang, Zhihao Li, Haozhang Yuan +2VLM RobustnessDirect Preference Optimization

  2. FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

    Jun 2, 2026Chang Kong, Yuebing Li, Peng Mo +2Synthetic Data AugmentationVision-Language Models

  3. Generalization Limits in Vehicle Re-Identification

    Jun 1, 2026Anis Yassine Ben Mabrouk, Antoine Tadros, Rafael Grompone von Gioi +3Fine-Grained Visual PerceptionCross-Dataset Generalization

  4. CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

    May 31, 2026Xin Dong, Wenjia Geng, Wenfeng Deng +1Temporal Video GroundingVideo Representation Learning

  5. UniVerse: A Unified Modulation Framework for Segmentation-Free,Disentangled Multi-Concept Personalization

    May 29, 2026Quynh Phung, Sandesh Ghimire, Minsi Hu +2Diffusion TransformerImage Generation

  6. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    May 29, 2026Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3VLM EvaluationSemantic Correspondence

  7. iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

    May 29, 2026Chang-Bin Zhang, Yujie Zhong, Qiang Zhang +1Large Vision-Language ModelsVision-Language Grounding

  8. DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

    May 26, 2026Jianfei Zhao, Feng Zhang, Xin Sun +3Supervised Fine-TuningVision-Language Models

  9. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  10. PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

    May 22, 2026Rim Assouel, Amir Bar, Michal Drozdzal +1Visual Spatial ReasoningSynthetic Data Generation

  11. Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

    May 21, 2026Zixuan Lan, Luzhe Sun, Matthew R. Walter +1VLM EvaluationVLM Interpretability

  12. Towards UAV Detection in the Real World: A New Multispectral Dataset UAVNet-MS and a New Method

    May 20, 2026Yihang Luo, Jun Chen, Chao Xiao +13Multispectral Object DetectionSmall Object Detection

  13. FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

    May 20, 2026Enhui Yu, Junhui Li, Ruitong Lu +2Agricultural Image AnalysisEnsemble Learning

  14. Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation

    May 19, 2026He-Yang Xu, Pengyuan Zhang, Zongyuan Ge +5VLM EvaluationRobotic Manipulation

  15. Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

    May 18, 2026Qianhao Yuan, Jie Lou, Xing Yu +4Multimodal Large Language ModelsOn-Policy Distillation

  16. A Large-Scale Study on the Accuracy vs Cost Trade-offs of Training and Evaluation Settings in Fine-Grained Image Recognition

    May 18, 2026Edwin Arkel Rios, Augusto Christian Surya, Oswin Gosal +5Data AugmentationCost-Aware Inference

  17. Collision-Resistant Single-Pass Method for Unsupervised Fine-Grained Image Hashing

    May 18, 2026Anh-Kiet Duong, Petra Gomez-Krämer, Jean-Michel CarozzaFine-Grained Image RetrievalImage Retrieval

  18. DSAA: Dual-Stage Attribute Activation for Fine-grained Open Vocabulary Detection

    May 18, 2026Donghong Jiang, Endian Lin, Hanqing Liu +4Open-Vocabulary Object DetectionFine-Grained Visual Perception

  19. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Cross-Modal LearningVideo Object Segmentation

  20. EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

    May 16, 2026Haozhe Shan, Xiancong Ren, Han Dong +9VLM EvaluationVision-Language Grounding

  21. How to Choose Your Teacher for Fine Grained Image Recognition

    May 15, 2026Oswin Gosal, Edwin Arkel Rios, Augusto Christian Surya +3Fine-Grained Image ClassificationTeacher-Student Learning

  22. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  23. SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

    May 14, 2026Pengxin Xu, Xincheng Lin, Luping Xiao +5Fine-Grained Visual PerceptionMultimodal Understanding

  24. FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

    May 13, 2026Geng Li, Yuxin PengVLM EvaluationFine-Grained Visual Perception

  25. UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

    May 12, 2026Shuo Ni, Tong Wang, Jing Zhang +5VLM EvaluationRemote Sensing Image Understanding

  26. Count Anything at Any Granularity

    May 11, 2026Chang Liu, Haoning Wu, Weidi XieObject CountingMultimodal Large Language Models

  27. Explainable Part-Based Vehicle Classifier with Spatial Awareness

    May 8, 2026Andreas Caduff, Klaus Zahn, Jonas Hofstetter +2Intelligent Transportation SystemsExplainable Image Classification

  28. ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

    May 8, 2026Ziheng Zhou, Yang Wang, Nan Wang +2Image RetrievalFine-Grained Visual Perception

  29. Fine-tuning a vision-language model for fracture-surface morphology recognition

    May 8, 2026Quanliang Liu, Jungtaek Kim, Kangwook Lee +1VLM AdaptationMaterials Science