Visual Search

Momentum

6 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 30

All topics
CardsList
  1. Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs

    Oct 4, 2026Renchi Zhang, Joost C. F. de Winter, Dimitra Dodou +2Multimodal Large Language ModelsVisual Search

  2. Recurrent Latent Visual Search for GUI Grounding

    Oct 4, 2026Kaiyu Wu, Beichen Zheng, Weiyao Huang +1GUI GroundingVision-Language Grounding

  3. HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

    Sep 29, 2026Zhangquan Chen, Yaoxin Niu, Xiang An +5Human-in-the-Loop AnnotationProcess Supervision

  4. Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom

    Sep 29, 2026Xijia Tao, Yihua Teng, Xinyu Fu +5Visual Question AnsweringTool Use in VLMs

  5. Graded-Relevance Composed Multimodal Retrieval for E-commerce Visual Search at Scale

    Sep 21, 2026Anubhav Gupta, Hrushikesh Mohapatra, Prijith Chandra +6Information RetrievalVisual Search

  6. RoboFind: Multi-Agent Personalized Object Search for People Who Are Blind or Have Low Vision

    Sep 17, 2026Ruiping Liu, Shaofang Quan, Qian Yin +10Assistive RoboticsMulti-Agent Systems

  7. SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

    Aug 5, 2026Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin +6Surgical Video UnderstandingGenerative Retrieval

  8. StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

    Aug 3, 2026Lingwei Dang, Shishuo Shang, Pan Liu +9Visual Search

  9. Bridging the Catalog-to-Real Gap: Scalable Product Recognition via Multi-Stage Contrastive Learning

    Jul 10, 2026Anyi Zhang, Joy Mazumder, Kiril LomakinContrastive LearningVisual Search

  10. BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

    Jul 3, 2026Geng Li, Yuxin PengLarge Vision-Language ModelsVisual Search

  11. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents

  12. ActiveScope: Actively Seeking and Correcting Perception for MLLMs

    Jun 23, 2026Yajing Wang, Chao Bi, Junshu Sun +4Multimodal Large Language ModelsVision-Language Grounding

  13. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

    Jun 13, 2026Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding

  14. VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

    Jun 2, 2026Hang He, Chuhuai Yue, Chengqi Dong +6VLM EvaluationVisual Question Answering

  15. Self-Prophetic Decoding to Unlock Visual Search in LVLMs

    May 27, 2026Zhendong He, Qiyuan Dai, Guanbin Li +2Large Vision-Language ModelsVLM Reasoning

  16. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5VLM EvaluationTool Use in VLMs

  17. Binding Visual Features Point by Point

    May 25, 2026Udith Haputhanthri, Declan Campbell, Rim Assouel +2Vision-Language ModelsVLM Interpretability

  18. CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

    May 22, 2026Liupeng Li, Haoqian Kang, Zhenyu Lu +4Efficient VLM InferenceLarge Vision-Language Models

  19. PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

    May 22, 2026Chunze Yang, Qidong Liu, Wenjie Zhao +10HealthcareMedical VQA

  20. Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

    May 18, 2026Yuhuan Wu, Cong Wei, Fangzhen Lin +2Vision-Language ModelsVLM Adaptation

  21. InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

    May 8, 2026Bohan Hou, Jiuning Gu, Jiayan Guo +5Multimodal IRMultimodal Search Agents

  22. Zero-Shot Satellite Image Retrieval through Joint Embeddings: Application to Crisis Response

    May 6, 2026James Walsh, William Fawcett, Grace Colverd +1Geospatial Foundation ModelsDisaster Response

  23. AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding

    May 4, 2026Ruilin Yao, Shegnwu Xiong, Tianyu Zou +2Uncertainty QuantificationGUI Grounding

  24. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  25. Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

    Oct 1, 2025Sanghwan Kim, Rui Xiao, Stephan Alaniz +2Multimodal Large Language ModelsLong-Video Understanding