Multiple Vision Tasks

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 41

All topics
CardsList
  1. Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs

    Oct 4, 2026Renchi Zhang, Joost C. F. de Winter, Dimitra Dodou +2Multiple Vision TasksMultimodal Search Agents

  2. EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

    Sep 29, 2026Yaoxin Niu, Zhangquan Chen, Yang Zhang +5Self-Supervised Vision TransformersFine-Grained Perception

  3. Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom

    Sep 29, 2026Xijia Tao, Yihua Teng, Xinyu Fu +5Multiple Vision TasksVisual Evidence

  4. Beyond Readability: Evaluating Task Information Recoverability

    Sep 29, 2026Yiwei LiuReadabilityMultiple Vision Tasks

  5. AHMAD: Adaptive Hybrid Multi-task Vision Learning with Assisted Distillation for Keypoint Detection

    Sep 28, 2026Mohammad Mahdi, Nedyalko Prisadnikov, Yuqian Fu +3Multi--Task LearningKeypoint Detection

  6. 0.5%>100%: Bidirectional Reciprocal Learning for Referring Image Segmentation

    Sep 21, 2026Xiaoqiang Lu, Licheng Jiao, Lingling Li +5Vision-Language AlignmentMultiple Vision Tasks

  7. MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

    Aug 31, 2026Vernon Toh, Navonil Majumder, Zhengyuan Liu +2PerceptuallyArtificial Intelligence Agents

  8. VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

    Aug 31, 2026Jingyi He, Sanghwan Kim, Zeynep AkataMultiple Vision TasksRecent Vision-Language Models

  9. Multi-Task Consistency-based Detection of Adversarial Attacks

    Aug 7, 2026Cong Chen, Jean-Philippe Monteuuis, Jonathan PetitAutonomous Driving PerceptionObject Detection

  10. Suppress and Diversify: Refining Robust Pathways for Corruption Robustness

    Aug 7, 2026Jiangang Yang, Wenhui Shi, Xiaoran Xu +4Robustness VerificationAdversarial Corruption

  11. Geometry Meets Semantics: Fractional Gradient Stabilization for Semantic-Driven Bounding Box Optimization in Visual Detection Tasks

    Jul 26, 2026Qi Ming, Zheng Zhou, Haitian Yang +4Bounding BoxGeometric Machine Learning

  12. Open-Vocabulary Gaze Object Prediction: Benchmark and Method

    Jul 21, 2026Binglu Wang, Sensen Niu, Ying Chen +1Gaze Target EstimationMultiple Vision Tasks

  13. AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

    Jul 16, 2026Susan Liang, Chao Huang, Filippos Bellos +3Multiple Vision TasksFine-Grained Perception

  14. Let RGB Be the Language of Vision

    Jul 14, 2026Timing Yang, Jinrui Yang, Xinlong Li +11Vision Foundation ModelsMultiple Vision Tasks

  15. TDSal: Task-Based Top-Down Saliency Prediction Model

    Jul 10, 2026Can Mizrakli, Tolga K. CapinSaliencyMultiple Vision Tasks

  16. BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

    Jul 3, 2026Geng Li, Yuxin PengFine-Grained PerceptionMultiple Vision Tasks

  17. EAGLE-360: Embodied Active Global-to-Local Exploration in 360∘^\circ

    Jul 2, 2026Jingtao Xu, Zizhuo Lin, Jianwen Sun +2Multiple Vision TasksMultimodal Search Agents

  18. GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

    Jul 1, 2026Dianyu Wang, Peirong Zhang, Xuyang Li +2Remote SensingMultiple Vision Tasks

  19. PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

    Jun 30, 2026Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Multiple Vision TasksVisual Evidence

  20. LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

    Jun 22, 2026Tongkun Guan, Haocheng Wang, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  21. VTOS: Learning to Orchestrate Vision Tools by Co-Searching Solutions and Observers

    Jun 17, 2026Jinchao Ge, Lingqiao Liu, Shuwen Zhao +1Multiple Vision TasksComputer Vision

  22. PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution

    Jun 16, 2026Zihan Gu, Junchi Zhang, Li Liu +2Multiple Vision TasksSearch Algorithms

  23. MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

    Jun 16, 2026Hao-Yuan Ma, Li Zhang, Minjie Qiang +1Vision State Space ModelsSpatial Tokens

  24. Position: The Systemic Lack of Agency in Visual Reasoning

    Jun 11, 2026Yizhao Huang, Haoyang Chen, Shiqin Wang +6Visual ReasoningMultiple Vision Tasks

  25. VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

    Jun 2, 2026Hang He, Chuhuai Yue, Chengqi Dong +6Multiple Vision Tasks

  26. Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language

    May 27, 2026Qiwei Wu, Rui Zhang, Xin Xiang +4TactileRobotic Manipulation

  27. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

    May 25, 2026Jingru Chen, Yiming Liu, Mingtao Chen +5Multiple Vision TasksFine-Grained Perception

  28. CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

    May 22, 2026Liupeng Li, Haoqian Kang, Zhenyu Lu +4Multiple Vision TasksMultimodal Search Agents

  29. Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

    May 18, 2026Yuhuan Wu, Cong Wei, Fangzhen Lin +2Recent Vision-Language ModelsMultiple Vision Tasks

  30. The MixCount Dataset: Bridging the Data Gap for Open-Vocabulary Object Counting

    May 18, 2026Corentin Dumery, Niki Amini-Naieni, Shervin Naini +1CountingVision Datasets

  31. DiffVAS: Diffusion-Guided Visual Active Search in Partially Observable Environments

    May 15, 2026Anindya Sarkar, Srikumar Sastry, Aleksis Pirinen +2Multiple Vision TasksDynamic Environments

  32. From Web to Pixels: Bringing Agentic Search into Visual Perception

    May 12, 2026Bokang Yang, Xinyi Sun, Kaituo Feng +3Multiple Vision TasksVisual Perception

  33. TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles

    May 12, 2026Sara Shoouri, Morteza Tavakoli Taba, Hun-Seok KimVision State Space ModelsState Space Models

  34. From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

    May 10, 2026Shuang Liang, Zeqing Wang, Yuxian Li +2Multiple Vision TasksAmbiguity

  35. Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search

    May 7, 2026Faisal Aljehrai, Mohammed A. Alkhrashi, Alreem Almuhrij +6Visual EmbeddingsSaliency

  36. S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

    Apr 20, 2026Nitish Shukla, Surgan Jandial, Arun RossMultiple Vision TasksSequential Preference Optimization

  37. E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

    Apr 20, 2026Koya Sakamoto, Taiki Miyanishi, Daichi Azuma +6Viewpoint-Dependent Active PerceptionMultiple Vision Tasks

  38. Task Alignment: A Simple Proxy for Practical Model Merging Across Diverse Vision Tasks

    Date pendingPau de Jorge, César Roberto de Souza, Björn Michele +5Continual Model MergingMultiple Vision Tasks