Visual Perception

Momentum

14 papers in the last four weeks, up 250% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 114

All topics
CardsList
  1. EviRover: Reinforcing Agentic Perception Beyond a Glance

    Sep 30, 2026Kaixuan Fan, Kaituo Feng, Tianshuo Peng +4Visual PerceptionPerception

  2. Future Video Generation Better Aligns with the Human Visual Cortex than Observed Video

    Sep 30, 2026Chang-Bae Bang, Hyungjin Chung, Byung-Hoon KimAutoregressive Video Diffusion ModelsHuman Visual Cortex

  3. SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

    Sep 30, 2026Rafi Ibn Sultan, Xiangyu Zhou, Md. Sajid Alam Chowdhury +4Spatial ReasoningRecent Vision-Language Models

  4. Curating Synthetic Data for Task-Specific Visual Perception

    Sep 29, 2026Saptarshi Neil Sinha, Paul Julius Kühn, Michael WeinmannSynthetic DataIndoor Scene Generation

  5. Do Vision Model See Like the Brain? A Comparison Across EEG Encoding Model

    Sep 22, 2026Shashank Baghel, Kshitij Dwivedi, Dinesh Singh +1Vision TransformerConvolutional Neural Networks

  6. The Visual Target Matters: Learning across the Visual Hierarchy for Brain-to-Image Retrieval

    Sep 21, 2026Ye Wang, Haokun Ren, Hong Yu +4Visual PerceptionRetrieval Layer

  7. BinoGen: Scaling egocentric binocular data for embodied visual perception and learning

    Sep 17, 2026Chunpeng Li, Ya-tang LiEgocentric VisionVisual Perception

  8. Bridging Learned Visual Perception and Symbolic Belief-Space Planning

    Sep 15, 2026Guy Azran, Michael Navat, Sarah KerenPlanningVisual Perception

  9. ViD: Vision-Dominant Gender Bias Mitigation for Large Vision-Language Models

    Sep 15, 2026Zhipeng Zhao, Zhaoqiang Wei, Peishun Liu +2Recent Vision-Language ModelsGender Bias

  10. Assisted Spatial Cognition Through Vision-Language Models

    Sep 14, 2026H. Riaz, J. B. Fernandez, I. Mills +3Vision-Language Navigation3D Spatial Reasoning

  11. Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

    Sep 13, 2026Mingze Yin, Xiaohan Wang, Dian Li +8Mathematical ReasoningMultimodal Large Language Models

  12. From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment

    Sep 8, 2026Aoting Zhang, Mingze Gao, Dongbao Yang +5Image Quality AssessmentMultimodal Large Language Models

  13. Are Image Generators Zero-Shot Perceivers? A Rigorous Evaluation

    Sep 7, 2026Shangzhe Di, Zhaokai Wang, Weidi XieZero-Shot RobustnessImage Generation

  14. Towards Generalizable Visually Grounded Exploration of Household Devices

    Sep 1, 2026Linhao Zheng, Zeming Liu, Wangke Chen +4Embodied AgentsWeak Visual Grounding

  15. Chartography: A Benchmark for Professional Chart Understanding

    Aug 11, 2026Suhaas Garre, Chris Mutty, Sushant Mehta +1ChartDiagnostic Benchmark

  16. Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

    Aug 7, 2026Moloud Damandeh, Meead SaberiMultimodal EvaluationUrban Environments

  17. CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?

    Aug 6, 2026Zijie Wang, Chen Zhong, Wei HeChange DetectionOpen-Vocabulary Object Detection

  18. IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers

    Aug 5, 2026Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani +1Vision TransformerVisual Perception

  19. ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making

    Aug 5, 2026Ningxin Pan, Hanyu Li, Yehui TangVisual Perception

  20. DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

    Aug 5, 2026Haotian Yang, Zhile Yang, Huiyu Zhou +1Indoor Scene GenerationHuman Motion Generation

  21. HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

    Aug 3, 2026Jin Cui, Chuanchang Su, Jiayi Lu +3Ava-VlmVision Encoders

  22. Enhancing Visual Perception in Foggy Conditions via Multiclass Fog Density Modeling

    Aug 3, 2026Mohamad Mofeed Chaar, Galia WeidlFogAutonomous Driving Perception

  23. Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

    Jul 29, 2026Mingkuan Feng, Zhengqi Wen, Jianhua TaoLong Visual-Token SequencesMultimodal Large Language Models

  24. Real-time Reconstruction of Human Visual Perception from fMRI

    Jul 23, 2026Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva +10Functional Magnetic Resonance ImagingNeuroscience

  25. TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

    Jul 23, 2026Ke Ma, Yifei Wang, Meng Wang +1Large-Scale Robot Demonstration DatasetsMicroscopy

  26. Associative Emotional Learning in Convolutional Neural Networks

    Jul 21, 2026Seowung Leem, Andreas Keil, Mingzhou Ding +1Dense Associative MemoryNeural Network

  27. MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

    Jul 21, 2026Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou +2Recent Vision-Language ModelsVisual Perception

  28. Can Multimodal Large Language Models Understand OCT?

    Jul 18, 2026Baochen Fu, Wenzhi Deng, Baihao Jin +5Optical Coherence TomographyMultimodal Benchmarks

  29. Do Vision Encoders Exhibit Human-like Color Thresholds?

    Jul 17, 2026Engy Ehab, Pablo Hernández-Cámara, Nahla Belal +3Vision EncodersVisual Perception

  30. Toward a mechanistic understanding of inference in visual cortex and diffusion models

    Jul 17, 2026Zeyu Yun, Alexander Belsten, Dasheng Bi +3Human Visual CortexDiffusion Models

  31. Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

    Jul 10, 2026Junfei Zhan, Haoxun Shen, Mingang Guo +2Visual PerceptionBottlenecks

  32. Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers

    Jul 10, 2026Ibrahim Batuhan Akkaya, Kishaan Jeeveswaran, Bahram Zonooz +1Self-Supervised Vision TransformersVisual Perception

  33. TDSal: Task-Based Top-Down Saliency Prediction Model

    Jul 10, 2026Can Mizrakli, Tolga K. CapinSaliencyMultiple Vision Tasks

  34. REMIND: RE-Identification with Memory for INDoor Navigation

    Jul 10, 2026Pablo Diaz-Pereda, Alejandro Rodriguez-Ramos, David Perez-Saura +1Multi-Object TrackingRe-Identification

  35. On Locality and Length Generalization in Visual Reasoning

    Jul 10, 2026Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3Visual PerceptionVision Foundation Models

  36. Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images

    Jul 9, 2026Matthias Tangemann, Benjamin Lo, Zygmunt Pizlo +3Geometric CuesVisual Perception

  37. Texture Representations in Deep Vision Models: Comparing CNNs, Vision Transformers, and Human Perception

    Jul 9, 2026Ludovica de Paolis, Marco Baroni, Alessandro Laio +1Visual PerceptionConvolutional Neural Networks

  38. A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation

    Jul 9, 2026Liuyi Wang, Kai Sheng, Zongtao He +8Vision-Language NavigationVisual Perception

  39. Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

    Jul 1, 2026Yiqian Liu, Iuliia Kotseruba, John K. TsotsosVisual PerceptionLinguistics

  40. Rethinking Generic Object Tracking Toward Human-Level Perceptual Intelligence

    Jul 1, 2026Shih-Fang ChenMulti-Object TrackingVisual Perception

  41. Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

    Jul 1, 2026Ziyu Ma, Shidong Yang, Yuxiang Ji +5Fine-Grained PerceptionRecent Vision-Language Models

  42. What Does the Brain See? Multiview Neural Representations to Demystify the Brain-Visual Alignment

    Jun 24, 2026Salini Yadav, Taveena Lotey, Pravendra Singh +1Electroencephalography DecodingVisual Perception

  43. M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection

    Jun 23, 2026Wei Bao, Siqi Li, Shouan Pan +2Cross-Modal DistillationVisual Perception

  44. Dual-Stream EEG Decoding for 3D Visual Perception

    Jun 20, 2026Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro +1Electroencephalography Decoding3D Perception

  45. Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation

    Jun 18, 2026Fatma Youssef Mohammed, Grzegorz Malczyk, Kostas AlexisViewpoint-Dependent Active PerceptionAutonomous Navigation

  46. Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

    Jun 16, 2026Logan Mann, Yi Xia, Ajit Saravanan +6Vision-Language Foundation ModelsVisual Perception

  47. VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

    Jun 14, 2026Zinan Liu, Eric Zheng, Soumyaratna Debnath +3Spiking Neural NetworksTime-To-First-Spike

  48. Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

    Jun 13, 2026Marta Vallejo, Siwen WangRecent Vision-Language ModelsVisual Perception

  49. From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

    Jun 8, 2026Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu +1Multimodal Large Language ModelsLarge Audio Language Models

  50. CSFlow: Aligning Flow Matching with Human Contrast Sensitivity

    Jun 7, 2026Malgorzata Galinska, Bart Pogodzinski, Jan Eric LenssenContrastive Flow MatchingConditional Flow Matching

  51. The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders?

    Jun 5, 2026Rishabh Jain, Naomi HarteVisual Perception