Visual Cues

Momentum

5 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 33

All topics
CardsList
  1. Diff-RF: Mutually Reinforced Image Registration and Fusion via Degradation-Aware Learning

    Sep 23, 2026Xunpeng Yi, Zaixi Du, Qinglong Yan +3Visible Image FusionQuery-Specific Degradation-Aware Representation

  2. Visual Cue Guided Video Planning for Generalizable Robot Navigation

    Sep 15, 2026Hojin Lee, Sizhe Lester Li, Maximilian Hilger +4Object Goal NavigationRobot Navigation

  3. From Model Patterns to Abstract Semantics in Compositional Zero-Shot Learning

    Sep 14, 2026Weize Li, Zhicheng Zhao, Fei SuZero-Shot Composed Image RetrievalZero-Shot

  4. Localized Visual Feature Aggregation via Focus Pooling for Visuomotor Policies

    Sep 8, 2026Ruiyu Wang, Zheyu Zhuang, Danica Kragic +1Visuomotor PolicyGlobal Average Pooling

  5. InfluenceField: A Differentiable Field with Interventionally Identifiable Causal Structure for Multimodal World Modeling

    Sep 7, 2026Zihao Yang, Zijia Wang, Zhiqiu HuangLatent Feature InterventionsMultimodal Large Language Models

  6. From Visual Cues to Spoken Narration: Rethinking Audio Description

    Sep 1, 2026Akshita Gupta, Aditya Arora, Federico Tombari +2Video CaptioningAudio Understanding

  7. GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures

    Aug 31, 2026Yanran Xu, Chuanhang Qiu, Yue Wang +2HazardVisual Cues

  8. Investigating the Visual Cues of CNNs for Vascular Segmentation: A Case Study in Microscopy and Fundus Imaging

    Jul 25, 2026Weslley dos Santos Silva, Cesar Henrique CominVessel SegmentationFundus Images

  9. ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

    Jul 23, 2026Han Li, Si Liu, Zehao Huang +6Spatio-Temporal ReasoningMultimodal Large Language Models

  10. Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction

    Jul 22, 2026Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung +1Multimodal AlignmentVisual Cues

  11. Spotted: Location-informed Reidentification of Hyenas and Leopards in Camera Trap Surveys

    Jul 1, 2026Halil Sina Kelebek, Julia Hindel, Kobus Hoffman +9Animal Re-IdentificationRe-Identification

  12. Fusing Complementary Multi-view Features for Screen-Based Eye Tracking

    Jun 30, 2026Chang Liu, Jiaqi Liu, Chengwen Zhang +6Gaze Target EstimationMultimodal Dataset

  13. Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

    Jun 29, 2026Kai Jiang, Ruishu Zhu, Siqi Huang +2Latent Visual ReasoningMultimodal Large Language Models

  14. DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

    Jun 25, 2026Geng Li, Yuxin PengFine-Grained PerceptionMultimodal Benchmarks

  15. The Power of Light: Improving Synthetic-to-Real Domain Adaptation through Physically-Based Indirect Illumination

    Jun 21, 2026Hooman Tavakoli Ghinani, Tatjana Legler, Martin RuskowskiSynthetic-To-Real Domain GapObject Detection

  16. StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

    Jun 18, 2026Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal +2Large Language Model BiasStylistic Fidelity

  17. Beyond Visual Cues: CoT-Enhanced Reasoning for Semi-supervised Medical Image Segmentation

    Jun 16, 2026Yuming Chen, Yuxin Xie, Tao Zhou +1Semi-Supervised Medical Image SegmentationDiagnosis

  18. LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

    Jun 15, 2026Zhou Tao, Fang Zhang, Zewen Ding +5Fine-Grained PerceptionVisual Cues

  19. AutoMine Solution for AV2 2026 Scenario Mining Challenge

    Jun 10, 2026Songliang Cao, Jiele Zhao, Yuru Wang +10Autonomous DrivingNaturalistic Driving Data

  20. ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation

    Jun 4, 2026Kanghui Tian, Siyuan Liu, Ziang Yan +3Multimodal ReasoningVisual Cues

  21. Vision-Language Models Suppress Female Representations Under Ambiguous Input

    May 29, 2026Arnau Marin-Llobet, Simon Henniger, Mahzarin R. BanajiGenderVisual Cues

  22. The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

    May 23, 2026Dingling Yao, Andrea Polesello, Adeel Pervez +2Scientific DiscoveryRepresentation Learning

  23. From Model Uncertainty to Human Attention: Localization-Aware Visual Cues for Scalable Annotation Review

    May 12, 2026Moussa Kassem Sbeyti, Joshua Holstein, Philipp Spitzer +2Automatic LabellingAnnotations

  24. Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

    May 11, 2026Qingxin Xiao, Peilin Zhao, Yangyang Zhao +2Contrastive DecodingLarge Language Model Hallucination

  25. Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

    May 9, 2026Tri Cao, Khoi Le, Thong Nguyen +7Video Multimodal Large Language ModelsSpatio-Temporal Reasoning

  26. Object-Level Explanations for Image Geolocation Models: a GeoGuessr use-case

    Apr 29, 2026Emilie Durrieu, Christophe Hurter, Philippe Muller +1Cross-View Geo-LocalizationSemantic Region

  27. Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

    Apr 26, 2026Zehua Cheng, Wei Dai, Jiahao SunMultimodal Retrieval Augmented GenerationAnonymization

  28. Low Light Image Enhancement Challenge at NTIRE 2026

    Apr 19, 2026George Ciubotariu, Sharif S M A, Abdur Rehman +90Low-Light Image EnhancementLow-Resolution

  29. Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID

    Apr 16, 2026Jiaxuan Li, Xin Wen, Zhihang LiRe-IdentificationPedestrian Detection

  30. VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

    Mar 23, 2026Xinghan Li, Junhao Xu, Jingjing ChenDeepfake DetectionDigital Forensics