Visual Representations

Momentum

14 papers in the last four weeks, up 56% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 108

All topics
CardsList
  1. NeuronEye: Query-Guided Visual Concept Activation for Vision-Language Reasoning

    Sep 29, 2026Ruiyu Yan, Bowen Chen, Shaowen Wan +1Recent Vision-Language ModelsVisual Representations

  2. VLM Fine-Tuning for End-to-End Combinatorial Optimization

    Sep 29, 2026Qingsong Yan, Xia Jiang, Yaoxin Wu +3Combinatorial OptimizationVisual Representations

  3. Where Predictive Supervision Goes Shapes What VLA Policies Learn

    Sep 29, 2026Hanseul Kim, Jewon Yeom, Youngjoon Jeong +2Generalizable Vision-Language-Action PoliciesAction Prediction

  4. W2Rep: Learning Visual Representations by Watching the World Change

    Sep 28, 2026Wen Huang, Hang Guo, Jiarui Yang +3Fine-Grained Video UnderstandingVision Encoders

  5. When Explanations Cannot Be Read: Measuring and Correcting SHAP and LIME Rendering for Right-to-Left Languages

    Sep 23, 2026Rameesha Zia, Muhammad Shahid Iqbal MalikExplainable AI MethodsShapley Additive Explanations

  6. Visual Jev: Accurate and Efficient Decisions from Shared Visual Context

    Sep 22, 2026Guanxu Yu, Yuhang YaoVisual RepresentationsVista

  7. Object-Centric Conditioning for Visuomotor Flow Matching

    Sep 21, 2026Jijie Li, Xu Yang, Junhong Zou +4Flow-Matching Vision-Language-ActionRobotic Manipulation Policies

  8. Positive Pair Geometry Matters: Optimal Transport for Contrastive Learning of Visual Representations

    Sep 21, 2026Akshit Nanda, Shahzad Ahmad, Ram Prasad PadhyContrastive LearningData Augmentation

  9. Training-Adaptive Convolutional Sparse Coding via Information Bottleneck for Robust Visual Representation

    Sep 16, 2026Meng'en Qin, Yinchen Liu, Mingxuan Cui +1Information BottleneckSparsity

  10. An Ensemble-Based Self-Taught Learning Approach for Parking Space Classification Under Limited Data

    Sep 3, 2026Lucas de Oliveira Cunha, Joelton Deonei Gotz, Paulo Lisboa de Almeida +1Domain AdaptationAutoencoder Architectures

  11. Position: Unlabeled IS NOT Equal to No Human Supervision in Visual Learning

    Sep 2, 2026Dong LaoUnlabeled DataUnsupervised

  12. RingMoClaw: An Experience-Inspired Multi-Agent Framework for Self-Evolving Research in Remote Sensing

    Sep 1, 2026Kaiyue Kang, Qixuan He, Peijin Wang +9Remote SensingClaw-Like Agent

  13. Less Is More: Balancing Positive and Negative Space in Visual Concept Blending

    Aug 31, 2026Shishi Xiao, Adam J. Coscia, David H. LaidlawVisual RepresentationsInpainting

  14. SVI2LoD3: Agent-Driven Reconstruction of LoD3 Facade Openings in Semantic 3D City Models from Volunteered Street View Imagery using Large Language and Visual Models

    Aug 30, 2026Elmehdi Kanna, Lukas Arzoumanidis, Huynh Duc An Son Nguyen +1Semantic SegmentationVisual Representations

  15. ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models

    Aug 30, 2026Shaghayegh Kolli, Sina Emami, Moreno D'Incà +4Modern Text-To-Image ModelsStereotype Mitigation

  16. Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

    Aug 26, 2026Luca Bux, Thiago Rios, Ingo Scholtes +2Visual RepresentationsShapes Constraint Language

  17. MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

    Aug 13, 2026Ashok Urlana, L. D. M. S. Sai Teja, Vivek Hruday Kavuri +1Semantic MappingVisual Representations

  18. Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

    Aug 10, 2026Weijie Liang, Yuanfeng Song, Xing Chen +3Repository-Level Code UnderstandingCoding Agents

  19. Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

    Aug 9, 2026Jonathan Suprijadi, Raphael Stock, Moritz Langenberg +10Radiology Report GenerationCone-Beam Computed Tomography

  20. Three Necessary Principles for Self-Supervised Visual Representation Learning

    Aug 8, 2026Nikos Giakoumoglou, Paschalis Giakoumoglou, Tania StathakiSelf-Supervised RepresentationsSelf-Supervised Learning

  21. Learning visual representations for compositional analysis of artworks and photographs

    Aug 6, 2026Fatemeh Behrad, Tinne Tuytelaars, Johan WagemansVisual RepresentationsArt

  22. Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

    Aug 5, 2026Zehua Chen, Junyou Wang, Yuxuan Jiang +5Audio-Video GenerationText-To-Video Diffusion Models

  23. RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

    Aug 1, 2026Jiayang Yu, Jialun Zhong, Lei ZouKnowledge-Based Visual Question AnsweringLingdt-Vl-Ocr

  24. Contrastive Concept Importance: Explaining Pairwise Class Decisions Through Automatically Extracted Concept Representations

    Jul 30, 2026Roel Visser, Isaac Roberts, Barbara HammerContrastive LearningExplainability

  25. LU-500: A Logo Benchmark for Concept Unlearning

    Jul 27, 2026Keyu Li, Jin Gao, Jialing Zhang +1Visual RepresentationsSuppression

  26. Robot Learning to Communicate through Projected Visual Abstractions

    Jul 24, 2026Danyang Yan, Boyuan Wang, Jiaxun Liu +1Robot SystemsMotion Imitation

  27. Self-Supervised Learning of Structured Dynamics from Videos

    Jul 23, 2026Lukas Knobel, Andrew Zisserman, Yuki M. AsanoSelf-Supervised LearningLatent Motion

  28. Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

    Jul 23, 2026Mingyu Wang, Weilin Jin, Wenbo Li +3Spatial ReasoningObject Hallucination

  29. VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

    Jul 22, 2026Yanbin Wei, Yang Chen, Renling Gan +7Graph-Based Retrieval Augmented GenerationKnowledge-Based Visual Question Answering

  30. Linguistic Context Recodes Visual Representations in Vision-Language Models

    Jul 21, 2026Brian Song, Michael A. Lepori, Ellie PavlickVisual RepresentationsCross-Modality

  31. Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?

    Jul 14, 2026Nusrat Munia, Tyler Ward, Nishat Nayla +2Self-Supervised LearningSelf-Supervised Representations

  32. ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

    Jul 10, 2026Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani +3Explainable Artificial IntelligenceTrustworthy Artificial Intelligence

  33. Multimodal Scenario Similarity Search for Autonomous Driving

    Jul 10, 2026Tamás Matuszka, András Tamásy, Balázs SzolárNaturalistic Driving DataAutonomous Driving

  34. Dive Into the Implicit Biases of Low-rank Vision-language Alignment

    Jul 9, 2026Mingjia Shi, Shuo Wang, Xiaobo Wang +7Vision-Language AlignmentFeature Alignment

  35. Billions of Sketches Reveal Hidden Cultural Variation in Human Concepts

    Jul 8, 2026Arianna Pera, Mauro Martino, Nima Dehmamy +3Cross-Cultural VariationSketches

  36. VisTCP: A Visualization Framework to Construct Knowledge-Graph-Based Representation for Traditional Chinese Painting

    Jul 7, 2026Zhiguang Zhou, Fengling Zheng, Miaoxin Hu +9Visual RepresentationsArt

  37. VEIL: How Visual Encoding Hijacking Induces Bias In Vision Models

    Jul 6, 2026Suranjana Sooraj, Xuyang Chen, Madhumitha Venkatesan +1Visual AnalyticsVisual Representations

  38. Show Me Examples: Inferring Visual Concepts from Image Sets

    Jul 2, 2026Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3Visual In-Context LearningVisual Representations

  39. Domain Generalization via Text-Anchored Information Bottleneck

    Jul 2, 2026Eunyi Lyou, Yunjeong Choi, Junho Lee +1Multimodal Domain GeneralizationDomain Invariance

  40. Beyond Heatmaps: Unsupervised Concept-Graph Reasoning for Interpretable Visual Explanation

    Jul 1, 2026Md Mohasin Hossain, Anar Amirli, Robert Leist +2HeatmapGradient-Weighted Class Activation Mapping

  41. Group-Equivariant Poincaré Convolutional Networks

    Jul 1, 2026Aiden Durrant, Rahul Baburajan, Georgios LeontidisRotation EquivarianceBatch Normalization

  42. Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

    Jul 1, 2026Yixin Ji, Fanghua Ye, Juntao Li +5Multi-Hop ReasoningAgentic Reasoning

  43. Information-Regularized Attention for Visual-Centric Reasoning

    Jul 1, 2026Guohao Sun, Xiaofang Wang, Yash Patel +3Recent Vision-Language ModelsWeak Visual Grounding

  44. Making Sense of Touch from the Child's View for Contrastive Learning

    Jun 30, 2026Max Whitton, Zecheng Wang, Puchen Liu +12TactileDevelopmental Trajectories

  45. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Multimodal GenerationLarge Multimodal Models

  46. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

    Jun 25, 2026Sicheng Zhang, Muzammal Naseer, Binzhu Xie +5Contrastive Language-Image Pre-Training ModelVisual Representations

  47. Meta-learning as a principle for human-like visual representations

    Jun 24, 2026Can Demircan, Marcel Binz, Alireza Modirshanechi +1Meta-LearningVisual Representations

  48. Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds

    Jun 23, 2026Thomas Fel, Matthew Kowal, Mozes Jacobs +22Manifold PerspectiveSparsity

  49. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Latent Visual ReasoningLarge Multimodal Models

  50. The Hidden Evolution of Disguised Visual Context inside the VLM

    Jun 18, 2026Wish Suharitdamrong, Tony Alex, Muhammad Awais +1Long Visual-Token SequencesVisual Representations

  51. SketchXplain: Intuitive Visual Explanations of Image Classifiers with Sketches

    Jun 16, 2026Wencan Zhang, Mario Michelessa, Xuejun Zhao +1XaiSketches

  52. Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

    Jun 8, 2026Eduardo Borges, Manuel Abreu, Luís Garrote +1Re-IdentificationAutonomous Driving