Visual Embeddings

Momentum

6 papers in the last four weeks, down 25% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 65

All topics
CardsList
  1. Sparse-View Interpretable 3D Animal Behavior Representations for Neural Encoding and Decoding

    Sep 28, 2026Xinming Dai, Qihang Jin, Tianshu Tan +8Sparse-ViewVisual Embeddings

  2. Domain Recentering and Confidence-Weighted Prior Calibration for Vision-Language Models

    Sep 24, 2026Youngeun Seol, Jimin Shin, Heeseo Yoon +1Visual EmbeddingsLogit Lens

  3. Hierarchical Prompt Learning for Hyperbolic Vision-Language Models

    Sep 21, 2026Andro Erdelez, Pascal Mettes, Behzad BozorgtabarMultiple Prompt Learning FrameworksVisual Embeddings

  4. InterHier: Learning Interconnected Hierarchical Semantics for Open-Vocabulary Object Detection

    Sep 21, 2026Yeong-Jin Kim, Ho-Joong Kim, Seong-Whan LeeOpen-Vocabulary Object DetectionSemantic Representations

  5. MotionJEPA: Preventing Temporal Feature Collapse by Capturing Visual Changes in Latent Space

    Sep 20, 2026Markus Karmann, Shile Li, Christian Internò +10Video Joint Embedding Predictive ArchitectureS-Jepa

  6. GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting

    Sep 8, 2026Thodoris Betsas, Anastasios Doulamis, Andreas Georgopoulos3D Scene UnderstandingVisual Embeddings

  7. ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

    Sep 3, 2026Javier del Pino, Salvador Rodríguez, Alejandro Garabito +2Visual EmbeddingsMulti-Object Tracking

  8. Allocate Before You Embed: Adaptive Visual Input Allocation for Video Embeddings

    Sep 1, 2026Song Jin, Zhongtao Jiang, Chenglei Shen +5Visual EmbeddingsLong Videos

  9. Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval

    Aug 30, 2026Trishan Singha Roy, Arkadeep Acharya, Vishwajeet Kumar +2Multimodal RetrievalVisual Document Retrieval

  10. TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

    Aug 13, 2026Yi-Chung Chen, Philip Jacobson, Tom Lampo +6Fine-Grained Video UnderstandingVisual Embeddings

  11. The Impact of Temporal Context Length and Encoding Strategies on Self-Supervised ECG Representation Learning

    Aug 13, 2026Ahmed Sameh, Ramzi Al-Sharawi, Yogatheesan VaratharajahElectrocardiogram Foundation ModelsRepresentation Learning

  12. P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

    Aug 10, 2026Amoon Jamzad, Dilakshan Srikanthan, Faranak Akbarifar +2Visual EmbeddingsPrincipal Component Analysis

  13. LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search

    Aug 10, 2026Yulun Zhang, Zixu Li, Zhiwei Chen +6Pedestrian DetectionRe-Identification

  14. SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

    Aug 9, 2026Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen HalvorsenRe-IdentificationVision-Language Alignment

  15. AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

    Aug 9, 2026Haoyu Zuo, Yibo Yan, Xin Zou +4Visual Document RetrievalVisual Embeddings

  16. Topometric Autonomous Vehicle Localization by Combining Visual Embeddings and Feed-Forward 3D Models

    Aug 6, 2026Eulogio Quemada-Torres, Alberto Jaenal, Francisco-Angel Moreno +1Sequential Visual LocalizationIndoor Localization

  17. Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data

    Aug 2, 2026Advait Pavuluri, Shamik Karkhanis, Uzma MushtaqueNaturalistic Driving DataVideo Joint Embedding Predictive Architecture

  18. Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy

    Aug 1, 2026Simiao Sun, Kenneth Ng, Lynn Lee +6MicroscopyVisual Embeddings

  19. Explaining Image Similarity with Automatically Extracted Concept Activation Vectors

    Jul 30, 2026Isaac Roberts, Petra Bevandic, Alexander Schulz +1Similarity and MetricsVisual Embeddings

  20. Controlling Embedding Spaces with Text-Conditioned Transformations

    Jul 24, 2026Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani +2Visual EmbeddingsLatent Space

  21. InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection

    Jul 18, 2026Jikang Cheng, Hao Shen, Xueyi Zhang +4Face Forgery DetectionForgeries

  22. A Good Initialization is All You Need for Faithful Visual Attribution

    Jul 7, 2026Zihan Gu, Jiayu Wang, Hua Zhang +1Visual Embeddings

  23. Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors

    Jun 28, 2026Guanyu Lu, Fang Zhou, Cheqing JinMultimodal Anomaly DetectionLogical Anomalies

  24. Spatially Localized Image Degradation Embeddings for Image Quality Assessment

    Jun 28, 2026Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu +2Query-Specific Degradation-Aware RepresentationImage Quality Assessment

  25. ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

    Jun 26, 2026Xiangyu Sai, Meysam Madadi, Sergio Escalera +1Virtual Try-OnConditional Flow Matching

  26. Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

    Jun 23, 2026Jonas Klotz, Cassio F. Dantas, Pallavi Jain +2InterpretabilitySparse Supervision

  27. Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

    Jun 22, 2026Seyed Hamid Reza Roodabeh, Zongyu Li, Homa AlemzadehSurgical RobotsSurgery

  28. LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

    Jun 22, 2026Tongkun Guan, Haocheng Wang, Wei Shen +1Visual Document RetrievalMultimodal Retrieval

  29. LARE: Low-Attention Region Encoding for Text-Image Retrieval

    Jun 17, 2026Abdulmalik Alquwayfili, Faisal Almeshal, Jumanah Almajnouni +8Composed Image RetrievalFine-Grained Perception

  30. Ghost Vectors: Soft-Deleted Embeddings Remain Reconstructible in HNSW Vector Databases

    Jun 16, 2026Chandranil Chakraborttii, Jackeline García Alvarado, Sitora Abdulofizova +1Vector DatabaseRetrieval-Augmented Generation Pipelines

  31. Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

    Jun 13, 2026Shubhang Bhatnagar, Dheeraj Baiju, Narendra AhujaVisual EmbeddingsVision Encoders

  32. MVEB: Massive Video Embedding Benchmark

    Jun 12, 2026Adnan El Assadi, Roman Solomatin, Isaac Chung +13Visual EmbeddingsMultimodal Benchmarks

  33. Vision Transformers for Face Recognition Need More Registers

    Jun 10, 2026Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira +2Vision TransformerVisual Embeddings

  34. TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

    Jun 5, 2026Sweta Mahajan, Sukrut Rao, Jiahao Xie +2Vision-Language AlignmentVisual Embeddings

  35. LatentWave: JEPA Pretraining for Wireless Foundation Models

    Jun 4, 2026Ahmed Mohamed, Ahmed Aboulfotouh, Hatem Abou-ZeidWireless Foundation ModelsJoint-Embedding Predictive Architectures

  36. Noise-Aware Visual Representation Learning for Medical Visual Question Answering

    Jun 4, 2026I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar +1Medical Visual Question AnsweringVisual Embeddings

  37. Spatial Blindness in Whole-Slide Multiple Instance Learning

    May 17, 2026Xiangyu Li, Ran SuWhole-Slide ImagesMultiple Instance Learning

  38. Rethinking the Good Enough Embedding for Easy Few-Shot Learning

    May 13, 2026Michael Karnes, Alper YilmazFew-Shot LearningVisual Embeddings

  39. Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

    May 13, 2026Hao Sun, Zi-Jun Ding, Da-Wei ZhouClass-Incremental LearningVisual Embeddings

  40. PreFIQs: Face Image Quality Is What Survives Pruning

    May 13, 2026Jan Niklas Kolf, Guray Ozgur, Andrea Atzori +4Face Recognition ModelImage Quality Assessment

  41. Learning to Align Generative Appearance Priors for Fine-grained Image Retrieval

    May 11, 2026Shijie Wang, Yadan Luo, Zijian Wang +2Fine-Grained PerceptionGeneralized Category Discovery

  42. ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality

    May 10, 2026Feng Ding, Haisheng Fu, Jie Liang +3Image Quality AssessmentLearned Image Compression

  43. Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation

    May 9, 2026Yang Xiao, Huiyuan Chen, Kaiyuan Deng +5Short Video BurstsVideo Compression

  44. Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

    May 8, 2026Pascal Tilli, Mohsen MesgarVisual Document RetrievalVisual Embeddings

  45. APEX: Assumption-free Projection-based Embedding eXamination Metric for Image Quality Assessment

    May 8, 2026Caterina Gallegati, Monica Bianchini, Franco Scarselli +2Image Quality AssessmentVisual Embeddings

  46. Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search

    May 7, 2026Faisal Aljehrai, Mohammed A. Alkhrashi, Alreem Almuhrij +6Visual EmbeddingsSaliency

  47. When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

    May 7, 2026Harshvardhan Saini, Samyak Jha, Yiming Tang +1Large Language Model HallucinationHallucination Mitigation

  48. Exploring Clustering Capability of Inpainting Model Embeddings for Pattern-based Individual Identification

    May 6, 2026Jens van Bijsterveld, Daniele Avitabile, Fons J. Verbeek +1Visual EmbeddingsMorphogenesis

  49. Intermediate Representations are Strong AI-Generated Image Detectors

    May 5, 2026Zhenhan Huang, Pin-Yu Chen, Tejaswini Pedapati +1Ai-Generated Image DetectionUnsupervised Detection

  50. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Recent Vision-Language ModelsVisual Memory

  51. Faithful Extreme Image Rescaling with Learnable Reversible Transformation and Semantic Priors

    May 1, 2026Hao Wei, Yanhui Zhou, Chenyang Ge +2Image RestorationResidual Conditional Diffusion Model

  52. Generalizable Sparse-View 3D Reconstruction from Unconstrained Images

    Apr 30, 2026Vinayak Gupta, Chih-Hao Lin, Shenlong Wang +23D ReconstructionSparse-View

  53. Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

    Apr 27, 2026Zhiheng Liu, Weiming Ren, Xiaoke Huang +12Multimodal UnderstandingMultimodal Model

  54. ID-Eraser: Proactive Defense Against Face Swapping via Identity Perturbation

    Apr 23, 2026Junyan Luo, Peipeng Yu, Jianwei Fei +4Deepfake DetectionModel-Agnostic Defense