Vision Encoders

Latest papers 153

All topics
CardsList
  1. Video Encoders Built on Image Representations

    Oct 5, 2026Jusheng Zhang, Wenhao Wang, Longqi Cai +3Vision Encoders

  2. A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

    Oct 4, 2026Yilin Yang, Jun-Tao Tang, Kengyi Wang +3Vision Encoders

  3. eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

    Oct 1, 2026Dehao Huang, Jianbang Liu, Jianpan Gao +7Diffusion-Based Vision-Language-ActionsOffline Reinforcement Learning

  4. CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

    Sep 30, 2026Yulong Liu, Xiaotian Han, Junyuan Shang +6Vision EncodersToken Compression

  5. MC-PanDA++: Simpler, Stronger, and More Robust Domain-Adaptive Panoptic Segmentation

    Sep 30, 2026Ivan Martinović, Josip Šarić, Yuki M. Asano +1Panoptic SegmentationDomain Adaptation

  6. Feature-Aware Token Attack for Compression-Triggered Stealthy Failures in Large Vision-Language Models

    Sep 30, 2026Shilinlu Yan, Bowen Chen, Yuechen Zhang +3Token CompressionVision Encoders

  7. PAIQ: Patch-Aligned Semantic Injection via Residual Rotation

    Sep 29, 2026Pinze Ren, Yuwei Zhang, Hao Chen +3Vision EncodersCross-Encoder

  8. Structured Visual Target Learning For Cross-Subject eeg-to-image retrieval

    Sep 29, 2026Salini Yadav, Taveena Lotey, Mickaël Coustaty +2Electroencephalography DecodingVision Encoders

  9. How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective

    Sep 29, 2026Janet Wang, Yunbei Zhang, Xiao Wang +1Medical Vision-Language ModelsSkin Lesion Classification

  10. EdgeVLN: Runtime-Aware Deployment Ready Quantized Vision Language Navigation Model

    Sep 28, 2026Rithvik Jonna, Man Namgung, Aakash Gurram +1Vision-Language NavigationResource-Constrained Edge Devices

  11. W2Rep: Learning Visual Representations by Watching the World Change

    Sep 28, 2026Wen Huang, Hang Guo, Jiarui Yang +3Fine-Grained Video UnderstandingVision Encoders

  12. WorldGuide: Learning Success-Failure Boundaries in Latent World Models for Vision-Language-Action Policies

    Sep 28, 2026Lin Liu, Lu Zhang, Ziying Song +6Latent World ModelsVision Encoders

  13. ConvCue: Complementary Visual Inductive Biases for Vision-Language Models

    Sep 28, 2026Zixuan Lan, Shichu SunRecent Vision-Language ModelsVision Encoders

  14. IronViT: Toward Efficient Generalist Visual Representation Learning

    Sep 24, 2026Jiaxi Huang, Yueqi Hu, Xin Zhu +13Vision EncodersRepresentation Quality

  15. Less is More: Encoder-only Audio-Visual Segmentation

    Sep 24, 2026Ilpo Viertola, Vladimir Iashin, Sophie Tötterström +1Video Object SegmentationVision Encoders

  16. Virtual Encoders in Multimodal Transformers

    Sep 22, 2026Katsuya Ogata, Yuta NakashimaDetection TransformerVision Encoders

  17. RoboMP-DINOv2: Prompts, Not Filters for Robust Robot Manipulation

    Sep 22, 2026Han Qi, Heng YangVisuomotor ControlRobot Systems

  18. Streaming Video Editing with Easy Adaptation

    Sep 21, 2026Yujia Hu, Jiajun Li, Zihao He +1Video EditingVideo Diffusion Models

  19. Video-STLayout Pre-training

    Sep 21, 2026Akash Abdu Jyothi, Greg MoriFine-Grained Video UnderstandingVision Encoders

  20. Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models

    Sep 16, 2026Shahram Najam Syed, Arthur Jakobsson, Prayuj Sachdev +1Vision-Language Model AdaptationDiffusion-Based Vision-Language-Actions

  21. Tables Decoded: DELTA for Structure, TARQA for Understanding

    Sep 15, 2026Jahanvi Rajput, Dhruv Kudale, Saikiran Kasturi +2Tabular DataQuestion-Answering Benchmarks

  22. High-Fidelity Video Quality Assessment with VQA-Specific Saliency

    Sep 15, 2026Hakan Emre Gedik, Shashank Gupta, Alan BovikVideo QualityVision Encoders

  23. Pre-PEFT Probing: Weight Statistics and Perturbation Robustness for Layer Selection in VLM Vision Encoders

    Sep 14, 2026Qingtao Xia, Jiahua Bao, Siyao Cheng +1Parameter-Efficient Fine-Tuning MethodsVision-Language Model Adaptation

  24. What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency

    Sep 12, 2026Luoyang Sun, Guoyang Xia, Fengfa Li +9Vision EncodersScaling

  25. BruNet: A Cross-Domain Transfer Framework for Bruise Segmentation

    Sep 11, 2026Qiming Wang, Richard J. Motley, Ebube E. Obi +2Skin Lesion ClassificationVision Encoders

  26. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual ReasoningVision Encoders

  27. Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs

    Sep 8, 2026Xiaofu Chen, Stella Frank, Yova KementchedjhievaVision EncodersDecoding

  28. CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding

    Sep 3, 2026Jing Jiang, Yiran Ling, Ruonan Li +2Streaming Video UnderstandingVision Encoders

  29. Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference

    Sep 1, 2026Reza Heidari, Hamed R. Tavakoli, Juho KannalaToken CompressionVision Encoders

  30. Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

    Aug 20, 2026Haoqiang Kang, Yinpeng Chen, Luyang Liu +5Latent Visual ReasoningMultimodal Reasoning

  31. CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

    Aug 19, 2026Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe +44DVision Encoders

  32. PXDepth: Pixel-Space Modeling for Structure Preserving Monocular Depth Estimation

    Aug 17, 2026Zhiyuan Yuan, Guanying Chen, Lingteng Qiu +3Monocular Depth EstimationDepth Estimation

  33. AVA-Encoder: Towards Agent-Native Video Representation Learning

    Aug 12, 2026Chuyue Li, Jinpeng Yu, Haozhe Wang +7Video AgentVision Encoders

  34. Where To Look? : Causal Tracing of Vision Encoders in VLM

    Aug 11, 2026Naren Kumar S, Tirth Bhatt, Mayank SinghRecent Vision-Language ModelsVision Encoders

  35. Label-Free Parkinson's Disease Screening from Face and Voice through Mechanistic Interpretability

    Aug 10, 2026Jiaheng Su, Yu SunDiseaseScreening

  36. Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

    Aug 7, 2026Rahul Murali Shankar, Titus von der Malsburg, Sebastian PadóGaze BehaviorVision Encoders

  37. Invisible Shortcuts: Why Vision Encoders Know Your Camera

    Aug 5, 2026Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos +2Vision EncodersEncoders

  38. Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

    Aug 5, 2026Weihan Cai, Hao Tan, Zichang Tan +2Ai-Generated Image DetectionVision Encoders

  39. Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

    Aug 5, 2026Hakyeong Kim, Ruicheng Wang, Chengtang Yao +2Dense PredictionVision Encoders

  40. Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training

    Aug 3, 2026Yanliang Huang, Zhuocheng Zhang, Peng Xie +5Visuomotor PolicyReachability

  41. Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

    Aug 3, 2026Jin Cui, Yanbin Hu, Xinyue Long +3Diffusion-Based Vision-Language-ActionsVision Encoders

  42. HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

    Aug 3, 2026Jin Cui, Chuanchang Su, Jiayi Lu +3Ava-VlmVision Encoders

  43. Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

    Aug 2, 2026Myeongkyun Kang, Yanting Yang, Xiaoxiao LiMedical Vision-Language ModelsVision Encoders

  44. RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning

    Jul 31, 2026Qian Wang, Longrui Chen, Peiran Sun +8Visual Geometry Grounded TransformerRobotic Perception

  45. FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

    Jul 31, 2026Li Lin, Wujun Xu, Weiwei Meng +3Vision EncodersEmbodied Artificial Intelligence

  46. MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

    Jul 29, 2026Yitao Zhu, Mengjun Liu, Yingji Fu +2Medical Vision-Language ModelsLong Visual-Token Sequences

  47. Rethinking Expert Training for Model Merging with Prompt Learning

    Jul 27, 2026Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno +3Continual Model MergingContrastive Language-Image Pre-Training Model

  48. UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

    Jul 25, 2026Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati +4Vision EncodersRecent Vision-Language Models

  49. LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

    Jul 24, 2026Xudong Liu, Bicheng Wan, Yulin JinOptical Character RecognitionVision Encoders

  50. Multimodal Pretraining for Generalizable EEG Representation Learning

    Jul 23, 2026Targol Bakhtiarvand, Jugal Kalita, Adham AtyabiElectroencephalography Foundation ModelsSeizure Detection

  51. Sparse Concept Channels in Frozen 3D CT Vision Encoders

    Jul 23, 2026Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen +1Medical Vision-Language ModelsFrozen Encoder

  52. Latent-Action-Guided Video-Language Feature Learning for Surgical Instrument-Tissue Interaction Recognition

    Jul 22, 2026Jiajun Cheng, Sainan Liu, Subarna Tripathi +2Diffusion-Based Vision-Language-ActionsVision Encoders