Memory-Augmented VLMs

VLM: Vision-Language Model

Latest papers 90

All topics
CardsList
  1. MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

    Jul 26, 2026Yuqi Liu, Shengju Qian, Tianyuan Qu +5Memory-Augmented VLMsEfficient VLM Inference

  2. Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

    Jul 22, 2026Penglei Sun, Yehua Huang, Zhuoli Tao +8Memory-Augmented VLMsAerial Robotics

  3. ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

    Jul 21, 2026Santiram Tiwari, Nishant Sinha, Kunal KislayMemory-Augmented VLMsKV Caching

  4. FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

    Jul 20, 2026Ruicheng Li, Qixiu Li, Ruichun Ma +8Memory-Augmented VLMsLanguage-Conditioned Robot Manipulation

  5. VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

    Jul 20, 2026Yijian Li, Xiangru Mu, Changze Li +7Memory-Augmented VLMsAutonomous Parking

  6. Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

    Jul 20, 2026Lingrui Li, Nan Pu, Dong Zhao +4Memory-Augmented VLMsVLM Adaptation

  7. ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

    Jul 20, 2026Ting Huang, Zhenyu Zhang, Wenyuan Huang +2Memory-Augmented VLMsVisual Spatial Reasoning

  8. VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation

    Jul 16, 2026Xiaoran Xu, Yupeng Wu, Tianyu Xue +4Memory-Augmented VLMsRobot Navigation

  9. FOLIO: Focused Semantic Memory for Streaming Video Understanding

    Jul 14, 2026Haoyang Fan, Dhruv Parikh, Anvitha Ramachandran +4Memory-Augmented VLMsStreaming Video Understanding

  10. Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

    Jul 13, 2026Yu Qi, Hongyu Li, Shaofei Huang +6Memory-Augmented VLMsUAV Navigation

  11. SLVMBench: Skill Learning from Video Memory

    Jul 13, 2026Yudong Yang, Guangzhi Sun, Yixuan Li +1Memory-Augmented VLMsVideo-Language Models

  12. PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

    Jul 11, 2026Wenyuan Wang, Lianyu Hu, Hao Wang +1Memory-Augmented VLMsPhysical Reasoning

  13. TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

    Jul 9, 2026Yushen Liang, Yue Peng, Baosheng Jin +6Memory-Augmented VLMsVisuomotor Policy Learning

  14. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

    Jul 8, 2026Hongyu Qu, Jianzhe Gao, Xiaobin Hu +6Memory-Augmented VLMsRobotic Manipulation

  15. NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

    Jul 7, 2026Ziye Wang, Modi Shi, Chaojun Ni +5Memory-Augmented VLMsLong-Horizon Robotic Manipulation

  16. Latent Visual Cache for Video Reasoning

    Jul 1, 2026Yongheng Zhang, Zhipeng Xu, Hao Wu +4Memory-Augmented VLMsVision-Language Models

  17. ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

    Jun 27, 2026Guanglong Sun, Shuang Cui, Bo Lei +6Memory-Augmented VLMsVision-Language Models

  18. μμVLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models

    Jun 10, 2026Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky +6Memory-Augmented VLMsRecurrent Transformers

  19. Key-Gram: Extensible World Knowledge for Embodied Manipulation

    May 18, 2026Jingjing Fan, Siyuan Li, Botao Ren +1Memory-Augmented VLMsLanguage-Conditioned Robot Manipulation

  20. AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

    May 18, 2026Pan Wang, Yihao Hu, Xiujin Liu +3Memory-Augmented VLMsReward Shaping

  21. MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

    May 14, 2026Xiyu Ren, Zhaowei Wang, Yiming Du +11VLM EvaluationMemory-Augmented VLMs

  22. ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

    May 9, 2026Yanbin Hu, Jin Cui, Jiayi Lu +6Memory-Augmented VLMsLong-Horizon Robotic Manipulation

  23. Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

    May 1, 2026Siyuan Huang, Xiaoye Qu, Yafu Li +6Memory-Augmented VLMsVLM Robustness

  24. ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

    Mar 21, 2026Kanglong Fan, Tianhe Wu, Wen Wen +6Memory-Augmented VLMsVision-Language Models

  25. Vision-Language Memory for Spatial Reasoning

    Nov 25, 2025Zuntao Liu, Yi Du, Taimeng Fu +3Memory-Augmented VLMsVision-Language Models

  26. StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

    Date pendingJoya Chen, Zeyun Zhong, Mike Zheng ShouMemory-Augmented VLMsStreaming Video Understanding