Memory-Augmented VLMs

VLM: Vision-Language Model

Latest papers 90

All topics
CardsList
  1. UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling

    Sep 11, 2026Wei Li, Rui Shao, Jie He +3Memory-Augmented VLMsVisuomotor Policy Learning

  2. Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

    Sep 11, 2026Weitong Cai, Hang Zhang, Yukai Huang +6Memory-Augmented VLMsEfficient VLM Inference

  3. Whose record is this? Diagnosing and authorizing record use in personalized multimodal models

    Sep 7, 2026Xinyu Mao, Junsi Li, Chenyang Liu +2Memory-Augmented VLMsMultimodal Model Evaluation

  4. Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

    Sep 3, 2026Hongyu Qu, Guangming Yao, Ling Xing +7Memory-Augmented VLMsVideo Understanding

  5. Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations

    Sep 3, 2026Yunao Zheng, Bin Wen, Xiaojie Wang +12Memory-Augmented VLMsRepresentation Learning

  6. Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQA

    Sep 1, 2026Hai-Dang Nguyen, Huy-Hieu PhamMemory-Augmented VLMsVisual Question Answering

  7. SlideBank: A Persistent Hierarchical Evidence Bank for Consistent Whole-Slide Reasoning

    Aug 31, 2026Beidi Zhao, Gexin Huang, Ciro Zhang +6Memory-Augmented VLMsMedical VQA

  8. Good Memory Has ECC: Evaluating the Memory of Vision-Language Models Beyond Accuracy

    Aug 31, 2026Shmuel Berman, Jia DengVLM EvaluationMemory-Augmented VLMs

  9. Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

    Aug 31, 2026Xinru Jiang, Lin Zhao, Xi Xiao +7Memory-Augmented VLMsStreaming Video Understanding

  10. AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies

    Aug 30, 2026Hongbo Gao, Zeyu Ni, Xin Wen +4Memory-Augmented VLMsRobotic Manipulation

  11. Spatial Memory Agent: Experience-Grounded Procedural Memory for Spatial Intelligence

    Aug 13, 2026Haokai Zhang, Yuhang Ding, Yunshu Zhou +5Memory-Augmented VLMsVisual Spatial Reasoning

  12. DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

    Aug 12, 2026Yan Deng, Fei XuMemory-Augmented VLMsDiffusion-Based Planning

  13. StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

    Aug 11, 2026Muxin Fu, Yifan Zhang, Wentao Zhang +5Memory-Augmented VLMsStreaming Video Understanding

  14. Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

    Aug 11, 2026Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3Memory-Augmented VLMsVision-Language Models

  15. DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

    Aug 11, 2026Zebin Xing, Yupeng Zheng, Qiang Chen +10Memory-Augmented VLMsEnd-to-End Autonomous Driving

  16. Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

    Aug 8, 2026Gabriele La Malfa, Nitay Alon, Emanuele La Malfa +2VLM EvaluationMemory-Augmented VLMs

  17. Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

    Aug 7, 2026Yeeun Choi, Youngbeom Yoo, Joon-Young Lee +2Memory-Augmented VLMsEpisodic Memory

  18. StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

    Aug 6, 2026Xichen Zhang, Guankai Li, Yinghao Zhu +6Memory-Augmented VLMsStreaming Video Understanding

  19. BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

    Aug 5, 2026Peiyan Li, Yuze Zhu, Yixiang Chen +10Memory-Augmented VLMsGeneralization in Robotic Manipulation

  20. When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

    Aug 5, 2026Yushi Sun, Yanjie ZhangMemory-Augmented VLMsVisual Grounding

  21. ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

    Aug 3, 2026Yuzhi Huang, Weijue Bu, Ziyi Xiong +4Memory-Augmented VLMsLong-Horizon Robotic Manipulation

  22. TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

    Aug 3, 2026Kang Liu, Zijing Wang, Yongkang Liu +5Memory-Augmented VLMsVisual Reasoning

  23. Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

    Aug 3, 2026Ashfak Yeafi, Mehedi Hasan, Md Khairul IslamMemory-Augmented VLMsVision-Language Models

  24. PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

    Aug 2, 2026Jingyu Sun, Yan Lin, Yuyang Xue +10Memory-Augmented VLMsMultimodal Memory

  25. HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

    Jul 31, 2026An Liu, Bingxi Liu, Hongyu Ding +6Memory-Augmented VLMsVision-Language Navigation

  26. ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

    Jul 30, 2026Mingkang Dong, Muxin Pu, Jie Li +8Memory-Augmented VLMsStreaming Video Understanding

  27. Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

    Jul 28, 2026Hong Chen, Kang Chen, Yuxuan Fan +4Memory-Augmented VLMsVisual Question Answering