Memory Agent Benchmarks

Momentum

16 papers in the last four weeks, up 167% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 90

All topics
CardsList
  1. M3^3Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

    Jun 5, 2026Zhengjun Huang, Wenxuan Liu, Zhoujin Tian +6Multimodal GroundingEfficient Multimodal Inference

  2. SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

    Jun 4, 2026Wenxuan Wang, Haoyu Sun, Fukuan Hou +4Persistent Memory for Language ModelsLong-Horizon Agent Evaluation

  3. LifeSide: Benchmarking Agents as Lifelong Digital Companions

    Jun 3, 2026Yuqian Wu, Zhijie Deng, Wei Chen +8Long-Horizon Agent EvaluationAI Companions

  4. eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents

    Jun 2, 2026A. Haroon Rasheed, Maria KabtoulLLM Agent MemoryMemory Agent Benchmarks

  5. Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

    May 30, 2026Adril Putra Merin, David Anugraha, Ayu Purwarianti +1Agent MemoryTemporal Reasoning

  6. EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

    May 29, 2026Rosario Forte, Giuseppe Lando, Antonino FurnariVLM EvaluationStreaming Video Understanding

  7. WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

    May 28, 2026Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu +14Multimodal MemoryLLM Agent Memory

  8. MemFail: Stress-Testing Failure Modes of LLM Memory Systems

    May 26, 2026Ishir Garg, Neel Kolhe, Dawn Song +1LLM Agent MemoryLLM Memory

  9. MemGym: a Long-Horizon Memory Environment for LLM Agents

    May 20, 2026Wujiang Xu, Yu Wang, Kai Mei +8LLM Agent MemoryLLM Agent Evaluation

  10. MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

    May 18, 2026Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh +3Agent MemoryLong-Horizon Agent Evaluation

  11. EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

    May 18, 2026Yuyao Wang, Zhongjian Zhang, Mo Chi +7LLM Agent MemoryLLM Agent Evaluation

  12. GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations

    May 14, 2026Jingbo Yang, Kwei-Herng Lai, Xiaowen Wang +3Conversational MemoryLLM Agent Evaluation

  13. MEME: Multi-entity & Evolving Memory Evaluation

    May 12, 2026Seokwon Jung, Alexander Rubinstein, Arnas Uselis +2Agent MemoryPersistent Memory for Language Models

  14. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Agent MemoryHealthcare

  15. When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

    May 8, 2026Jiaqi Shao, Yiyi Lu, Yunzhen Zhang +1Agent MemoryAI Agent Evaluation

  16. STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

    May 7, 2026Hanxiang Chao, Yihan Bai, Rui Sheng +2Agent MemoryLLM Agent Evaluation

  17. From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

    Apr 21, 2026Md Nayem Uddin, Kumar Shubham, Eduardo Blanco +2Long-Horizon Agent EvaluationAI Agent Benchmarks

  18. Evaluating Memory Structure in LLM Agents

    Feb 11, 2026Alina Shutova, Alexandra Olenina, Ivan Vinogradov +1LLM Agent MemoryLLM Agent Evaluation

  19. EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

    Jan 23, 2026Xinze Li, Ziyue Zhu, Siyuan Liu +4Episodic MemoryLong-Horizon Agent Evaluation

  20. Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

    Jul 7, 2025Yuanzhe Hu, Yu Wang, Julian McAuleyLLM Agent MemoryLLM Agent Evaluation