Memory Agent Benchmarks

Momentum

16 papers in the last four weeks, up 167% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 90

All topics
CardsList
  1. Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems

    Aug 5, 2026Kartikey Singh Bhandari, Aarya Wadhwani, Dhruv Kumar +1Temporal IREpisodic Memory

  2. EA-Graph: Artifact-Anchored Verification Memory for Coding Agents under Upstream Drift

    Aug 4, 2026Hwai-Jung Hsu, Cheng-Jan Chi, Hanna EverettAgent MemorySoftware Engineering Agents

  3. FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

    Aug 4, 2026Ben Wang, Kang Zhou, Lifan Guo +2Financial ServicesLLM Agent Memory

  4. When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary

    Aug 3, 2026Qiuyang Zhan, Rui Zhang, Sheng Guo +2Agent MemoryMemory Agent Benchmarks

  5. When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses

    Aug 3, 2026Haofei Sun, Lin HeLLM Agent MemoryMemory Agent Benchmarks

  6. MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

    Jul 29, 2026Xuanze Chen, Xukang Xie, Wentao Fu +3Agent Memory PoisoningMemory Agent Benchmarks

  7. Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

    Jul 29, 2026Lingyang Zeng, Guangze Chen, Kaichen Yu +9Personality Modeling in Language ModelsMemory Agent Benchmarks

  8. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Jul 29, 2026Sizhe Zhou, Sheldon Yu, Hui Wei +8Agent MemoryLLM Agent Memory

  9. Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

    Jul 27, 2026Ruizhe Li, Mingxuan Du, Benfeng Xu +1Agent MemoryIn-Context Retrieval

  10. RUMBA: Russian User Memory Benchmark

    Jul 23, 2026Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko +2Temporal Reasoning in Language ModelsTemporal Reasoning

  11. MemTools: A Unified Research Framework for Interoperable Agent Memory

    Jul 23, 2026Chengfeng Zhao, Jinhui Chen, Sirui Liang +4Agent MemoryMemory Agent Benchmarks

  12. Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

    Jul 18, 2026Maksim Sheverev, David Finkelstein, Sergey NikolenkoLLM Agent MemoryAI Agent Benchmarks

  13. RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

    Jul 18, 2026Mihir Shriniwas AryaCompositional ReasoningLLM Agent Memory

  14. MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

    Jul 14, 2026Xixuan Hao, Zeyu Zhang, Zehao Lin +6Conversational MemoryPersistent Memory for Language Models

  15. PM-Bench: Evaluating Prospective Memory in LLM Agents

    Jul 14, 2026Genglin Liu, Saadia GabrielLLM Agent MemoryLLM Agent Evaluation

  16. The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

    Jul 12, 2026Yixiong Chen, Xinyi Bai, Alan YuilleWeb Agent BenchmarksLong-Horizon Agent Evaluation

  17. S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

    Jul 2, 2026Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez +7Temporal Video GroundingEpisodic Memory

  18. MemSyco-Bench: Benchmarking Sycophancy in Agent Memory

    Jul 1, 2026Zhishang Xiang, Zerui Chen, Yunbo Tang +5Agent MemoryLLM Sycophancy

  19. MemAudit: Auditing Long-Term Agent Memory via Hidden User-State Recovery

    Jun 23, 2026Enze Ma, Yufan Zhou, Wei-Chieh Huang +7Agent MemoryAI Agent Benchmarks

  20. DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

    Jun 22, 2026Wenya Xie, Shengming Zhou, Zelin Li +9Agent MemoryLLM Agent Memory

  21. GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents

    Jun 17, 2026Zhe Ren, Yibo Yang, Yimeng Chen +7LLM Agent MemoryAI Agent Security

  22. MemTrace: Probing What Final Accuracy Misses in Long-Term Memory

    Jun 15, 2026Xianxuan Long, Zhikai Chen, Shenglai Zeng +3Temporal Reasoning in Language ModelsLLM Agent Memory