Memoryagentbench

Momentum

7 papers in the last four weeks, up 133% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 32

All topics
CardsList
  1. Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

    Oct 1, 2026Gabriel Tomitsuka, Arman Raayatsanati, Emma Xing +2Data Science AgentsMemoryagentbench

  2. Remember Before You're Asked: MemDream for Self-Probing Memory Evolution

    Sep 28, 2026Mingfei Lu, Mengjia Wu, Runsong Jia +2Large Language Model AgentsDream

  3. DolphinBench: Mapping the Pareto Frontier of Agent Memory

    Sep 21, 2026Soumil Rathi, Deshraj Yadav, Taranjeet SinghMemoryagentbenchFactual Recall

  4. VibeMemBench: Evaluating Memory Systems for Coding Agents on Real Repository Coding Tasks

    Sep 20, 2026Liyang Fan, Yingcheng Shi, Yongbin Li +7Repository-Level Code UnderstandingMemoryagentbench

  5. Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents

    Sep 12, 2026Susheel Suresh, Hazel Mak, Sahil Bhatnagar +2Long-Term Agent MemoryMemoryagentbench

  6. When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory

    Aug 13, 2026Ruizhe Li, Licheng Zhang, Benfeng Xu +3Conversational MemorySearch Agents

  7. DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

    Aug 11, 2026Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub +3Data Science AgentsMemoryagentbench

  8. TEPA: Revoking Stale Memories for Conflict-Robust Language Agents

    Aug 7, 2026Yan Zhou, Yue Ouyang, Kaiyang Zheng +1Long-Term Agent MemoryGradient Staleness

  9. GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

    Aug 3, 2026Abhinav Pothuri, Zhe Jiang, Zelin Xu +1Geospatial ReasoningMemoryagentbench

  10. PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

    Jul 21, 2026Dankai Liao, Tianyi Zhang, Yufeng Wu +6Whole-Slide ImagesPathology Foundation Models

  11. When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents

    Jul 6, 2026Yechao Zhang, Shiqian Zhao, Jiawen Zhang +5MemoryagentbenchClaw-Like Agent

  12. World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

    Jul 1, 2026Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan +1Icr-RlMemoryagentbench

  13. PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

    Jul 1, 2026Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi +1MemoryagentbenchScientific Agents

  14. TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

    Jun 23, 2026Tianyu Yang, Sudipta Paul, Vijay Srinivasan +2Agentic MemoryLong-Term Memory

  15. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

    Jun 21, 2026Yikun Fu, Bowen Fu, Zhenyu Wu +10MemoryagentbenchArtificial Intelligence Agents

  16. ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

    Jun 18, 2026Jiajun Li, Mingshu Cai, Yixuan Li +5Operations ResearchMulti-Agent Orchestration

  17. LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

    May 12, 2026Di Wu, Zixiang Ji, Asmi Kawatkar +4Long-Term Agent MemoryLong-Term Memory

  18. δδ-mem: Efficient Online Memory for Large Language Models

    May 12, 2026Jingdi Lei, Di Zhang, Junxian Li +7Peak MemoryEfficient Long-Context Inference

  19. MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

    May 12, 2026Yihao Wang, Haoran Xu, Renjie Gu +10Long-Term Agent MemoryMemoryagentbench

  20. ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

    May 11, 2026Amirhossein Abaskohi, Yuhang He, Peter West +3Computer-Use AgentsMultimodal Agents

  21. PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

    May 10, 2026Zhen Hang, Yushan Yashengjiang, Junhui Li +21Neural Partial Differential Equation SolversPartial Differential Equations

  22. SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

    Mar 31, 2026Kuangshi Ai, Haichao Miao, Kaiyuan Tang +13MemoryagentbenchEvaluation Benchmarks

  23. Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

    Jul 7, 2025Yuanzhe Hu, Yu Wang, Julian McAuleyAgentic MemoryLarge Language Model Agents