Semantic Caching

Momentum

0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 14

All topics
CardsList
  1. LaCache: Robust Semantic Caching for LLM Serving

    Aug 3, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1LLM ServingLLM Security

  2. From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

    Jul 11, 2026Cosimo Spera, Ray GarciaSemantic Caching

  3. Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

    Jul 5, 2026Muhammad Mansoor, Tahir Ahmad, Yeo-Chan YoonLLM Inference EfficiencyRetrieval-Augmented Generation

  4. When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

    Jul 1, 2026Yushi Sun, Bowen Cao, Wai LamLearning-Augmented AlgorithmsSemantic Caching

  5. SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

    Jun 30, 2026Amirhossein Abaskohi, Giuseppe Carenini, Peter West +1KV-Cache OffloadingKV Caching

  6. Closing the Operational Gap in Semantic Caching

    Jun 18, 2026Aditeya Baral, Radoslav Ralev, Iliya Sotirov Zhechev +2LLM EvaluationCost-Aware Inference

  7. Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

    May 27, 2026Diego Gosmar, Deborah A. DahlAI Agent ReliabilityMulti-Agent LLM Systems

  8. MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation

    May 24, 2026Ali Noshad, Zishan Zheng, Yinjun WuLLM Inference EfficiencyRL for Combinatorial Optimization

  9. Continuous Semantic Caching for Low-Cost LLM Serving

    Apr 21, 2026Baran Atalar, Xutong Liu, Jinhang Zuo +3LLM ServingCost-Aware Inference

  10. From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching

    Jan 30, 2026Zhixiang Zhang, Zesen Liu, Yuchong Xie +2Adversarial AttacksLLM Agent Security

  11. PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

    Date pendingLin Huang, Yujuan Tan, Weisheng Li +4Retrieval-Augmented GenerationInference-Time Optimization