KV-Cache Reuse

Momentum

15 papers in the last four weeks, up 400% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 50

All topics
CardsList
  1. How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit

    Jul 11, 2026Daming Luo, Christy Liang, Junyu XuanKV CachingKV-Cache Reuse

  2. KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

    Jul 10, 2026Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelsKV Caching

  3. Affix Cache for Diffusion Large Language Models

    Jun 26, 2026Kaihua Liang, An Zhong, Xin Tan +4KV CachingMemory-Efficient Inference

  4. Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

    Jun 25, 2026Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching

  5. Can I Buy Your KV Cache?

    Jun 11, 2026Luoyuan ZhangLLM Inference EfficiencyKV Caching

  6. Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

    Jun 11, 2026Saehun Chun, Wonje Choi, Sera Choi +2LLM-Based Program SynthesisAgentic Code Generation

  7. RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

    Jun 7, 2026Anirudh SekarLLM Inference EfficiencyKV Caching

  8. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5LLM ServingKV Caching

  9. QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving

    Jun 4, 2026Jianxin Yan, Wangze Ni, Zhenxin Li +8Retrieval-Augmented GenerationKV Caching

  10. LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

    Jun 3, 2026Haocheng Xia, Mihir Pamnani, Hanxi Fang +2Retrieval-Augmented GenerationKV Caching

  11. ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse

    May 16, 2026Yu Zhu, Aditya Dhakal, Yunming Xiao +2LLM Inference EfficiencyKV-Cache Offloading

  12. PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

    May 10, 2026Bing Xie, Zhipeng Wang, Masahiro Tanaka +1LLM ServingKV Caching

  13. Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management

    May 7, 2026Haoyu Zheng, Fangcheng Fu, Jia Wu +6LLM Inference EfficiencyKV Caching

  14. When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

    Apr 29, 2026Tianyu Liu, Yuhao Shen, Xinyi Hu +8Speculative DecodingLLM Inference Acceleration

  15. MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches

    Apr 24, 2026Xin Wang, Chi Ma, Shaobin Chen +14KV-Cache OffloadingKV Caching