Key-Value Cache

Momentum

30 papers in the last four weeks, up 114% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 163

All topics
CardsList
  1. PatchKV: Weight-Space Compensation of KV Cache

    Sep 30, 2026Chanryeol Lee, Chanhyuk Lee, Yeonwoo Choi +2Key-Value Cache CompressionKey-Value Cache

  2. SPLASH: Switching Parallel Layouts of Attention with Seamless Handoff for LLM Serving

    Sep 29, 2026Chuan Liu, Shuoming Zhang, Zhicheng Li +6Large Language Model ServingKey-Value Cache

  3. CacheRepair: Learning to Repair Cross-Chunk Context in RAG for KV Cache Fusion

    Sep 28, 2026Genglin Wang, Wangsong Yin, Yeerzhati Abudunuer +3Key-Value CacheCross-Attention

  4. WorldAttention: An Efficient Attention Architecture for Interactive Video World Models

    Sep 28, 2026Zeyu Zhang, Jinyuan Mao, Dakai An +6Video World ModelsDynamic Sparse Attention

  5. KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems

    Sep 28, 2026Hyesung Jeon, Hyeongju Ha, Seoyoung Lee +2Kv-Cache ManagementKey-Value Cache

  6. PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction

    Sep 28, 2026Hyesung Jeon, Hyeongju Ha, Jae-Joon KimKey-Value CacheCache

  7. Positions Are Not Facts: The Mismatch Between KV Caches and Memory

    Sep 27, 2026Changhai Zhou, Yuhua Zhou, Shiyang Zhang +5Key-Value CacheLarge Language Model Memory

  8. PQ-HSA: Reusing Product-Quantized Scores for Hybrid Sparse-Approximate Attention

    Sep 27, 2026Kunming Shao, Jierun Chen, Yanli Wang +4Dynamic Sparse AttentionKey-Value Cache Quantization

  9. RelaxKV: Recomputation Guided by the Query with Sparse Context Attention for Efficient KV Cache Reuse

    Sep 27, 2026Ruoling Qi, Yirui Liu, Xuaner Wu +5CacheKey-Value Cache

  10. In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion

    Sep 26, 2026Yikai Wang, Xiao Han, Mengmeng Xu +9Autoregressive Video Diffusion ModelsCache

  11. Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs

    Sep 26, 2026Vincent-Daniel Yun, Woosang Lim, Haneul Yoo +3PrefillMulti-Agent Large Language Model Systems

  12. DeltaS: Reading the Gated Linear Attention State for KV Cache Eviction in Streaming Video

    Sep 23, 2026Taeyoun Kwon, Seungjin Kim, Hyeonyu Kim +1Kimi Delta AttentionLinear Attention

  13. TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching

    Sep 18, 2026Zhihao Shu, Md Musfiqur Rahman Sanim, Jie Hu +4Kv-Cache ManagementDepthweave-Kv

  14. Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

    Sep 16, 2026Yipeng Liu, Yingqiang Zhang, Feifei Li +1CallKey-Value Cache

  15. Contiguity, Not Importance: Budgeted Repair of Stale KV Caches After Document Edits

    Sep 16, 2026Mingyang Mao, Wyatt Mackey, Xiaomin LinKey-Value CacheMultimodal Knowledge Editing

  16. T-LoopFormer: Token-Level Elastic-Depth Looped Transformers for Latent Reasoning With Dynamic Routing

    Sep 14, 2026Mingqian Yu, Wenpeng Zhang, Peilin ZhaoTransformer ArchitecturesInference Latency

  17. FlexComp: One Model for Every Ratio in Context Compression

    Sep 11, 2026Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1Data Compression MethodsKey-Value Cache

  18. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKv-Cache ManagementKey-Value Cache

  19. Composable CXL Memory as a Kubernetes-Native Shared Memory for LLM Serving

    Sep 9, 2026Hongjian Fan, Kevin Zhang, David Habinsky +1Kv-Cache ManagementKey-Value Cache

  20. Fine-Tuning a KV Cache Concatenation-Aware Model or Recomputing KV Caches? Why Not Both?

    Sep 9, 2026Fumihiko Tachibana, Daisuke Miyashita, Jun DeguchiKey-Value CacheCache

  21. BIO-MEMART: Biometric-Aware KV Cache Memory for Multi-User LLM Agents

    Sep 8, 2026Yanhong Qian, Xuanying He, Qingguo Meng +3Kv-Cache ManagementKey-Value Cache

  22. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8Key-Value Cache EvictionKey-Value Cache

  23. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4Efficient Long-Context InferenceKey-Value Cache

  24. Faithfulness Is Not Free: Auditing Offline KV-Cache Quantization in Retrieval-Augmented Generation

    Aug 31, 2026Atta Ul Asad, Ahsan Bilal, Muhammad Ali +2Key-Value Cache QuantizationFaithfulness

  25. What It Costs to Compose, Rebuild, and Correct Precomputed Memory

    Aug 31, 2026Asa ShepardLarge Language Model MemoryKey-Value Cache

  26. Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware

    Aug 31, 2026Simon Richter, Ruhai Lin, Jason Yik +4Dynamic Sparse AttentionNeuromorphic Computing

  27. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Efficient Long-Context InferenceLLM Inference Optimization

  28. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

    Aug 27, 2026Tao Zhang, Jianchao Tan, Pingwei Sun +6Recurrent StateGated Deltanet

  29. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Dynamic Sparse AttentionEfficient Long-Context Inference

  30. vToken: Token-Level Virtualization for Reclaimable KV Caches

    Aug 13, 2026Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen +4Kv-Cache ManagementKey-Value Cache

  31. Keep the Future, Drop the Rollout: RIFT for World Action Models

    Aug 12, 2026Chushan Zhang, Jinguang Tong, Xuesong Li +2World ModelsAutoregressive Rollout

  32. ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover

    Aug 11, 2026Minwoo Kim, Soochang Song, Namyoon Lee +2Kv-Cache ManagementKey-Value Cache

  33. RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

    Aug 9, 2026Dongjie Xu, Kai Qian, Julius +6Key-Value Cache CompressionKey-Value Cache

  34. Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

    Aug 8, 2026Xuning He, Zinan Sheng, Yongding Tao +4Diffusion Language ModelsDiffusion Models

  35. SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

    Aug 8, 2026Jiamu Zhang, Liang Wu, Kelly Wan +2Key-Value CacheCache

  36. CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

    Aug 8, 2026Weizhong Huang, Jinchao Zhang, Xiawu ZhengKey-Value Cache CompressionDepthweave-Kv

  37. When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs

    Aug 5, 2026Jiaming Cheng, Subhransu Das, Rajiv RamnathMulti-Agent Large Language Model SystemsLarge Language Model Memory

  38. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2Key-Value Cache CompressionKey-Value Cache

  39. Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

    Aug 2, 2026Yujian Liu, Jiabao Ji, Li An +4Key-Value Cache CompressionCompaction

  40. S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

    Aug 1, 2026Jialong Han, You Wu, Kewei TuKey-Value Cache CompressionKey-Value Cache

  41. Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models

    Jul 31, 2026Jin-woo Lee, Minkyung Song, Junghyun Oh +4Key-Value CacheTranslation Quality

  42. LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

    Jul 31, 2026Yirui Liu, Ruoling Qi, Longwen Wang +5Kimi Delta AttentionKey-Value Cache

  43. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

    Jul 30, 2026Yao Xiao, Reuben Tan, Zhen Zhu +3Long Visual-Token SequencesKey-Value Cache

  44. SemPIC: Learning Semantic Position-Independent KV Caches

    Jul 30, 2026Hui Xie, Peng Xiao, Yutong Deng +3Key-Value CacheCache