Kv-Cache Management

Momentum

15 papers in the last four weeks, up 400% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 63

All topics
CardsList
  1. TempoKV: Timely Staging of LLM KV Caches for Memory-Semantic Flash

    Sep 28, 2026Jay H. Park, Hyungjun Kim, Dong KimKv-Cache ManagementCache

  2. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6Kv-Cache ManagementNeural Processing Units

  3. PulseInfer: I/O-Centric Sparse KV Cache Offloading for Efficient Long-Context LLM Decoding

    Sep 28, 2026Qiuyang Zhang, Kai Zhou, Kai Lu +6Kv-Cache ManagementLarge Language Model Decoding

  4. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2Graphics Processing Unit MemoryKv-Cache Management

  5. KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems

    Sep 28, 2026Hyesung Jeon, Hyeongju Ha, Seoyoung Lee +2Kv-Cache ManagementKey-Value Cache

  6. EfficientAgent: What Makes KV Cache Offloading Work for Concurrent Agents?

    Sep 27, 2026Kunming Shao, Jierun Chen, Jiangnan Yu +7Kv-Cache ManagementOffloading

  7. FlashLoop: Fast and Memory-Efficient Looped Transformers via Lazy Updates

    Sep 24, 2026Wanqi Yang, Shiwei LiuBlock Sparse Flash AttentionTransformer Architectures

  8. TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching

    Sep 18, 2026Zhihao Shu, Md Musfiqur Rahman Sanim, Jie Hu +4Kv-Cache ManagementDepthweave-Kv

  9. DiffSynth-Music: Audio-Conditioned KV-Cache Adapters for Controllable Music Generation

    Sep 14, 2026Zhongjie Duan, Shengchuan Gao, Hong Zhang +1Song GenerationAudio Editing

  10. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKv-Cache ManagementKey-Value Cache

  11. Composable CXL Memory as a Kubernetes-Native Shared Memory for LLM Serving

    Sep 9, 2026Hongjian Fan, Kevin Zhang, David Habinsky +1Kv-Cache ManagementKey-Value Cache

  12. BIO-MEMART: Biometric-Aware KV Cache Memory for Multi-User LLM Agents

    Sep 8, 2026Yanhong Qian, Xuanying He, Qingguo Meng +3Kv-Cache ManagementKey-Value Cache

  13. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1Kv-Cache ManagementKeys And Value

  14. vToken: Token-Level Virtualization for Reclaimable KV Caches

    Aug 13, 2026Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen +4Kv-Cache ManagementKey-Value Cache

  15. ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover

    Aug 11, 2026Minwoo Kim, Soochang Song, Namyoon Lee +2Kv-Cache ManagementKey-Value Cache

  16. Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

    Aug 6, 2026Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair +4Large Language Model ServingLLM Inference Optimization

  17. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4Key-Value Cache QuantizationKv-Cache Management

  18. InferScale: GPU-Native KV Injection for Personalized LLM Serving

    Jul 29, 2026Peter Li, Prashant PandeyLarge Language Model MemoryKv-Cache Management

  19. Kalypso: Relational LLM Serving

    Jul 26, 2026Hojae Son, Md Ashraful Islam, Huy Gia Cao +2Large Language Model ServingKv-Cache Management

  20. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsMatrix MultiplicationTransformer Attention

  21. SALT: Salience-Aware Lexical Trie for Long-Context Compression

    Jul 20, 2026Oteo Mamo, Hyunjin Yi, Joydhriti Choudhury +2Efficient Long-Context InferenceLarge Language Model Memory

  22. MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

    Jul 12, 2026Venkatesha Matam, Keon KimKey-Value Cache EvictionKv-Cache Management

  23. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1Kv-Cache ManagementLarge Language Model Serving

  24. TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation

    Jul 7, 2026Andrii Balashov, Olena PonomarovaKey-Value Cache QuantizationMixture-Of-Experts

  25. When Latent Agents Lie: KV-Cache Integrity in Multi-Agent LLM Collaboration

    Jun 27, 2026Luís Brito, Carlos BaqueroLarge Language Model AgentsHidden States

  26. KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

    Jun 15, 2026Mufei Li, Shikun Liu, Dongqi Fu +5Kv-Cache ManagementKey-Value Cache

  27. See What I See, Know What I Think: Dense Latent Communication Across Heterogeneous Agents

    Jun 11, 2026Siyi Chen, Xiaoyan Zhang, Meng Wu +7Kv-Cache ManagementLatent Representation Alignment

  28. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5Kv-Cache ManagementKey-Value Cache

  29. NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference

    Jun 2, 2026Mubarak Adetunji OjewaleKv-Cache ManagementTime-To-First-Token

  30. A Token/KV-Cache Communication Media Selection and Resource Allocation Strategy for Multi-Agent Collaboration

    May 25, 2026Lipeng Dai, Luping Xiang, Kun YangPower AllocationKv-Cache Management

  31. KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

    May 18, 2026Jian Lin, Jiazhi Mi, Zicong Hong +5Kv-Cache ManagementKey-Value Cache

  32. Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

    May 14, 2026Jiahao Tian, Yiwei Wang, Gang Yu +1Autoregressive Video Diffusion ModelsAutoregressive Video Generation

  33. KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

    May 12, 2026Alireza Nadali, Patrick Cooper, Ashutosh Trivedi +1Efficient Long-Context InferenceKv-Cache Management

  34. KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jian Zhang +3Kv-Cache ManagementLarge Language Model Decoding

  35. PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

    May 10, 2026Bing Xie, Zhipeng Wang, Masahiro Tanaka +1Kv-Cache ManagementEviction

  36. PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

    May 9, 2026Xingyu Qu, Tianhao Lin, Yiqi Li +2Large Language Model ServingKv-Cache Management

  37. Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management

    May 7, 2026Haoyu Zheng, Fangcheng Fu, Jia Wu +6Kv-Cache ManagementWorkload

  38. Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility

    May 7, 2026Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji +2Efficient Long-Context InferencePrefill

  39. When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

    Apr 29, 2026Tianyu Liu, Yuhao Shen, Xinyi Hu +8Speculative DecodingKv-Cache Management

  40. The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

    Apr 23, 2026Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi +3Transformer ArchitecturesKv-Cache Management

  41. SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving

    Apr 19, 2026Christian LysenstøenLarge Language Model ServingCrashes

  42. Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems

    Apr 19, 2026Yuji Yamamoto, Satoshi MatsuuraKv-Cache ManagementLarge Language Model Serving

  43. KV Cache Offloading for Context-Intensive Tasks

    Apr 9, 2026Andrey Bocharnikov, Ivan Ermakov, Denis Kuznedelev +2Kv-Cache ManagementEfficient Long-Context Inference

  44. Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

    Feb 9, 2026Yifei Gao, Lei Wang, Rong-Cheng Tu +3Dynamic Sparse AttentionLLM Inference Optimization