Long-Context Language Model Inference

Latest papers 166

All topics
CardsList
  1. STS: Efficient Sparse Attention with Speculative Token Sparsity

    May 15, 2026Ceyu Xu, Jiangnan Yu, Yongji Wu +1Self-AttentionLong-Context Language Model Inference

  2. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

    May 13, 2026Gergely Szilvasy, Manuel Faysse, Maria Lomeli +5Self-AttentionKV Caching

  3. SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference

    May 13, 2026Anay Chauhan, Gurucharan Marthi Krishna Kumar, Arion Das +4KV CachingLong-Context Language Model Inference

  4. Attention Drift: What Autoregressive Speculative Decoding Models Learn

    May 11, 2026Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek +3Long-Context Language Model InferenceSpeculative Decoding

  5. ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

    May 9, 2026Junjie Li, Jiong Lou, Jie LiLLM PruningKV Caching

  6. ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing

    May 9, 2026Yongqi An, Chang Lu, Kuan Zhu +5KV CachingLong-Context Language Model Inference

  7. An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference

    May 8, 2026Feiyu Yao, Zhixiong Niu, Xiaqing Li +3GPU AccelerationSelf-Attention

  8. Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility

    May 7, 2026Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji +2Self-AttentionLong-Context Language Model Inference

  9. AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse

    May 5, 2026Jie Ou, Jinyu Guo, Shiyao Guo +5Long-Context Language Model InferenceKV-Cache Management

  10. Stochastic Sparse Attention for Memory-Bound Inference

    May 3, 2026Kyle Lee, Corentin Delacour, Kevin Callahan-Coray +5GPU AccelerationSelf-Attention

  11. Budget-Aware Routing for Long Clinical Text

    May 1, 2026Khizar Qureshi, Geoffrey Martin, Yifan PengSubmodular OptimizationLong-Context Language Model Inference

  12. Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving

    Apr 29, 2026Zihan Zhao, Baotong Lu, Shengjie Lin +8LLM ServingKV-Cache Offloading

  13. Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective

    Apr 28, 2026Jiaming Yang, Chenwei Tang, Liangli Zhen +1KV CachingLong-Context Language Model Inference

  14. DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

    Apr 27, 2026Zahra Dehghanighobadi, Asja FischerLLM PruningKV Caching

  15. Kwai Summary Attention Technical Report

    Apr 27, 2026Chenglong Chu, Guorui Zhou, Guowang Zhang +35Self-AttentionKV Caching

  16. From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors

    Apr 25, 2026Yitian Zhou, Chaoning Zhang, Jiaquan Zhang +6LLM CompressionLong-Context Language Model Inference