Long-Context Language Model Inference

Latest papers 166

All topics
CardsList
  1. On-Demand Attention: Language Models Know When to Recall

    Sep 17, 2026Haibo Feng, Ruiqi Liang, Hanyang Peng +1Language Model DecodingLong-Context Language Model Inference

  2. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Long-Context Language Model InferenceLLM Inference Scheduling

  3. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLong-Context Language Model InferenceEfficient Language Model Reasoning

  4. EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering

    Sep 8, 2026Ziliang Zhao, Zenan Xu, Shuting Wang +6Long-Context Language Model InferenceTemporal Reasoning in Language Models

  5. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5KV CachingLong-Context Language Model Inference

  6. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4KV CachingLong-Context Language Model Inference

  7. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

    Sep 1, 2026Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt +4Long-Context Language Model InferenceLLM Inference Acceleration

  8. Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

    Aug 31, 2026Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5Long-Context Language Model InferenceLLM Inference Acceleration

  9. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Long-Context Language Model InferenceLLM Inference Acceleration

  10. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Fine-TuningKV Caching

  11. QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

    Aug 5, 2026Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya +3KV CachingLong-Context Language Model Inference

  12. TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

    Aug 4, 2026Wonpyo Park, Seung-won HwangLLM PruningKV Caching

  13. ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

    Aug 3, 2026Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino +1Long-Context Language Model InferenceLLM Inference Acceleration

  14. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2KV CachingLong-Context Language Model Inference

  15. S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

    Aug 1, 2026Jialong Han, You Wu, Kewei TuKV CachingLong-Context Language Model Inference

  16. A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

    Jul 30, 2026Yuesong Liu, Yuan Zeng, Min Lyu +3Long-Context Language Model InferenceSpeculative Decoding

  17. Recall Before You Rank: Similarity-Guided Top-KK Reuse for Efficient Long-Context Attention

    Jul 30, 2026Wenshuai Yao, Wenyong Zhou, Hanyong Shao +5Long-Context Language Model InferenceEfficient Attention

  18. CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

    Jul 28, 2026Yufei Xue, Lin Niu, Hong Liu +6Long-Context Language Model InferenceLLM Inference Acceleration