Long-Context Language Model Inference

Latest papers 166

All topics
CardsList
  1. SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

    Apr 24, 2026Yuqi Pan, Jinghao Zhuang, Yupeng Feng +16Long-Context Language Model InferenceSpiking Neural Networks

  2. LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction

    Apr 22, 2026Enshuai Zhou, Yifan Hao, Chao Wang +7KV CachingLong-Context Language Model Inference

  3. Simplified Sparse Attention via Gist Tokens

    Apr 22, 2026Yuzhen Mao, Michael Y. Li, Emily B. FoxSelf-AttentionLong-Context Language Model Inference

  4. DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing

    Apr 21, 2026Jinyu Guo, Zhihan Zhang, Jiehui Xie +7Long-Context Language Model InferenceLLM Inference Acceleration

  5. AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization

    Apr 20, 2026Kosuke Matsushima, Yasuyuki Okoshi, Masato Motomura +1Compute-in-MemoryLong-Context Language Model Inference

  6. Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

    Apr 20, 2026Yujie Chen, Tailai Chen, Yifeng Gao +4Self-AttentionLong-Context Language Model Inference

  7. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4GPU AccelerationSelf-Attention

  8. Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference

    Apr 8, 2026Quantong Qiu, Zhiyi Hong, Yi Yang +5Self-AttentionLong-Context Language Model Inference

  9. Learning to Evict from Key-Value Cache

    Feb 10, 2026Luca Moschella, Laura Manduchi, Ozan SenerKV CachingLong-Context Language Model Inference

  10. Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

    Feb 9, 2026Yifei Gao, Lei Wang, Rong-Cheng Tu +3Self-AttentionKV Caching

  11. Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

    Dec 18, 2025Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra +1Self-AttentionLong-Context Language Model Inference

  12. Block Sparse Flash Attention

    Dec 7, 2025Daniel Ohayon, Itay Lamprecht, Itay Hubara +3GPU AccelerationSelf-Attention

  13. BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models

    Nov 7, 2025Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi +1LLM CompressionLong-Context Language Model Inference

  14. CompLLM: Compression for Long Context Q&A

    Sep 23, 2025Gabriele Berton, Jayakrishnan Unnikrishnan, Son Tran +1LLM CompressionLong-Context Language Model Inference