Long-Context Language Model Inference

Latest papers 166

All topics
CardsList
  1. SALT: Salience-Aware Lexical Trie for Long-Context Compression

    Jul 20, 2026Oteo Mamo, Hyunjin Yi, Joydhriti Choudhury +2LLM CompressionLong-Context Language Model Inference

  2. Global Merger-Arbitrage Forecasting with Language Models

    Jul 10, 2026Hinal Jajal, Michal Mucha, Charles Sweat +3Long-Context Language Model InferenceLLM Fine-Tuning

  3. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  4. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  5. Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

    Jul 5, 2026Akhiad Bercovich, Talor Abramovich, Daniel Afrimi +67Mixture-of-Experts PruningLLM Pruning

  6. Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

    Jul 3, 2026Xiang Hu, Xinyu Wei, Hao Gu +10Long-Context Language Model InferenceLong-Context Language Modeling

  7. Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

    Jul 2, 2026Pranshu Chaturvedi, Parth Shroff, Tarun Suresh +2MambaLong-Context Language Model Inference

  8. Gemma 4 Technical Report

    Jul 2, 2026Gemma Team, Sherif El Abd, Vaibhav Aggarwal +298Efficient Multimodal InferenceUnified Multimodal Models

  9. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3LLM InferenceKV Caching

  10. Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

    Jul 1, 2026Aryo Pradipta Gema, Beatrice Alex, Pasquale MinerviniLong-Context RetrievalAttention Head Analysis

  11. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5KV CachingLong-Context Language Model Inference

  12. RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

    Jun 30, 2026Wenhao Li, Jinhao Dong, Hailin Zhang +3KV CachingLong-Context Language Model Inference

  13. SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

    Jun 30, 2026Amirhossein Abaskohi, Giuseppe Carenini, Peter West +1KV-Cache OffloadingKV Caching

  14. Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding

    Jun 29, 2026Tianyu Wang, Gourav Rattihalli, Aditya Dhakal +4Long-Context Language Model InferenceLLM Inference Acceleration

  15. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

    Jun 27, 2026Yuxuan Yang, Feiyang Ren, Bowen Zeng +4KV CachingLong-Context Language Model Inference

  16. Information-Aware KV Cache Compression for Long Reasoning

    Jun 25, 2026Jushi Kai, Zhuiri Xiao, Alexandra Birch +1KV CachingLong-Context Language Model Inference

  17. Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

    Jun 23, 2026WenHung Lee, Jian-Jia Chen, Xiaolin Lin +6Long-Context Language Model InferenceKV-Cache Management

  18. Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets

    Jun 22, 2026Duc Duong, Hoang Anh Duy Le, Jianwen Xie +2KV CachingLong-Context Language Model Inference