Efficient Long-Context Inference

Latest papers 229

All topics
CardsList
  1. OVAL: Output-Aware Local Page Bases for KV Cache Retrieval

    Oct 5, 2026Ashkan Shahbazi, Chayne Thrash, Soheil KolouriEfficient Long-Context Inference

  2. ReMem: Streaming Video Understanding With Long Context Retention

    Oct 5, 2026Li Yiheng, He Xu, Wang Shaobo +2Streaming Video UnderstandingEfficient Long-Context Inference

  3. HLA: Expressive Hybrid Linear Attention via Chunk-Wise Dynamic Mixing

    Oct 5, 2026Zhuokun Chen, Xi Lin, Xiyu Wu +3Kimi Delta AttentionEfficient Long-Context Inference

  4. Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning

    Sep 30, 2026Taye Akinrele, Noorbakhsh Amiri Golilarz, Subash Neupane +2LLM Reasoning StrategiesEfficient Long-Context Inference

  5. PatchKV: Weight-Space Compensation of KV Cache

    Sep 30, 2026Chanryeol Lee, Chanhyuk Lee, Yeonwoo Choi +2Key-Value Cache CompressionKey-Value Cache

  6. StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning

    Sep 30, 2026Naen Xu, Wanqing Cui, Yibo Hu +5LLM Reasoning StrategiesDialogue Benchmarks

  7. Selecting What Matters: Semantic Compression-Guided Selective Pooling for Long-Context Embeddings

    Sep 29, 2026Zifeng Cheng, Jie Zheng, Zhiwei Jiang +4Efficient Long-Context InferenceToken Embeddings

  8. When Can Attention Heads Be Statically Defined?

    Sep 28, 2026Weixian Waylon Li, Yintao Tai, Marcio Fonseca +1Efficient Long-Context InferenceModel Fine-Tuning

  9. The Model Knows When to Stop: Training-Free Early Stopping for Long-Context Reading

    Sep 28, 2026Muath Alyobi, Mohamed Eltahir, Almoayyad Abuljdail +3Efficient Long-Context InferenceLong-Context Reasoning

  10. Rethinking Contextualization by Reinterpreting Attention Head Channels

    Sep 27, 2026Hakaze Cho, Haolin Yang, Zhun Sun +3Efficient Long-Context InferenceChannel

  11. DISCO: Distributed Long Context Scaling with Grounding-Reasoning Disaggregation

    Sep 27, 2026Guanzheng Chen, Viet Dac Lai, Subhojyoti Mukherjee +5Efficient Long-Context InferenceLLM Reasoning Strategies

  12. ARM: Attention with Routed-Memory for Learnable Sparse Control

    Sep 21, 2026Qiuhao Zeng, Jerry Huang, Peng Lu +7Efficient Long-Context InferencePeak Memory

  13. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Multilingual BenchmarkAcoustic Latent Space

  14. On-Demand Attention: Language Models Know When to Recall

    Sep 17, 2026Haibo Feng, Ruiqi Liang, Hanyang Peng +1Efficient Long-Context InferenceDynamic Attention

  15. Foreground Voice Activity Detection: Learning Speaker Selectivity from Supervision

    Sep 17, 2026Guangzhao Yang, Muhammad Huzaifah, Yu Pan +2SpeakerTalk

  16. Long-Context Demonstration Selection Using State Space Models

    Sep 15, 2026Ziniu Zhang, Zhenshuo Zhang, Ruoxuan Xiong +2Efficient Long-Context InferenceIn-Context Learning

  17. SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking

    Sep 14, 2026Zhiwei Li, Lei Zhu, Hao Gu +6Dynamic Sparse AttentionBlock Sparse Flash Attention

  18. Distance generalization in transformers: why bother with positional encoding?

    Sep 11, 2026Daniel Henrik Nevermann, Claudius GrosPositional EncodingTransformer Architectures

  19. PRAGMA: Evaluating Personalized Guidance with Memory Alignment in Lifelong Conversations

    Sep 10, 2026Hyojeong Yu, Hyukhun Koh, Minsung Kim +2Conversational MemoryInteraction History

  20. ConvMem: Convolutional Memory for Long-Context Reasoning

    Sep 9, 2026Hongming Zhang, Zhaozhen Gu, Fengshuo Bai +6Efficient Long-Context InferenceLarge Language Model Memory

  21. Pushing the Boundaries of Streaming Multi-Speaker ASR: A Systematic Study of Architectural Trade-offs

    Sep 9, 2026Taejin Park, Ivan Medennikov, Kunal Dhawan +3Automatic Speech RecognitionStreaming

  22. Fine-Tuning a KV Cache Concatenation-Aware Model or Recomputing KV Caches? Why Not Both?

    Sep 9, 2026Fumihiko Tachibana, Daisuke Miyashita, Jun DeguchiKey-Value CacheCache

  23. CausalChapter: Improving Long-Video Chaptering with Interventional Dependency Modeling

    Sep 8, 2026Xinran Duan, Guozhang Li, Yaoyao Zhong +3Video UnderstandingEfficient Long-Context Inference

  24. Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?

    Sep 8, 2026Sara Rizwan, Samaanah Abdus SalamEfficient Long-Context Inference

  25. Separating Stream Stability from Long-Term Recall in Language Models

    Sep 7, 2026Peipei Cao, Xin Zhang, Jie Tang +3Large Language Model MemoryEfficient Long-Context Inference

  26. CEDAR: Error-Bounded Residual Routing for Efficient Long-Context Attention

    Sep 7, 2026Siyu Li, Dong Wang, Jie Zhou +3Dynamic Sparse AttentionEfficient Long-Context Inference

  27. SGD-KV: Summarization Guided KV Cache Compression

    Sep 3, 2026Zeyu Liu, Woomin Song, Xuandi Fu +5Key-Value Cache CompressionEfficient Long-Context Inference

  28. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models

    Sep 2, 2026Renjie Xie, Juncheng Yang, Aoting Hu +4Efficient Long-Context InferenceKey-Value Cache

  29. LatentPress: Context Compression Beyond Text and Vision

    Sep 1, 2026Zhengze Zhou, Hejian SangEfficient Long-Context InferenceLarge Language Model Compression

  30. Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

    Aug 31, 2026Zhigeng Liu, Zhiyuan Ning, Ruixiao Li +5Efficient Long-Context InferenceLarge Language Model Decoding

  31. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

    Aug 31, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +2Kimi Delta AttentionLinear Attention

  32. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

    Aug 31, 2026Haoyun Jiang, Haolin Li, Jianwei Zhang +7Efficient Long-Context InferenceLLM Inference Optimization

  33. TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy

    Aug 27, 2026Hong Chen, Yudong Zeng, Yongwei Huang +4Key-Value Cache EvictionCache

  34. Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

    Aug 20, 2026Matthias Seeger, Zeyu Zhang, Vihang Patil +2Dynamic Sparse AttentionEfficient Long-Context Inference

  35. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

    Aug 12, 2026Arda Uzunoglu, Benjamin Van Durme, Daniel KhashabiEfficient Long-Context InferenceLarge Language Model Training

  36. MARCH: Scaling Recurrent Memory with Content-Routed State Anchors

    Aug 12, 2026Ming Zhang, Kaisen Yang, Shu Yu +6Efficient Long-Context InferenceRecurrent Model

  37. Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

    Aug 11, 2026Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3Efficient Long-Context InferenceTransformer Architectures

  38. Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

    Aug 10, 2026Amanda Bertsch, Luca Soldaini, Matthew R. Gormley +4Efficient Long-Context InferenceTransformer Architectures

  39. MixFormer: Linear Transformer with Mixture of Memory Experts

    Aug 10, 2026Yu Guo, Lei DuanKimi Delta AttentionEfficient Long-Context Inference

  40. VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

    Aug 9, 2026Yuqi Zhang, Cheng Chen, Yuyu Guo +6Recent Vision-Language ModelsEfficient Long-Context Inference

  41. QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

    Aug 5, 2026Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya +3Key-Value Cache EvictionEfficient Long-Context Inference

  42. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

    Aug 5, 2026Indraneil Paul, Falko Helm, Goran Glavaš +1Efficient Long-Context InferenceCodebases

  43. Training-Free Hashing-Based Attention via Binary Principal Components

    Aug 5, 2026Daohai Yu, Zhanpeng Zeng, Keyu Chen +6Dynamic Sparse AttentionBlock Sparse Flash Attention

  44. Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

    Aug 3, 2026Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson +2Large Language Model MemoryEfficient Long-Context Inference

  45. DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling

    Aug 3, 2026Yixiao Qian, Song Chen, Pengkai Wang +3Recurrent StateKimi Delta Attention

  46. Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation

    Aug 3, 2026Xingyu Ren, Youran Sun, Chugang Yi +1Dynamic Sparse AttentionBlock Sparse Flash Attention

  47. Learning What to Remember: Test-Time Training via Context Distillation

    Aug 3, 2026Zixuan Wang, Xingyu Dang, Rui-Jie Zhu +4Efficient Long-Context InferenceTest-Time Training

  48. ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression

    Jul 31, 2026Yuhang Zhan, Lisi Chen, Shuo ShangKey-Value Cache CompressionCache