Long-Context Language Model Inference

Latest papers 166

All topics
CardsList
  1. Probing for Long-Horizon Deductive Reasoning Capabilities in Language Models with Prolog

    Oct 8, 2026Hadeel Al-Negheimish, Jasna Ilieva, Yoon KimLLM ReasoningLong-Context Language Model Inference

  2. Hybrid Latent Attention for Looped Language Models

    Oct 6, 2026Yuhan Chen, Siyuan Zhang, Nan Wang +2Long-Context Language Model InferenceLLM Inference Acceleration

  3. ReFold: Training-Free Reversible Inter-Turn Context Folding for Long-Horizon Agents

    Oct 6, 2026Yupeng Su, Jiayi Tian, Zheng Zhang +1LLM Inference EfficiencyLong-Context Language Model Inference

  4. OVAL: Output-Aware Local Page Bases for KV Cache Retrieval

    Oct 5, 2026Ashkan Shahbazi, Chayne Thrash, Soheil KolouriLong-Context Language Model InferenceLLM Inference Acceleration

  5. DeferKV: Rethinking Eviction Timing for One-Shot KV Cache Compression

    Oct 5, 2026Zhe Wang, Jiakai Li, Yujia Sun +2Long-Context Language Model InferenceKV-Cache Eviction

  6. HHR: Hierarchical Hash Retrieval for Efficient LLM Generation

    Oct 1, 2026Lianjun Liu, Tiantian Zheng, You Huang +5Long-Context Language Model InferenceLLM Inference Acceleration

  7. Role-aware Heuristic Episodic Attention for Conversational LLMs

    Oct 1, 2026Wanyang Hong, Zhaoning Zhang, Yi Chen +5Memory-Augmented Language ModelsLong-Context Language Model Inference

  8. LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning

    Sep 29, 2026Quang Hieu Pham, Thuy Duong Nguyen, Jocelyn Qiaochu Chen +1Long-Context Language Model EvaluationLong-Context Language Model Inference

  9. The Model Knows When to Stop: Training-Free Early Stopping for Long-Context Reading

    Sep 28, 2026Muath Alyobi, Mohamed Eltahir, Almoayyad Abuljdail +3Early StoppingLong-Context Language Model Evaluation

  10. PulseInfer: I/O-Centric Sparse KV Cache Offloading for Efficient Long-Context LLM Decoding

    Sep 28, 2026Qiuyang Zhang, Kai Zhou, Kai Lu +6KV-Cache OffloadingLong-Context Language Model Inference

  11. DISCO: Distributed Long Context Scaling with Grounding-Reasoning Disaggregation

    Sep 27, 2026Guanzheng Chen, Viet Dac Lai, Subhojyoti Mukherjee +5LLM GroundingLong-Context Language Model Inference

  12. Just Let Linear States Forget the Distant Past: Prefix Caching via Suffix Replay for Hybrid LLMs

    Sep 27, 2026Yirui Liu, Ruoling Qi, Xuaner Wu +6Long-Context Language Model InferenceLLM Inference Acceleration

  13. GSM: Efficient Language Modeling with Shared Global State

    Sep 27, 2026Yunao Zheng, Bin Wen, Xiaojie Wang +12Long-Context Language Model InferenceLong-Context Language Modeling

  14. Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models

    Sep 23, 2026Ke Wan, Chen ChenLong-Context Language Model InferenceRecurrent Transformers

  15. Distilling Sequential Computation in Transformer Language Models

    Sep 23, 2026Zixuan Lan, Jessica Yang, Yanhong Li +2LLM CompressionLong-Context Language Model Inference

  16. CompKV: Compensation-Aware KV Selection for Long-Context LLM Inference

    Sep 22, 2026Zhen Huang, Ruizhe Yao, Danyi Liu +8Long-Context Language Model InferenceKV-Cache Management

  17. Compressing Long Context into Answer-Aligned Memory Embeddings for LLM Inference

    Sep 22, 2026Md Mostafizer Rahman, Md Faizul Ibne Amin, Md Shahajada Mia +2LLM Inference EfficiencyLong-Context Language Model Inference

  18. ARM: Attention with Routed-Memory for Learnable Sparse Control

    Sep 21, 2026Qiuhao Zeng, Jerry Huang, Peng Lu +7Memory-Augmented Language ModelsLong-Context Language Model Inference

  19. TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching

    Sep 18, 2026Zhihao Shu, Md Musfiqur Rahman Sanim, Jie Hu +4On-Device Language Model InferenceLong-Context Language Model Inference