LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Acceptance-Aware Draft Model Training for Speculative Decoding

    Sep 21, 2026Tianhua Xia, Mugilan Ganesan, Yifei Feng +3Speculative DecodingLLM Inference Acceleration

  2. On the Efficiency-Safety Dilemma in Large Reasoning Models

    Sep 20, 2026Yifei Yang, Zouying Cao, Xingrui Wang +4LLM Inference AccelerationLLM Jailbreak Attacks

  3. On-Demand Attention: Language Models Know When to Recall

    Sep 17, 2026Haibo Feng, Ruiqi Liang, Hanyang Peng +1Language Model DecodingLong-Context Language Model Inference

  4. To Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals

    Sep 17, 2026Roy Eisenstadt, Ido Cohen, Edo Cohen-Karlik +2Speculative DecodingLLM Inference Acceleration

  5. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM QuantizationLLM Evaluation

  6. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Long-Context Language Model InferenceLLM Inference Scheduling

  7. ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding

    Sep 15, 2026Ziyang Ma, Zihong Zhang, Zuchao Li +4Speculative DecodingLLM Inference Acceleration

  8. GrowMTP: Can RL Grow Its Own Draft Head?

    Sep 15, 2026Minghua He, Lingzhe Zhang, Yuan Liu +2Speculative DecodingLLM Inference Acceleration

  9. Breaking the 1.58-bit Barrier for Ternary LLMs

    Sep 14, 2026Evangelos Georganas, Alexander Heinecke, Pradeep DubeyTernary QuantizationLLM Compression

  10. LLM Inference in a Flash!

    Sep 14, 2026Sebastian Zhao, Minseo Kim, Coleman Hooper +5LLM QuantizationCompute-in-Memory

  11. To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs

    Sep 14, 2026Franck Signe, Hippolyte Pilchen, François Yvon +1Multilingual Language ModelsLLM Compression

  12. T-LoopFormer: Token-Level Elastic-Depth Looped Transformers for Latent Reasoning With Dynamic Routing

    Sep 14, 2026Mingqian Yu, Wenpeng Zhang, Peilin ZhaoKV CachingRecurrent Transformers

  13. SpliTEE: Fast and Private LLM Inference by Coupling GPU-Assisted Trusted Execution Environments with Differential Privacy

    Sep 14, 2026Shashie Dilhara Batan Arachchige, Robin Carpentier, Hassan Jameel Asghar +1Privacy-Preserving Language ModelsSplit Inference

  14. RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems

    Sep 14, 2026Ziyue Yang, Yuting Jiang, Lei Qu +1LLM InferenceLarge Language Model-Guided Optimization

  15. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention

    Sep 14, 2026Arya Tschand, Yaosheng Fu, Vikram Sharma Mailthody +6Disaggregated LLM ServingLLM Inference Acceleration

  16. AgentKV: Phase-Aware KV Eviction for Agentic LLMs

    Sep 14, 2026Taowen Tony Liu, Jeffrey T. H. Wong, Can Xiao +3KV CachingKV-Cache Eviction

  17. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLong-Context Language Model InferenceEfficient Language Model Reasoning

  18. FlexComp: One Model for Every Ratio in Context Compression

    Sep 11, 2026Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1LLM Inference AccelerationContext Compression

  19. OmniKVQuant: KV Cache Quantization for Omni-LLMs

    Sep 11, 2026Suho Yoo, Hyunjong Ok, Jongmin Choi +2Efficient Multimodal InferenceKV Caching

  20. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKV-Cache OffloadingKV Caching