LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Threshold-Based Exclusive Batching for LLM Inference

    May 30, 2026Weifang Zhang, Yuzhou Nie, Bowen Pang +2GPU AccelerationLLM Inference

  2. AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

    May 29, 2026Yuxin Wang, Jiahao Lu, Qifeng Wu +5Multi-Hop QARL for Language Model Reasoning

  3. CoMem: Context Management with A Decoupled Long-Context Model

    May 29, 2026Yuwei Zhang, Chengyu Dong, Shuowei Jin +11LLM InferenceLLM Inference Acceleration

  4. Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

    May 29, 2026Aditya K Kamath, Arvind Krishnamurthy, Marco Canini +1Efficient Neural Network InferenceGPU Kernel Optimization

  5. Speculative Decoding Across Languages

    May 28, 2026Nirajan Paudel, Michael Ginn, Luc De Nardi +1Multilingual Language ModelsSpeculative Decoding

  6. Unlocking the Working Memory of Large Language Models for Latent Reasoning

    May 28, 2026Lukas Aichberger, Sepp HochreiterMemory-Augmented Language ModelsEfficient Language Model Reasoning

  7. Accelerating Constrained Decoding with Token Space Compression

    May 28, 2026Michael Sullivan, Alexander KollerConstrained DecodingLLM Inference Acceleration

  8. Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

    May 28, 2026Jianuo Huang, Yaojie Zhang, Qituan Zhang +3Speculative DecodingLLM Inference Acceleration

  9. Draft-OPD: On-Policy Distillation for Speculative Draft Models

    May 28, 2026Haodi Lei, Yafu Li, Haoran Zhang +8Speculative DecodingLLM Inference Acceleration

  10. Parallax: Parameterized Local Linear Attention for Language Modeling

    May 27, 2026Yifei Zuo, Dhruv Pai, Zhichen Zeng +3Language Model PretrainingSelf-Attention

  11. Inference-Native Zeroth-Order Optimization for LLMs

    May 27, 2026Zelin Li, Caiwen DingLLM ServingZeroth-Order Optimization

  12. RW-TTT: Batched Serving for Request-Owned Test-Time Training State

    May 27, 2026Jian Yang, Zhizhuo Kou, Yao Tian +4LLM ServingTest-Time Optimization

  13. Locality-Aware Redundancy Pruning for LLM Depth Compression

    May 27, 2026Vincent-Daniel Yun, Youngrae Kim, Woosang Lim +3LLM PruningLLM Compression

  14. Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

    May 26, 2026Wenhui Tan, Minghao Li, Xiaoqian Ma +5Multi-Token PredictionLLM Compression

  15. NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

    May 26, 2026Hong Chen, Xiang Liu, Yubo Gao +5KV CachingLong-Context Language Modeling

  16. Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

    May 25, 2026Sangyun Lee, Sean McLeish, Tom Goldstein +1Memory-Augmented Language ModelsLong-Context Language Model Inference

  17. Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains

    May 25, 2026Hui Xie, Jie Liu, Ziyue Qiao +1Efficient Language Model ReasoningLLM Inference Acceleration

  18. Neural Router: Semantic Content Matching for Agentic AI

    May 25, 2026Lauri Lovén, Abhishek Kumar, Alexander Engelhardt +5Semantic Textual SimilarityLLM Inference Acceleration

  19. IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

    May 25, 2026Xintong Yang, Hao Gu, Binxing Xu +6Memory-Augmented Language ModelsSelf-Attention

  20. H2^{2}MT: Semantic Hierarchy-Aware Hierarchical Memory Transformer

    May 24, 2026Maryam Haghifam, Zifan He, Jason Cong +1Memory-Augmented Language ModelsLong-Context Language Model Inference

  21. Beyond the Target: From Imitation to Collaboration in Speculative Decoding

    May 24, 2026Jinze Li, Yixing Xu, Guanchen Li +7Speculative DecodingLLM Inference Acceleration

  22. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

    May 22, 2026Pu Li, Jiawen Qi, Qinyu ChenAI Accelerator InferenceOn-Device Language Model Inference

  23. A Simple Plug-in for Improving Eviction-Based KV Cache Compression

    May 22, 2026Yuping Lin, Jiayuan Ding, Yue Xing +3KV CachingMemory-Efficient Optimization