LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Learning When to Sample: Confidence-Aware Selective Sampling for Efficient Chain-of-Thought Reasoning

    Mar 9, 2026Juming Xiong, Kevin Guo, Congning Ni +7CoT ReasoningEfficient Language Model Reasoning

  2. InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context

    Mar 5, 2026Xin Teng, Canyu Zhang, Shaoyi Zheng +3Retrieval-Augmented GenerationKV Caching

  3. Vectorizing the Trie: Efficient Constrained Decoding for LLM-based Generative Retrieval on Accelerators

    Feb 26, 2026Zhengyang Su, Isay Katsman, Yueqi Wang +10Constrained DecodingGenerative Retrieval

  4. MineDraft: A Framework for Batch Parallel Speculative Decoding

    Feb 24, 2026Zhenwei Tang, Arun Verma, Zijian Zhou +4Speculative DecodingLLM Inference Acceleration

  5. Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation

    Feb 17, 2026Hua Yan, Heng Tan, Yingxue Zhang +1Human Behavior SimulationLLM Inference Acceleration

  6. QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

    Feb 11, 2026Kanghyun Noh, Jinheon Choi, Yulhwa KimLLM QuantizationLLM Compression

  7. Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

    Feb 9, 2026Yifei Gao, Lei Wang, Rong-Cheng Tu +3Self-AttentionKV Caching

  8. ResidualKV: Residual-Based KV Cache Compression for Efficient Long-Context Inference

    Feb 8, 2026Jitai Hao, Qiang Huang, Yaowei Wang +2Self-AttentionKV Caching

  9. OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale

    Feb 5, 2026Jingze Shi, Zhangyang Peng, Yizhang Zhu +3Mixture-of-Experts InferenceLLM Inference Acceleration

  10. Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States

    Feb 3, 2026Ximing Dong, Shaowei Wang, Dayi Lin +2Speculative DecodingLLM Inference Acceleration

  11. MatGPTQ: Efficient and Accurate Inference over Nested Quantized Models

    Feb 3, 2026Maximilian Kleinegger, Elvir Crnčević, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  12. STILL: Selecting Tokens for Intra-Layer Hybrid Attention to Linearize LLMs

    Feb 2, 2026Weikang Meng, Liangyu Huo, Yadan Luo +4LLM Inference AccelerationLinear Attention

  13. ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure

    Feb 1, 2026Jie Deng, Shining Liang, Jun Li +2Efficient Language Model ReasoningLLM Inference Acceleration

  14. Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

    Jan 30, 2026Arvind Mahankali, Kaiyue Wen, Tengyu MaMulti-Agent LLM SystemsCoT Reasoning

  15. ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

    Jan 12, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +3LLM Quantization4-Bit Quantization

  16. JuDi: Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence

    Jan 8, 2026Shengyin Sun, Yiming Li, Renxi Liu +5Speculative DecodingLLM Inference Acceleration

  17. Entropy-Aware Token Rejection for Improving Speculative Decoding

    Dec 29, 2025Tiancheng Su, Meicong Zhang, Guoxiu HeSpeculative DecodingLLM Inference Acceleration

  18. Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

    Dec 18, 2025Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra +1Self-AttentionLong-Context Language Model Inference

  19. xGR: Efficient Generative Recommendation Serving at Scale

    Dec 12, 2025Qingxiao Sun, Tongxuan Liu, Shen Zhang +13LLM ServingLLM Inference Acceleration

  20. Block Sparse Flash Attention

    Dec 7, 2025Daniel Ohayon, Itay Lamprecht, Itay Hubara +3GPU AccelerationSelf-Attention

  21. Poodle: Seamlessly Scaling Down Large Language Models with Just-in-Time Model Replacement

    Dec 5, 2025Nils Strassenburg, Boris Glavic, Tilmann RablCost-Aware InferenceSmall Language Models

  22. Data-Free Pruning of Self-Attention Layers in LLMs

    Dec 3, 2025Dhananjay Saikumar, Blesson VargheseLLM PruningLLM Compression

  23. ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

    Nov 24, 2025Long Lian, Sida Wang, Felix Juefei-Xu +7RL for Language Model ReasoningInference-Time Scaling

  24. DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

    Nov 19, 2025Peiming Yang, Sankeerth Durvasula, Ivan Fernandez +4Compute-in-MemoryLLM Inference Acceleration

  25. CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization

    Nov 7, 2025Ziqian Bi, Yinzhi Wang, Tianyang Wang +6Efficient Language Model ReasoningLLM Inference Acceleration

  26. BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models

    Nov 7, 2025Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi +1LLM CompressionLong-Context Language Model Inference

  27. NOSA: Native and Offloadable Sparse Attention

    Oct 15, 2025Yuxiang Huang, Pengjie Wang, Jicheng Han +9KV-Cache OffloadingGPU Acceleration

  28. Accelerating Attention with Basis Decomposition

    Oct 2, 2025Jialin ZhaoSelf-AttentionTransformer Attention

  29. Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

    Oct 2, 2025Joykirat Singh, Justin Chih-Yao Chen, Archiki Prasad +3RL for Language Model ReasoningLLM Inference Acceleration