LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Unified Static-Dynamic Pruning for Efficient LLM Inference

    Jul 24, 2026Jinhyeok Kim, Yejoon Lee, Jaeyoung DoEfficient Neural Network InferenceLLM Pruning

  2. Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

    Jul 23, 2026Yidu Wu, Xiang Wang, Kejie Zhao +3LLM PruningLLM Inference Acceleration

  3. Efficient Clustering with Provable Guardrails for LLM Inference at Scale

    Jul 22, 2026Longshaokan Wang, Wai Tsang Keung, Punit Ghodasara +3ClusteringLLM Inference Acceleration

  4. CausalGate: Causal Importance Distillation for Transformer Module Pruning

    Jul 21, 2026Kiran Nair, Smriti Regmi, Rodrigue RizkEfficient Transformer InferenceLLM Pruning

  5. AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

    Jul 21, 2026Yu-Yang Qian, Hao-Cong Wu, Chen Chen +4Speculative Decoding for Diffusion Language ModelsSpeculative Decoding

  6. BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

    Jul 21, 2026Fabian Waschkowski, Prabod Rathnayaka, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference

  7. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

    Jul 20, 2026Krish Agarwal, Zhuoming Chen, Yanyuan Qin +3Efficient Multimodal InferenceLLM Inference Acceleration

  8. SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs

    Jul 20, 2026Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow +1On-Device Language Model InferenceMemory-Efficient Inference

  9. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Mixed-Precision QuantizationLLM Quantization

  10. C2^2KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

    Jul 20, 2026Chuheng Du, Junyi Chen, Hanlin Tang +7KV CachingLLM Inference Acceleration

  11. ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts

    Jul 19, 2026Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa +1AI Accelerator InferenceMixture-of-Experts Inference

  12. SpecLA: Efficient Speculative Decoding for Linear-Attention Models

    Jul 18, 2026Zhibin Wang, Xuying Han, Zhaohua Yang +5Speculative DecodingLLM Inference Acceleration

  13. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models

  14. An MLIR-Based Compilation Method for Large Language Models

    Jul 17, 2026Pengchao Hu, Zhibin Xin, Yifan Chen +3LLM ServingLLM Inference Scheduling

  15. D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding

    Jul 16, 2026Tianyu Liu, Yuhao Shen, Rui Cen +7Speculative DecodingLLM Inference Acceleration

  16. Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

    Jul 14, 2026Abdurrahman Javat, Allan KazakovSpeculative DecodingLLM Inference Acceleration

  17. Speculate with Memory: Lossless Acceleration for LLM Agents

    Jul 14, 2026Yu Li, Qinyuan Ye, Prafulla Kumar Choubey +2Next-Action PredictionLLM Agent Memory

  18. FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

    Jul 13, 2026Wenzong Yang, Danyang Zhang, Kun Cao +17AI Accelerator InferenceLLM Inference

  19. LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

    Jul 13, 2026Ziqi Yin, Jianyang Gao, Peiqi Yin +2GPU Kernel OptimizationLLM Inference Acceleration