LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

    Apr 28, 2026Ma Zirui, Fan Zhihua, Li Wenxing +4Compute-in-MemoryOn-Device Language Model Inference

  2. Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning

    Apr 27, 2026Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim +3LLM PruningLLM Inference Acceleration

  3. Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

    Apr 27, 2026Zihuai Xu, Ruofei Hou, Yang Xu +3Retrieval-Augmented GenerationOn-Device Language Model Inference

  4. AgenticCache: Cache-Driven Asynchronous Planning for Embodied AI Agents

    Apr 27, 2026Hojoon Kim, Yuheng Wu, Thierry TambeLLM PlanningLLM Inference Acceleration

  5. Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

    Apr 27, 2026Amogh Sheth, Biruk Assefa, Yi Wen Huang +2LLM PruningSelf-Attention

  6. Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

    Apr 26, 2026Zichuan Fu, Xian Wu, Guojing Li +7Efficient Language Model ReasoningLLM Inference Acceleration

  7. Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

    Apr 25, 2026Divakar Kumar Yadav, Tian ZhaoLLM InferenceLLM Inference Acceleration

  8. Large Language Models Decide Early and Explain Later

    Apr 24, 2026Ayan Datta, Zhixue Zhao, Bhuvanesh Verma +3Efficient Language Model ReasoningLLM Inference Acceleration

  9. ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

    Apr 24, 2026Xiaojie Ke, Shuai Zhang, Liansheng Sun +6Learning to RankLLM Reranking

  10. LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs

    Apr 23, 2026Mohamed Ali Souibgui, Jan Fostier, Rodrigo Abadía-Heredia +3Transformer AttentionLLM Inference Acceleration

  11. SparKV: Overhead-Aware KV Cache Loading for Efficient On-Device LLM Inference

    Apr 23, 2026Hongyao Liu, Liuqun Zhai, Junyi Wang +3On-Device Language Model InferenceKV-Cache Offloading

  12. FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression

    Apr 22, 2026Ye Qiao, Yian Wang, Zhiheng Chen +2LLM CompressionGPU Acceleration

  13. Simplified Sparse Attention via Gist Tokens

    Apr 22, 2026Yuzhen Mao, Michael Y. Li, Emily B. FoxSelf-AttentionLong-Context Language Model Inference

  14. Super Apriel: One Checkpoint, Many Speeds

    Apr 21, 2026SLAM Labs, :, Oleksiy Ostapenko +13LLM Inference AccelerationAttention Mechanisms

  15. Micro Language Models Enable Instant Responses

    Apr 21, 2026Wen Cheng, Tuochao Chen, Karim Helwani +3On-Device Language Model InferenceSmall Language Models

  16. DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing

    Apr 21, 2026Jinyu Guo, Zhihan Zhang, Jiehui Xie +7Long-Context Language Model InferenceLLM Inference Acceleration

  17. Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs

    Apr 20, 2026Afsara Benazir, Felix Xiaozhu LinAI Accelerator InferenceEnergy-Efficient ML

  18. River-LLM: Large Language Model Seamless Exit Based on KV Share

    Apr 20, 2026Yingtao Shen, An ZouDecoder-Only Language ModelsKV-Cache Management

  19. AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization

    Apr 20, 2026Kosuke Matsushima, Yasuyuki Okoshi, Masato Motomura +1Compute-in-MemoryLong-Context Language Model Inference

  20. Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

    Apr 20, 2026Yujie Chen, Tailai Chen, Yifeng Gao +4Self-AttentionLong-Context Language Model Inference

  21. Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

    Apr 20, 2026Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala +13On-Device Language Model InferenceLLM Inference