LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

    Jul 12, 2026Zipeng Gao, Zhi Zheng, Qingrong Xia +5Speculative DecodingLLM Inference Acceleration

  2. MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

    Jul 12, 2026Venkatesha Matam, Keon KimKV CachingKV-Cache Eviction

  3. Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices

    Jul 11, 2026Yangyijian Liu, Hongyi Ye, Mingyang Li +1On-Device Language Model InferenceLLM Inference Scheduling

  4. COBS: Cumulant Order Block Sparse Attention

    Jul 10, 2026Alexander Tian, Aditya Ghai, Sanjit Neelam +2KV CachingLLM Inference Acceleration

  5. Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

    Jul 9, 2026Bishmoy Paul, Youngmin Yi, Hoeseok YangLLM PruningActivation Sparsity

  6. DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

    Jul 9, 2026Saw S. Lin, Jyh-Shing Roger JangSpeculative DecodingLLM Inference Acceleration

  7. Prompt Compression via Activation Aggregation

    Jul 9, 2026Thibaud Ardoin, Semira Einsele, Evis Bregu +1LLM Inference AccelerationRepresentation Geometry in Language Models

  8. Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

    Jul 9, 2026Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita +4LLM PruningLLM Compression

  9. CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems

    Jul 8, 2026Tingkai Liu, Muralidhar Andoorveedu, Sanjoy Das +2GPU Kernel OptimizationHigh-Performance Computing

  10. The Key to Going Linear: Analysis-Driven Transformer Linearization

    Jul 8, 2026Anna Kuzina, Paul N. Whatmough, Babak Ehteshami BejnordiSoftmax AttentionLLM Inference Acceleration

  11. DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting

    Jul 8, 2026Hong-Kai Zheng, Piji LiSpeculative DecodingLLM Inference Acceleration

  12. TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models

    Jul 8, 2026Yutang Ma, Kecheng Huang, Xikun Jiang +1Memory-Augmented Language ModelsKnowledge Augmentation for Language Models

  13. Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

    Jul 7, 2026Ke-Han Lu, Keqi Deng, Ruchao Fan +2KV CachingAutomatic Speech Recognition

  14. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  15. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  16. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

    Jul 6, 2026Xin Cheng, Xingkai Yu, Chenze Shao +30LLM ServingSpeculative Decoding

  17. KVpop -- Key-Value Cache Compression with Predictive Online Pruning

    Jul 6, 2026Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl +5KV CachingKV-Cache Eviction

  18. ELiTeFormer: An Efficient Transformer for FPGAs

    Jul 4, 2026Victor Agostinelli, Nicolas Bohm Agostini, Antonino TumeoLLM QuantizationTernary Quantization

  19. Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

    Jul 2, 2026Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj +2LLM ServingDisaggregated LLM Serving

  20. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3LLM InferenceKV Caching

  21. PARTREP: Learning What to Repeat for Decoder-only LLMs

    Jul 2, 2026Andikawati P Widjaja, Yongjun Kim, Hyounghun Kim +1Decoder-Only Language ModelsLLM Prompting

  22. Message Passing Enables Efficient Reasoning

    Jul 1, 2026Xuecheng Liu, Daman Arora, Gokul Swamy +1Inference-Time ScalingEfficient Language Model Reasoning

  23. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5KV CachingLong-Context Language Model Inference

  24. BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

    Jul 1, 2026Prabod Rathnayaka, Fabian Waschkowski, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference