LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

    May 7, 2026Bole Ma, Jan Eitzinger, Harald KöstlerKV CachingLLM Inference Serving

  2. UniVer: A Unified Perspective for Multi-step and Multi-draft Speculative Decoding

    May 6, 2026Yepeng Weng, Qiao Hu, Takehisa YairiSpeculative DecodingLLM Inference Acceleration

  3. Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference

    May 5, 2026Mohammed Sabry, Anya BelzLLM CompressionLow-Rank Adaptation

  4. Parallel Prefix Verification for Speculative Generation

    May 5, 2026Yuncheng Yao, Yuxuan Xia, Shengjie Wang +1Speculative DecodingLLM Inference Acceleration

  5. AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse

    May 5, 2026Jie Ou, Jinyu Guo, Shiyao Guo +5Long-Context Language Model InferenceKV-Cache Management

  6. Performance Optimization and Comparative Analysis of Generative AI Models on Advanced Accelerators

    May 5, 2026Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral +3Mixed-Precision QuantizationAI Accelerator Inference

  7. Gated Subspace Inference for Transformer Acceleration

    May 4, 2026Stephen J. ThomasTransformer InferenceLLM Inference Acceleration

  8. The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

    May 4, 2026Tu Nguyen, Matthieu Zimmer, Rasul Tutunov +2Language Model DecodingLLM Inference Acceleration

  9. Statistically-Lossless Quantization of Large Language Models

    May 4, 2026Michael Helcig, Eldar Kurtic, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  10. Stochastic Sparse Attention for Memory-Bound Inference

    May 3, 2026Kyle Lee, Corentin Delacour, Kevin Callahan-Coray +5GPU AccelerationSelf-Attention

  11. Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism

    May 3, 2026Long Zhao, Qinghe Wang, Jiaan Zhu +5Tensor ParallelismLLM Inference Acceleration

  12. SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

    May 3, 2026Yipin Guo, Siddharth JoshiLLM ServingKV Caching

  13. Tempus: A Temporally Scalable Resource-Invariant GEMM Streaming Framework for Versal AI Edge

    May 1, 2026M. Grailoo, J. Núñez-YáñezLLM Inference AccelerationFPGA Acceleration

  14. Rethinking LLM Ensembling from the Perspective of Mixture Models

    May 1, 2026Jiale Fu, Yuchu Jiang, Peijun Wu +3LLM Inference AccelerationLLM Routing

  15. Caracal: Causal Architecture via Spectral Mixing

    Apr 30, 2026Bingzheng Gan, Tianyi Zhang, Yusu Li +4Long-Context Language ModelingAutoregressive Language Modeling

  16. Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation

    Apr 30, 2026Jiaju Chen, Chongming Gao, Chenxiao Fan +4Speculative DecodingLLM Inference Acceleration

  17. To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

    Apr 30, 2026Wei Cheng, Yongchang Cao, Chen Shen +4Code GenerationLLM Inference Acceleration

  18. When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?

    Apr 29, 2026Tianyu Liu, Yuhao Shen, Xinyi Hu +8Speculative DecodingLLM Inference Acceleration

  19. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  20. Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction

    Apr 29, 2026Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani +2LLM Inference AccelerationParallel Decoding

  21. AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

    Apr 28, 2026Zhongkai Yu, Haotian Ye, Chenyang Zhou +9Compute-in-MemoryLLM Inference Acceleration

  22. Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models

    Apr 28, 2026Ajmain Inqiad Alam, Palash Roy, Chanchal K. Roy +2Software EngineeringLLM Compression