LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference

    Jun 18, 2026Kaizhen Tan, Rong Gu, Mingyuan LiLLM Inference EfficiencyRetrieval-Augmented Generation

  2. EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

    Jun 17, 2026Minseo Kim, Minjae Lee, Seunghyuk Oh +7RL for Language ModelsReinforcement Learning

  3. JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

    Jun 16, 2026Lanxiang Hu, Zhaoxiang Feng, Yulun Wu +9Speculative DecodingLLM Inference Acceleration

  4. ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation

    Jun 16, 2026Yao Chen, Yinqi Yang, Junyuan Shang +6LLM Inference AccelerationSparse Attention

  5. SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs

    Jun 16, 2026Mikołaj Zasada, Łukasz Struski, Jacek Tabor +1Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  6. MIVE: A Minimalist Integer Vector Engine for Softmax LayerNorm and RMSNorm Acceleration

    Jun 16, 2026Kosmas Alexandridis, Giorgos DimitrakopoulosAI Accelerator InferenceInference Acceleration

  7. Communication-Efficient Verifiable Attention for LLM Inference

    Jun 15, 2026Ziqun Chen, Ming Wu, Michael Heinrich +4LLM InferenceTrusted Execution Environments

  8. QK-Normed MLA: QK normalization without full key caching

    Jun 15, 2026Yizhou Han, Yao Zhao, Jun Zhou +2KV CachingTransformer Attention

  9. Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

    Jun 15, 2026Xiandong Zou, Jing Huang, Jianshu Li +1RL for Language Model ReasoningEfficient Language Model Reasoning

  10. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  11. A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

    Jun 13, 2026Yingnan Zhao, Razvan Bunescu, Ahmed Louri +2AI Accelerator InferenceMixture-of-Experts Inference

  12. Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

    Jun 13, 2026Tao Lu, Haoyu Wang, Zonghui Wang +3LLM PruningGPU Kernel Optimization

  13. CONCORD: Asynchronous Sparse Aggregation for Device-Cloud RAG under Document Isolation

    Jun 13, 2026Xuedong Hu, Zhiqing Tang, Zhi Yao +2Retrieval-Augmented GenerationPrivacy-Preserving Language Models

  14. Director: Accelerating Distributed MoE Serving via Online Proactive Expert Placement

    Jun 13, 2026Qianli Liu, Kaibin Guo, Zicong Hong +5Expert ParallelismLLM Serving

  15. Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

    Jun 12, 2026Shikun Liu, Mufei Li, Dongqi Fu +5Multi-Agent LLM SystemsKV-Cache Management

  16. SuperThoughts: Reasoning Tokens in Superposition

    Jun 11, 2026Zheyang Xiong, Shivam Garg, Max Yu +4Multi-Token PredictionLLM Inference Acceleration

  17. Beyond Uniform Tokens: Adaptive Compression for Time Series Language Models

    Jun 11, 2026Jialin Gan, Xin Qiu, Guangzhe Chen +1LLM Inference AccelerationMultimodal Token Compression

  18. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  19. ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

    Jun 11, 2026Sihwa Lee, Janghwan Lee, Donghoon Yoo +4LLM QuantizationLanguage Model Decoding

  20. MiniPIC: Flexible Position-Independent Caching in <100LOC

    Jun 11, 2026Nathan Ordonez, Thomas ParnellLLM Inference EfficiencyKV Caching

  21. Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

    Jun 11, 2026Saehun Chun, Wonje Choi, Sera Choi +2LLM-Based Program SynthesisAgentic Code Generation

  22. MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

    Jun 11, 2026Wenbo Chen, Puheng Li, Mengyang Liu +2LLM Inference EfficiencySelf-Consistency Decoding

  23. Doc-to-Atom: Learning to Compile and Compose Memory Atoms

    Jun 10, 2026Xingjian Diao, Wenbo Li, Yashas Malur Saidutta +3Memory-Augmented Language ModelsLong-Context Language Model Inference

  24. VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

    Jun 10, 2026Yuchen Xian, Yang He, Yunqiu Xu +1Speculative DecodingLLM Inference Acceleration

  25. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5RL for Language Model ReasoningLLM Inference Acceleration