LLM Inference Acceleration

LLM: Large Language Model

Latest papers 683

All topics
CardsList
  1. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

    Jun 5, 2026Qianli Ma, Zhiqing Tang, Hanshuai Cui +2LLM ServingKV Caching

  2. Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

    Jun 4, 2026Ziyue Li, Yang Li, Tianyi ZhouLLM InferenceLLM Inference Acceleration

  3. You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

    Jun 4, 2026Yutao Sun, Yanqi Zhang, Li Dong +2Long-Context Language Model InferenceKV-Cache Management

  4. Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

    Jun 4, 2026Zhuoming Chen, Xinrui Zhong, Qilong Feng +5LLM ServingLLM Inference Acceleration

  5. NTILC: Neural Tool Invocation via Learned Compression

    Jun 4, 2026Andrew Krikorian, Yayuan Li, Jason J. CorsoLLM Inference AccelerationLLM Tool Use

  6. When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

    Jun 4, 2026Luoming Zhang, Yuwei Ren, Kui Zhang +7Efficient Transformer InferenceLLM Inference Acceleration

  7. QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving

    Jun 4, 2026Jianxin Yan, Wangze Ni, Zhenxin Li +8Retrieval-Augmented GenerationKV Caching

  8. AdaPLD: Adaptive Retrieval and Reuse for Efficient Model-Free Speculative Decoding

    Jun 4, 2026Runheng Liu, Jincheng Xie, Wen Hu +2Speculative DecodingLLM Inference Acceleration

  9. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

    Jun 4, 2026Xuanzhe Li, Ziyan Weng, Zhiyu Zhu +1Efficient Transformer InferenceGPU Acceleration

  10. Less is MoE: Trimming Experts in Domain-Specialist Language Models

    Jun 4, 2026Haoze He, Xinkai Zou, Xuan Jiang +4Mixture-of-Experts PruningLLM Pruning

  11. Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge

    Jun 3, 2026Haotian Zheng, Zhanwei Wang, Mingyao Cui +3On-Device Language Model InferenceEdge Computing

  12. SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

    Jun 3, 2026Yaosheng Fu, Guangxuan Xiao, Xin Dong +2KV-Cache OffloadingLong-Context Language Model Inference

  13. D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models

    Jun 3, 2026Liyuan Zhang, Jiarui Zhang, Jinwei Yao +6Speculative Decoding for Diffusion Language ModelsSpeculative Decoding

  14. TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

    Jun 2, 2026Peer Rheinboldt, Frédéric Berdoz, Roger WattenhoferSpeculative DecodingLLM Inference Acceleration

  15. E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments

    Jun 2, 2026Truong-Thanh Le, Amir Taherkordi, Hoang-Loc La +3LLM ServingEdge Computing

  16. Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

    Jun 2, 2026Mehmet Utku ColakAI Coding AgentsLLM Prompting

  17. Experience-Driven Dynamic Exits for LLMs with Reinforcement Learning

    Jun 2, 2026Yanyu Zhu, Hoilam Pao, Niu Hu +6RL for Language ModelsSpeculative Decoding

  18. Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

    Jun 2, 2026Runpeng Dai, Tong Zheng, Rui Liu +2Reinforcement LearningTest-Time Scaling

  19. From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

    Jun 1, 2026Elia Cunegatti, Marcus Vukojevic, Erik Nielsen +1LLM PruningLLM Compression

  20. DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

    Jun 1, 2026Jiebin Zhang, Zhenghan Yu, Song Liu +9Speculative DecodingLLM Inference Acceleration

  21. Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning

    Jun 1, 2026Ting Xu, Xu He, Yupu Lu +4CoT ReasoningTest-Time Scaling

  22. Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

    Jun 1, 2026Ekaterina Alimaskina, Darya Rudas, Denis Shveykin +3LLM QuantizationEfficient Language Model Reasoning