LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jian Zhang +3KV CachingKV-Cache Management

  2. Test-Time Speculation

    May 10, 2026Avinash Kumar, Sujay Sanghavi, Poulami DasTest-Time AdaptationTest-Time Optimization

  3. Sparse Layers are Critical to Scaling Looped Language Models

    May 9, 2026Ryan Lee, Jacob Biloki, Edward J. Hu +1Mixture-of-Experts Language ModelsRecurrent Transformers

  4. ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

    May 9, 2026Junjie Li, Jiong Lou, Jie LiLLM PruningKV Caching

  5. ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing

    May 9, 2026Yongqi An, Chang Lu, Kuan Zhu +5KV CachingLong-Context Language Model Inference

  6. PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding

    May 9, 2026Zihao An, Taichi Liu, Ziqiong Liu +3Speculative DecodingLLM Inference Acceleration

  7. PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

    May 9, 2026Xingyu Qu, Tianhao Lin, Yiqi Li +2LLM ServingKV Caching

  8. Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

    May 9, 2026Jongseok Park, Sunga Kim, Zhenyu Gu +2Activation SparsityMixture-of-Experts Inference

  9. Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression

    May 9, 2026Hengyi Zhu, Zhendong Mi, Grace Li Zhang +1LLM CompressionLow-Rank Matrix Decomposition

  10. Fast Byte Latent Transformer

    May 8, 2026Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz +5Speculative DecodingLLM Inference Acceleration

  11. FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast

    May 8, 2026Wenhao Wu, Zishan Shao, Kangning Cui +5Efficient Transformer InferenceLLM Compression

  12. An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference

    May 8, 2026Feiyu Yao, Zhixiong Niu, Xiaqing Li +3GPU AccelerationSelf-Attention

  13. CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

    May 8, 2026Robin Karlsson, Go SuzuiRobotic ControlLanguage Model-Based Control

  14. LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification

    May 8, 2026Xuan Li, Yining Wang, Yuchen Liu +7CoT ReasoningEfficient Language Model Reasoning

  15. SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

    May 8, 2026Weijie Shi, Qiang Xu, Fan Deng +9Speculative DecodingLLM Inference Acceleration

  16. Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache

    May 7, 2026Mohsen Dehghankar, Abolfazl AsudehSelf-AttentionKV Caching

  17. Grokers: Bottom-Up Inductive Comprehension and Write-Time Intelligence over Typed Knowledge Graphs

    May 7, 2026Gregory MagarshakKG ConstructionMemory-Augmented Language Models

  18. LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

    May 7, 2026Yijia Zheng, Marcel WorringLLM Inference AccelerationAgentic RAG

  19. Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility

    May 7, 2026Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji +2Self-AttentionLong-Context Language Model Inference

  20. HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

    May 7, 2026Shen Xu, Xiangwen Zhuge, Zhe Xu +3LLM CompressionMemory-Efficient Inference