LLM Inference Acceleration

LLM: Large Language Model

Latest papers 683

All topics
CardsList
  1. Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

    Jun 11, 2026Saehun Chun, Wonje Choi, Sera Choi +2LLM-Based Program SynthesisAgentic Code Generation

  2. MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

    Jun 11, 2026Wenbo Chen, Puheng Li, Mengyang Liu +2LLM Inference EfficiencySelf-Consistency Decoding

  3. Doc-to-Atom: Learning to Compile and Compose Memory Atoms

    Jun 10, 2026Xingjian Diao, Wenbo Li, Yashas Malur Saidutta +3Memory-Augmented Language ModelsLong-Context Language Model Inference

  4. VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

    Jun 10, 2026Yuchen Xian, Yang He, Yunqiu Xu +1Speculative DecodingLLM Inference Acceleration

  5. Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

    Jun 10, 2026Kai Liu, Peijie Dong, Xinchen Xie +5RL for Language Model ReasoningLLM Inference Acceleration

  6. ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

    Jun 9, 2026Wenhao Liu, Hao Shi, Yunhe Li +7KV CachingMemory-Efficient Optimization

  7. K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

    Jun 9, 2026Zhiwei Tang, Yuanyu He, Yizheng Han +4LLM ServingLanguage Model Decoding

  8. SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

    Jun 9, 2026Jaeseong Lee, Seung-won Hwang, Samyam RajbhandariLLM PruningHigh-Performance Computing

  9. Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

    Jun 9, 2026Zhuohang Jiang, Yuxin Chen, Shijie Wang +6LLM Inference AccelerationUser Modeling

  10. Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

    Jun 9, 2026Zhiyuan Cheng, Longying LaiRetrieval-Augmented GenerationAI Accelerator Inference

  11. FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing

    Jun 8, 2026Yuhan Ma, Yong Li, Stefan SchmidSecure Multi-Party ComputationPrivacy-Preserving Language Models

  12. BUDDY: BUdget-Driven DYnamic Depth Routing for Adaptive Large Language Model Inference

    Jun 8, 2026Yuhua Zhou, Shaoqi Yu, Shichao Weng +4LLM PruningCost-Aware Inference

  13. From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs

    Jun 8, 2026Zhanchao Xu, Haoyang Li, Qingfa Xiao +4Long-Context Language Model InferenceLLM Inference Acceleration

  14. SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

    Jun 8, 2026Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja +1Retrieval-Augmented GenerationLLM Inference Acceleration

  15. Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy

    Jun 8, 2026Haozhe Hu, Hao Wu, Anhao Zhao +4LLM PruningLLM Inference Acceleration

  16. RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

    Jun 7, 2026Anirudh SekarLLM Inference EfficiencyKV Caching

  17. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  18. Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling

    Jun 7, 2026Hong Guo, Nianhui Guo, Christoph Meinel +1Markov Chain Monte CarloInference-Time Scaling

  19. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

    Jun 7, 2026Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang +3Mixed-Precision QuantizationKV Caching

  20. IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

    Jun 6, 2026Junjie Li, Jiong Lou, Jie LiKV CachingKV-Cache Management

  21. Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method

    Jun 6, 2026Kyoungmin Kim, Martin Catheland, Anastasia AilamakiSemantic SearchLLM Inference Acceleration

  22. Still: Amortized KV Cache Compaction in a Single Forward Pass

    Jun 5, 2026Charles O'Neill, Alex Sandomirsky, Harry Partridge +2KV CachingLong-Context Language Model Inference

  23. SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

    Jun 5, 2026Ernests Lavrinovics, Marco Letizia, Roy Janco +3Model CompressionLLM Compression