LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

    Apr 20, 2026You-Liang Huang, Xinhao Huang, Chengxi Liao +1LLM InferenceLLM Inference Acceleration

  2. Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling

    Apr 19, 2026Zizhang Luo, Yuhao Luo, Youwei Xiao +3LLM Inference EfficiencyMulti-Agent LLM Systems

  3. CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning

    Apr 19, 2026Yangsong Lan, Hongliang Dai, Piji LiLLM PruningLLM Compression

  4. Probabilistic Programs of Thought

    Apr 19, 2026Poorva Garg, Renato Lui Geh, Daniel Israel +3LLM-Based Program SynthesisEfficient Language Model Reasoning

  5. UCCL-Zip: Lossless Compression Supercharged GPU Communication

    Apr 19, 2026Shuang Ma, Chon Lam Lao, Zhiying Xu +8GPU Kernel OptimizationGPU Acceleration

  6. Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

    Apr 18, 2026Benteng Chen, Weida Wang, Shufei Zhang +2RL for Language Model ReasoningLLM Inference Acceleration

  7. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4GPU AccelerationSelf-Attention

  8. Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning

    Apr 17, 2026Jiaxi Bi, Tongxu Luo, Wenyu Du +2LLM Inference AccelerationLarge Reasoning Models

  9. EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation

    Apr 17, 2026Shuyu Zhang, Lingfeng Pan, Qicheng Wang +6Speculative DecodingLLM Inference Acceleration

  10. Faster LLM Inference via Sequential Monte Carlo

    Apr 17, 2026Yahya Emara, Mauricio Barba da Costa, Chi-Chih Chang +4Speculative DecodingLLM Inference Acceleration

  11. From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning

    Apr 16, 2026Kiran Purohit, Ramasuri Narayanam, Soumyabrata PalLLM Answer VerificationSpeculative Decoding

  12. ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

    Apr 16, 2026Haohui Mai, Xiaoyan Guo, Xiangyun Ding +7GPU Kernel OptimizationGPU Acceleration

  13. MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration

    Apr 16, 2026Xinyu Liu, Xin Liu, Bo Jin +8Multi-Token PredictionKV Caching

  14. RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

    Apr 16, 2026Zihong Zhang, Zuchao Li, Lefei Zhang +2Speculative DecodingLLM Inference Acceleration

  15. TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

    Apr 16, 2026Yi Zhao, Yajuan Peng, Cam-Tu Nguyen +4Efficient Language Model ReasoningLLM Inference Acceleration

  16. ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding

    Apr 16, 2026Walaa Amer, Uday das, Fadi KurdahiSpeculative DecodingLLM Inference Acceleration

  17. Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

    Apr 11, 2026Tiancheng Hu, Jin Qin, Zheng Wang +10GPU AccelerationLLM Inference Acceleration

  18. SMART: When is it Actually Worth Expanding a Speculative Tree?

    Apr 9, 2026Lifu Wang, Pan ZhouInference-Time OptimizationGPU Acceleration

  19. Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference

    Apr 8, 2026Quantong Qiu, Zhiyi Hong, Yi Yang +5Self-AttentionLong-Context Language Model Inference

  20. Screening Is Enough

    Apr 1, 2026Ken M. NakanishiSelf-AttentionLong-Context Language Modeling

  21. Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

    Apr 1, 2026Zhensu Sun, Zhihao Lin, Zhi Chen +4LLM Inference AccelerationPipeline Parallelism

  22. SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

    Mar 24, 2026Haoyu Huang, Jinfa Huang, Zhongwei Wan +3Efficient Multimodal InferenceLLM Inference Acceleration

  23. Learning When to Attend: Conditional Memory Access for Long-Context LLMs

    Mar 18, 2026Sakshi Choudhary, Aditya Chattopadhyay, Luca Zancato +4Self-AttentionLong-Context Language Modeling

  24. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Mar 10, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference