LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

    Jun 30, 2026Wenhao Li, Jinhao Dong, Hailin Zhang +3KV CachingLong-Context Language Model Inference

  2. Hierarchical Global Attention (HGA)

    Jun 29, 2026Woernle Frank, Fedosov Vladimir, Grinenko ArtemiyKV-Cache OffloadingLong-Context Modeling

  3. Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding

    Jun 29, 2026Tianyu Wang, Gourav Rattihalli, Aditya Dhakal +4Long-Context Language Model InferenceLLM Inference Acceleration

  4. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers

    Jun 29, 2026Linrui Ma, Chun Hei Lo, Xinyu Wang +12In-Context RetrievalLong-Context Language Modeling

  5. Depth Exploration for LLM Decoding

    Jun 28, 2026Weisi Yang, Zipeng Sun, Stephen XiaLanguage Model DecodingLLM Inference Acceleration

  6. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression

    Jun 27, 2026Yuxuan Yang, Feiyang Ren, Bowen Zeng +4KV CachingLong-Context Language Model Inference

  7. FlexMoE: One-for-All Nested Intra-Expert Pruning for MoE Language Models

    Jun 26, 2026Fan Mo, Yuxuan Han, Geng Zhang +2Mixture-of-Experts PruningLLM Pruning

  8. End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

    Jun 26, 2026Yuhang Chen, Jinhao Duan, Ruichen Zhang +11LLM InferenceStructured Sparsity

  9. CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

    Jun 25, 2026Shigeng Wang, Chao Li, Yangyuxuan Kang +2LLM QuantizationTernary Quantization

  10. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +44-Bit QuantizationLLM Inference Acceleration

  11. ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

    Jun 24, 2026Sining Ang, Yuan Chen, Liu Haiyan +5LLM Inference AccelerationAutonomous Driving Planning

  12. Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

    Jun 23, 2026WenHung Lee, Jian-Jia Chen, Xiaolin Lin +6Long-Context Language Model InferenceKV-Cache Management

  13. RoPE-Aware Bit Allocation for KV-Cache Quantization

    Jun 23, 2026Fengfeng Liang, Yuechen Zhang, Jiaya JiaKV CachingLLM Inference Acceleration

  14. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  15. FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

    Jun 22, 2026Yinpeng Wu, Yitong Chen, Lixiang Wang +3LLM ServingOn-Device Language Model Inference

  16. EnerInfer: Energy-Aware On-Device LLM Inference

    Jun 22, 2026Bohua Zou, Nian Liu, Binqi Sun +6On-Device Language Model InferenceLLM Inference Acceleration

  17. SwarmX: Agentic Scheduling for Low-Latency Agentic Systems

    Jun 19, 2026Yeqi Huang, Yanwei Ye, Guomin Chen +8Agentic WorkflowsLLM Inference Acceleration

  18. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

    Jun 19, 2026Yang Shen, Meghana Madhyastha, Robert Underwood +2LLM ServingKV Caching

  19. Masked Self-Distillation: Internalizing the Chain-of-Thought in Language Models

    Jun 18, 2026Durgesh Kalwar, Vardhan Palod, Jaya Adithya Pavuluri +1CoT DistillationEfficient Language Model Reasoning

  20. Token-Operations-Oriented Inference Optimization Techniques for Large Models

    Jun 18, 2026Shiguo Lian, Kai Wang, Zhaoxiang Liu +22LLM ServingInference-Time Optimization

  21. Activation- and Influence-Aware Ranks (AIR): Function-Preserving SVD Compression for LLMs

    Jun 18, 2026Nico Harder, Daniel Becking, Karsten Mueller +1LLM CompressionLow-Rank Matrix Decomposition

  22. SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

    Jun 18, 2026Haotian Xu, Zeyang Zhang, Linbao Li +3Speculative DecodingLLM Inference Acceleration