LLM Inference Acceleration

LLM: Large Language Model

Latest papers 683

All topics
CardsList
  1. LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning

    May 31, 2026Mengmeng Ji, Ravi Shanker Raju, Jonathan Lingjie Li +1LLM CompressionLLM Fine-Tuning

  2. Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context

    May 31, 2026Shihao Ji, Mingyu Li, Zihui SongLong-Context Language Model InferenceLLM Inference Acceleration

  3. ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

    May 30, 2026Seokjin Go, Marko Scrbak, Ephrem Wu +2Expert Load BalancingMixture-of-Experts Inference

  4. ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

    May 30, 2026Junlong Tong, Yao Zhang, Anhao Zhao +3LLM InferenceLLM Inference Acceleration

  5. Threshold-Based Exclusive Batching for LLM Inference

    May 30, 2026Weifang Zhang, Yuzhou Nie, Bowen Pang +2GPU AccelerationLLM Inference

  6. AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

    May 29, 2026Yuxin Wang, Jiahao Lu, Qifeng Wu +5Multi-Hop QARL for Language Model Reasoning

  7. CoMem: Context Management with A Decoupled Long-Context Model

    May 29, 2026Yuwei Zhang, Chengyu Dong, Shuowei Jin +11LLM InferenceLLM Inference Acceleration

  8. Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

    May 29, 2026Aditya K Kamath, Arvind Krishnamurthy, Marco Canini +1Efficient Neural Network InferenceGPU Kernel Optimization

  9. Speculative Decoding Across Languages

    May 28, 2026Nirajan Paudel, Michael Ginn, Luc De Nardi +1Multilingual Language ModelsSpeculative Decoding

  10. Unlocking the Working Memory of Large Language Models for Latent Reasoning

    May 28, 2026Lukas Aichberger, Sepp HochreiterMemory-Augmented Language ModelsEfficient Language Model Reasoning

  11. Accelerating Constrained Decoding with Token Space Compression

    May 28, 2026Michael Sullivan, Alexander KollerConstrained DecodingLLM Inference Acceleration

  12. Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

    May 28, 2026Jianuo Huang, Yaojie Zhang, Qituan Zhang +3Speculative DecodingLLM Inference Acceleration

  13. Draft-OPD: On-Policy Distillation for Speculative Draft Models

    May 28, 2026Haodi Lei, Yafu Li, Haoran Zhang +8Speculative DecodingLLM Inference Acceleration

  14. Parallax: Parameterized Local Linear Attention for Language Modeling

    May 27, 2026Yifei Zuo, Dhruv Pai, Zhichen Zeng +3Language Model PretrainingSelf-Attention

  15. Inference-Native Zeroth-Order Optimization for LLMs

    May 27, 2026Zelin Li, Caiwen DingLLM ServingZeroth-Order Optimization

  16. RW-TTT: Batched Serving for Request-Owned Test-Time Training State

    May 27, 2026Jian Yang, Zhizhuo Kou, Yao Tian +4LLM ServingTest-Time Optimization

  17. Locality-Aware Redundancy Pruning for LLM Depth Compression

    May 27, 2026Vincent-Daniel Yun, Youngrae Kim, Woosang Lim +3LLM PruningLLM Compression

  18. Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

    May 26, 2026Wenhui Tan, Minghao Li, Xiaoqian Ma +5Multi-Token PredictionLLM Compression

  19. NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

    May 26, 2026Hong Chen, Xiang Liu, Yubo Gao +5KV CachingLong-Context Language Modeling

  20. Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

    May 25, 2026Sangyun Lee, Sean McLeish, Tom Goldstein +1Memory-Augmented Language ModelsLong-Context Language Model Inference

  21. Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains

    May 25, 2026Hui Xie, Jie Liu, Ziyue Qiao +1Efficient Language Model ReasoningLLM Inference Acceleration

  22. Neural Router: Semantic Content Matching for Agentic AI

    May 25, 2026Lauri Lovén, Abhishek Kumar, Alexander Engelhardt +5Semantic Textual SimilarityLLM Inference Acceleration

  23. IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

    May 25, 2026Xintong Yang, Hao Gu, Binxing Xu +6Memory-Augmented Language ModelsSelf-Attention