LLM Inference Acceleration

LLM: Large Language Model

Latest papers 677

All topics
CardsList
  1. RaReCache: Bridging the Gap in Cross-Model KV Cache Reuse via Rank disagreement-based Selective Recomputation

    Oct 8, 2026Sreetama Sarkar, Saptarshi Mitra, Sitao Huang +2KV-Cache ReuseLLM Inference Acceleration

  2. Training Parallel Speculative Draft Models by Directly Minimizing Expected Decoding Rounds

    Oct 7, 2026Yunxiao Zhao, Changxiao CaiSpeculative DecodingLLM Inference Acceleration

  3. TAP: Efficient Long-Horizon Agent Pruning via Trajectory-Anchored Recovery

    Oct 6, 2026Yuanzhe Li, Pengxin Wang, Yuxin Ren +5LLM PruningLLM Inference Acceleration

  4. Enabling Dynamic Computation in Looped LMs

    Oct 6, 2026Aayush Mishra, Arnau Padrés Masdemont, Victor Conchello Vendrell +3LLM Inference AccelerationAdaptive Computation

  5. SSR: Sparse Segment Reduction for Ternary GEMM Acceleration

    Oct 6, 2026Adeline Pittet, Shien Zhu, Valérie Verdan +1Ternary QuantizationLLM Inference Acceleration

  6. Hybrid Latent Attention for Looped Language Models

    Oct 6, 2026Yuhan Chen, Siyuan Zhang, Nan Wang +2Long-Context Language Model InferenceLLM Inference Acceleration

  7. Nucleus Speculative Decoding: Plausibility-Aware Verification Beyond Exact Distribution

    Oct 6, 2026Shuhao Li, Fanghua Ye, Wanyu Lin +2Speculative DecodingLLM Inference Acceleration

  8. APEX: Speculate smarter, not deeper

    Oct 6, 2026Manvi Jha, Zach Zhang, Zhichao Xu +3Speculative DecodingLLM Inference Acceleration

  9. TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

    Oct 6, 2026Xin Wang, Hao Yu, Zhengyang Zhuge +9LLM QuantizationQuantization-Aware Training

  10. DLoop: Looped Speculative Decoding

    Oct 6, 2026Geonmo Gu, Byeongho Heo, HeeJae Jun +4Speculative DecodingLLM Inference Acceleration

  11. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  12. Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

    Oct 5, 2026Benhao Huang, Chufan Shi, Junlin Chen +4Efficient Language Model TrainingRecurrent Transformers

  13. OVAL: Output-Aware Local Page Bases for KV Cache Retrieval

    Oct 5, 2026Ashkan Shahbazi, Chayne Thrash, Soheil KolouriLong-Context Language Model InferenceLLM Inference Acceleration

  14. Behavior-Preserving KV Cache Compression

    Oct 5, 2026Doo Hwan Hwang, Junyoung Jang, Junho Na +2KV-Cache EvictionLLM Inference Acceleration

  15. SchemaFill: Efficient LLM Tool Calling via Slot-Parallel Speculative Decoding

    Oct 5, 2026Zhi-Kai Chen, Song-Yan Li, De-Chuan Zhan +1Speculative DecodingLLM Inference Acceleration

  16. More Value per Key: Asymmetric Sparse Attention for Faster LLM Decoding

    Oct 3, 2026Noam Elata, Itay Lamprecht, Mikey Shechter +3LLM Inference AccelerationSparse Attention

  17. DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair

    Oct 1, 2026Zhuoyu Wang, Junnan Huang, Xinyu ChenSpeculative DecodingLLM Inference Acceleration

  18. HHR: Hierarchical Hash Retrieval for Efficient LLM Generation

    Oct 1, 2026Lianjun Liu, Tiantian Zheng, You Huang +5Long-Context Language Model InferenceLLM Inference Acceleration

  19. AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing

    Sep 30, 2026Zhihui Gao, Tingjun Chen, Dirk EnglundOn-Device Language Model InferenceLLM Inference Acceleration

  20. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2LLM QuantizationLLM Inference Acceleration

  21. Efficient Expert-Parallel Communication on PCIe-Connected Consumer GPUs

    Sep 30, 2026Jaehwan Lee, Sangmin Lee, Chaewon Kim +2Expert ParallelismMixture-of-Experts Inference