Memory-Efficient Inference

Latest papers 101

All topics
CardsList
  1. dMoE: dLLMs with Learnable Block Experts

    May 29, 2026Sicheng Feng, Zigeng Chen, Gongfan Fang +2Mixture-of-Experts Language ModelsMemory-Efficient Inference

  2. BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

    May 29, 2026Liang He, Jingbo Wen, Qishi Zhan +4KV CachingLong-Context Language Model Inference

  3. Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

    May 22, 2026Junzhe Yang, Xiaoyu ShenKV CachingLong-Context Language Model Inference

  4. ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

    May 21, 2026Yeqiu Chen, Ziyan Liu, Zhenxin Huang +3Inference-Time SearchTree of Thoughts

  5. Memory-Efficient Partitioned DNN Inference on Resource-Constrained Android Crowds

    May 20, 2026Lakshani Manamperi, Disumi Pathirana, Thiwanka Pathirana +2Efficient Neural Network InferenceEdge Computing

  6. Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

    May 20, 2026Reese Levine, Rithik Sharma, Nikhil Jain +5GPU AccelerationLLM Inference

  7. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11KV CachingRotation-Based Quantization

  8. KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

    May 12, 2026Alireza Nadali, Patrick Cooper, Ashutosh Trivedi +1Transformer InferenceKV Caching

  9. OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

    May 12, 2026Seungwoo Roh, Huiyeong Kim, Jong-Chan KimVLMs for Autonomous DrivingEfficient VLA Model Inference

  10. ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference

    May 11, 2026Han Meng, Danny Willow Liu, Dong LiDiffusion TransformerGPU Acceleration

  11. CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

    May 11, 2026Yuning Han, Yangchenchen Jin, Dylan Zhao +1On-Device Language Model InferenceMemory-Efficient Inference

  12. Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

    May 10, 2026Aojie Yuan, Tianqi Shen, Dajun ZhangKV-Cache OffloadingKV Caching

  13. Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

    May 8, 2026Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo +3KV-Cache ManagementMemory-Efficient Inference

  14. Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators

    May 7, 2026Anupama Sridhar, Alexander JohansenKoopman Operator LearningMemory-Efficient Inference

  15. HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

    May 7, 2026Shen Xu, Xiangwen Zhuge, Zhe Xu +3LLM CompressionMemory-Efficient Inference

  16. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM ServingLLM Inference

  17. SURGE: SuperBatch Unified Resource-efficient GPU Encoding for Heterogeneous Partitioned Data

    May 1, 2026Shashank Kapadia, Deep Narayan Mishra, Sujal Reddy Alugubelli +3Efficient Neural Network InferenceGPU Acceleration

  18. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

    Apr 29, 2026Bodon Jeong, Hongsu Byun, Youngjae Kim +4On-Device Language Model InferenceKV-Cache Offloading

  19. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  20. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Streaming ASRSpeech Processing

  21. DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

    Apr 27, 2026Zahra Dehghanighobadi, Asja FischerLLM PruningKV Caching

  22. Stream-CQSA: Exact Out-of-Memory Recovery for Attention

    Apr 22, 2026Yiming Bian, Joshua M. AkeySelf-AttentionMemory-Efficient Inference

  23. Streaming Structured Inference with Flash-SemiCRF

    Apr 20, 2026Benjamin K. Johnson, Thomas Goralski, Ayush Semwal +2Efficient InferenceConditional Random Fields

  24. Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language Models

    Apr 20, 2026Tobias Grantner, Emanuel Sallinger, Martin FlechlMemory-Efficient InferenceText Embedding Models

  25. Towards Deep Encrypted Training: Low-Latency, Memory-Efficient, and High-Throughput Inference for Privacy-Preserving Neural Networks

    Apr 18, 2026Nges Brian Njungle, Eric Jahns, Michel A. KinsyEfficient Neural Network InferenceMemory-Efficient Inference

  26. MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration

    Apr 16, 2026Xinyu Liu, Xin Liu, Bo Jin +8Multi-Token PredictionKV Caching

  27. VTC: DNN Compilation with Virtual Tensors for Data Movement Elimination

    Feb 11, 2026Muyan Hu, Ahan Gupta, Jiachen Yuan +7Efficient Neural Network InferenceMemory-Efficient Inference

  28. NOSA: Native and Offloadable Sparse Attention

    Oct 15, 2025Yuxiang Huang, Pengjie Wang, Jicheng Han +9KV-Cache OffloadingGPU Acceleration

  29. ReFreeKV: Towards Threshold-Free KV Cache Compression

    Feb 24, 2025Xuanfan Ni, Liyan Xu, Chenyang Lyu +6KV CachingMemory-Efficient Optimization

  30. FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices

    Jan 13, 2025Yuji Chai, Mujin Kwun, David Brooks +1LLM QuantizationOn-Device Language Model Inference

  31. FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving

    Date pendingQingxiu Liu, Yongchao He, Runhan Jiang +4Expert OffloadingGPU Acceleration

  32. Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference

    Date pendingZhenhe Wu, Yaping Jin, Qinghua Xing +6Mixture of ExpertsMemory-Efficient Optimization