Memory-Efficient Inference

Latest papers 101

All topics
CardsList
  1. dMoE: dLLMs with Learnable Block Experts

    May 29, 2026Sicheng Feng, Zigeng Chen, Gongfan Fang +2Mixture-of-Experts Language ModelsMemory-Efficient Inference

  2. BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

    May 29, 2026Liang He, Jingbo Wen, Qishi Zhan +4KV CachingLong-Context Language Model Inference

  3. Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

    May 22, 2026Junzhe Yang, Xiaoyu ShenKV CachingLong-Context Language Model Inference

  4. ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

    May 21, 2026Yeqiu Chen, Ziyan Liu, Zhenxin Huang +3Inference-Time SearchTree of Thoughts

  5. Memory-Efficient Partitioned DNN Inference on Resource-Constrained Android Crowds

    May 20, 2026Lakshani Manamperi, Disumi Pathirana, Thiwanka Pathirana +2Efficient Neural Network InferenceEdge Computing

  6. Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

    May 20, 2026Reese Levine, Rithik Sharma, Nikhil Jain +5GPU AccelerationLLM Inference

  7. OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

    May 19, 2026Zunhai Su, Rui Yang, Chao Zhang +11KV CachingRotation-Based Quantization

  8. KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

    May 12, 2026Alireza Nadali, Patrick Cooper, Ashutosh Trivedi +1Transformer InferenceKV Caching

  9. OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

    May 12, 2026Seungwoo Roh, Huiyeong Kim, Jong-Chan KimVLMs for Autonomous DrivingEfficient VLA Model Inference

  10. ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference

    May 11, 2026Han Meng, Danny Willow Liu, Dong LiDiffusion TransformerGPU Acceleration

  11. CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

    May 11, 2026Yuning Han, Yangchenchen Jin, Dylan Zhao +1On-Device Language Model InferenceMemory-Efficient Inference

  12. Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

    May 10, 2026Aojie Yuan, Tianqi Shen, Dajun ZhangKV-Cache OffloadingKV Caching

  13. Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

    May 8, 2026Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo +3KV-Cache ManagementMemory-Efficient Inference

  14. Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators

    May 7, 2026Anupama Sridhar, Alexander JohansenKoopman Operator LearningMemory-Efficient Inference

  15. HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

    May 7, 2026Shen Xu, Xiangwen Zhuge, Zhe Xu +3LLM CompressionMemory-Efficient Inference

  16. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM ServingLLM Inference

  17. SURGE: SuperBatch Unified Resource-efficient GPU Encoding for Heterogeneous Partitioned Data

    May 1, 2026Shashank Kapadia, Deep Narayan Mishra, Sujal Reddy Alugubelli +3Efficient Neural Network InferenceGPU Acceleration

  18. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

    Apr 29, 2026Bodon Jeong, Hongsu Byun, Youngjae Kim +4On-Device Language Model InferenceKV-Cache Offloading

  19. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  20. WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

    Apr 28, 2026Erfan Ramezani, Mohammad Mahdi Giahi, Mohammad Erfan Zarabadipour +2Streaming ASRSpeech Processing

  21. DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

    Apr 27, 2026Zahra Dehghanighobadi, Asja FischerLLM PruningKV Caching

  22. Stream-CQSA: Exact Out-of-Memory Recovery for Attention

    Apr 22, 2026Yiming Bian, Joshua M. AkeySelf-AttentionMemory-Efficient Inference

  23. Streaming Structured Inference with Flash-SemiCRF

    Apr 20, 2026Benjamin K. Johnson, Thomas Goralski, Ayush Semwal +2Efficient InferenceConditional Random Fields