Memory-Efficient Inference

Latest papers 101

All topics
CardsList
  1. SemPIC: Learning Semantic Position-Independent KV Caches

    Jul 30, 2026Hui Xie, Peng Xiao, Yutong Deng +3KV CachingMemory-Efficient Inference

  2. Memory Efficient Tabular Foundation Models

    Jul 30, 2026Shuting Luo, Monika Mikhail Kanaan, Cameron Gordon +2Model CompressionTabular Foundation Models

  3. LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

    Jul 29, 2026Ming-Yen Lee, Hanchen Yang, Faaiq Waqar +4LLM Inference EfficiencyLLM Serving

  4. Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating

    Jul 27, 2026Maruthi Vemula, Neeraj Praneeth GajulaKV CachingKV-Cache Eviction

  5. Lean-SAM2: Target-Anchored Memory and Encoder Acceleration for SAM2

    Jul 22, 2026Xudong Ouyang, Wenlun Zhang, Yimin Xu +2Memory-Augmented Neural NetworksVideo Object Segmentation

  6. SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs

    Jul 20, 2026Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow +1On-Device Language Model InferenceMemory-Efficient Inference

  7. Taurus: Accelerating Out-of-Core Graph Neural Network Inference on Billion-Scale Graphs

    Jul 19, 2026Pranjal Naman, Yogesh SimmhanEfficient Neural Network InferenceGraph Neural Networks

  8. On Exploring Input Resolution Scaling For Anytime LiDAR Object Detection

    Jul 9, 2026Ahmet Soyyigit, Shuochao Yao, Heechul YunAdaptive InferenceLidar-Based 3D Object Detection

  9. Akashic: A Low-Overhead LLM Inference Service with MemAttention

    Jul 7, 2026Yang Liu, Zhaokai Luo, Huayi Jin +7LLM ServingMemory-Augmented Language Models

  10. MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices

    Jul 7, 2026Parsa Hassani Shariat Panahi, Amir Hossein Jalilvand, M. Hassan NajafiTiny MLMemory-Efficient Inference

  11. The risk of KV cache compression

    Jul 1, 2026Lukas Haverbeck, Carmen Amo Alonso, Andres Felipe Posada-Moreno +2Transformer InferenceKV Caching

  12. Affix Cache for Diffusion Large Language Models

    Jun 26, 2026Kaihua Liang, An Zhong, Xin Tan +4KV CachingMemory-Efficient Inference

  13. Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

    Jun 21, 2026Li Kong, Qi Qi, Yinyu Ye +1LLM ServingLLM Inference Scheduling

  14. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  15. Memory Is No Longer a Bottleneck: Memory-Efficient Graph Filtering for Scalable Collaborative Filtering

    Jun 19, 2026Jin-Duk Park, Won-Yong ShinMemory-Efficient InferenceKrylov Subspace Methods

  16. VQ4SNN: Vector Quantization for Memory-Efficient FPGA Spiking Neural Networks

    Jun 12, 2026Dimitrios Sekertzis, Giorgos DimitrakopoulosMemory-Efficient InferenceVector Quantization

  17. Recursive Binding on a Budget: Subspace Carving in Order-p Tensor Memories

    Jun 9, 2026Travis Pence, Daisuke Yamada, Vikas SinghMemory-Efficient InferenceVector Symbolic Architectures

  18. FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

    Jun 8, 2026Yan Wang, Qifan Zhang, Jiachen Yu +12KV CachingLong-Context Language Model Inference

  19. Operator Fusion for LLM Inference on the Tensix Architecture

    Jun 3, 2026Qingbo Wu, Ke Li, Wenzhu Wang +3Efficient Transformer InferenceAI Accelerator Inference

  20. PrimeSVT: An Automated Memory-aware Pruning Framework with Prioritized Compression Policy for Spiking Vision Transformers

    Jun 2, 2026Rachmad Vidya Wicaksana Putra, Achyuta Muthuvelan, Alberto Marchisio +1Memory-Efficient InferenceSpiking Neural Networks