Graphics Processing Unit Memory

Latest papers 40

All topics
CardsList
  1. KV-streams for Efficient Compaction in Agentic Reinforcement Learning

    Sep 28, 2026Emiliano Penaloza, Dane Malenfant, Dheeraj Vattikonda +15CompactionAgentic Reinforcement Learning

  2. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2Graphics Processing Unit MemoryKv-Cache Management

  3. Does Execution Require Target KV Fidelity? A Mixed-Fidelity KV Runtime for LLM Serving

    Sep 27, 2026Jiantong Jiang, Yue Yang, Peiyu Yang +1Large Language Model ServingKeys And Value

  4. OLED-MoE: Accelerating MoE-Based dLLM Inference via Inter-Iteration Locality-Aware Expert Offloading

    Sep 27, 2026Jingyuan Xiao, Jiayue Wang, Yitao Hu +7Mixture-Of-Expert InferenceOffloading

  5. Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

    Sep 16, 2026Yipeng Liu, Yingqiang Zhang, Feifei Li +1CallKey-Value Cache

  6. Layer-wise Curriculum Learning for Efficient LLM Compression

    Sep 16, 2026Donggeon Lee, Dooyeon Na, Seungmin Oh +1Large Language Model CompressionAdaptive Curriculum

  7. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention

    Sep 14, 2026Arya Tschand, Yaosheng Fu, Vikram Sharma Mailthody +6Linear AttentionGraphics Processing Unit Memory

  8. LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

    Aug 12, 2026Xiaojun Wu, Cehao Yang, Honghao Liu +5Large Language Model TrainingGraphics Processing Unit Memory

  9. SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

    Aug 8, 2026Jiamu Zhang, Liang Wu, Kelly Wan +2Key-Value CacheCache

  10. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1Low-Rank Adaptation AdaptersHip-Lora

  11. EMAGN: Efficient Multi-Attention Graph Network via Learned Clustering for Scalable Traffic Forecasting

    Jul 14, 2026Mingxing Xu, Rakesh Chowdary Machineni, Ke Liu +7Interleaved Graph AttentionAccurate Traffic Forecasting

  12. MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression

    Jul 1, 2026Sheng Qiang, Ruiwei Chen, Yinpeng Wu +5Key-Value Cache CompressionLarge Language Model Compression

  13. SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

    Jun 30, 2026Amirhossein Abaskohi, Giuseppe Carenini, Peter West +1Key-Value Cache CompressionKey-Value Cache

  14. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Large Language Model QuantizationGradient Quantization

  15. EvoGS: Constructing Continuous-Layered Gaussian Splatting with Evolution Tree for Scalable 3D Streaming

    Jun 5, 2026Yuang Shi, Simone Gasparini, Géraldine Morin +1Gaussian SplattingVolumetric Video

  16. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

    Jun 4, 2026Yang Liu, ZhaoKai Luo, HuaYi Jin +5Kv-Cache ManagementKey-Value Cache

  17. STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

    Jun 1, 2026Yuhang Han, Wenzheng Yang, Yujie Chen +4Key-Value Cache CompressionGraphics Processing Unit Memory

  18. BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

    May 29, 2026Liang He, Jingbo Wen, Qishi Zhan +4Speculative DecodingGraphics Processing Unit Memory

  19. Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

    May 29, 2026Aditya K Kamath, Arvind Krishnamurthy, Marco Canini +1Graphics Processing Unit MemoryLLM Inference Optimization

  20. Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

    May 19, 2026Mert Yildiz, Pietro Spadaccino, Alexey Rolich +2PreemptionOffloading

  21. KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference

    May 18, 2026Jian Lin, Jiazhi Mi, Zicong Hong +5Kv-Cache ManagementKey-Value Cache

  22. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

    May 17, 2026Jiayi Yao, Samuel Shen, Kuntai Du +7Key-Value CacheLLM Inference Optimization

  23. A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

    May 15, 2026Shaoke Xi, ChonLam Lao, Boyi Jia +11Large Language Model TrainingLarge Language Models(Llms

  24. OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

    May 12, 2026Seungwoo Roh, Huiyeong Kim, Jong-Chan KimDiffusion-Based Vision-Language-ActionsGraphics Processing Unit Memory

  25. ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference

    May 11, 2026Han Meng, Danny Willow Liu, Dong LiOffloadingPreemption

  26. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuOptimizer DesignGraphics Processing Unit Memory

  27. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM Inference OptimizationGraphics Processing Unit Memory

  28. AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

    May 1, 2026Zhijie Cai, Haolong Chen, Guangxu ZhuAdamZeroth-Order Optimization

  29. AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

    May 1, 2026Wenxiang Lin, Juntao Huang, Luhan Zhang +5Large Language Model QuantizationGradient Quantization

  30. Lightweight Distillation of SAM 3 and DINOv3 for Edge-Deployable Individual-Level Livestock Monitoring and Longitudinal Visual Analytics

    Apr 29, 2026Haiyu Yang, Miel HostensDinov3Vision Encoders

  31. AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

    Apr 28, 2026Zhongkai Yu, Haotian Ye, Chenyang Zhou +9Graphics Processing Unit MemoryLinear Attention

  32. MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches

    Apr 24, 2026Xin Wang, Chi Ma, Shaobin Chen +14Sequential RecommendationGraphics Processing Unit Memory

  33. Stream-CQSA: Exact Out-of-Memory Recovery for Attention

    Apr 22, 2026Yiming Bian, Joshua M. AkeyGraphics Processing Unit Memory