Memory-Efficient Optimization

Latest papers 64

All topics
CardsList
  1. AF-Muon: An AdamW-Free Muon Optimizer for Tied-Embedding Models

    Oct 1, 2026Arash Lagzian, Paniz Halvachi, Junming Zhang +2Memory-Efficient OptimizationMuon Optimizer

  2. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  3. Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

    Sep 3, 2026Heng Wang, Jielin Qiu, Wenting Zhao +8KV CachingMemory-Efficient Optimization

  4. LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference

    Sep 2, 2026Renyuan Liu, Yuyang Leng, Kaiyan Liu +7LLM Inference EfficiencyOn-Device Language Model Inference

  5. SubZero+: Memory-Efficient Adaptive Zeroth-Order LLM Fine-Tuning in Random Subspaces

    Aug 16, 2026Ziming Yu, Shuyao Xiao, Xingyu Zhao +6Memory-Efficient Fine-TuningZeroth-Order Optimization

  6. Batch Size or Negatives? A Selection Rule for Memory-Constrained Recommender Training

    Aug 11, 2026Artyom Sabitov, Daniil Volkov, Alexey ZaytsevMemory-Efficient OptimizationRecommender Systems

  7. ZeroLock: Concurrent Memory-Efficient LLM Training via Modular Update Decoupling

    Aug 8, 2026Wentao Dai, Xuanran Li, Yuxiang Zhang +2On-Device TrainingMemory-Efficient Fine-Tuning

  8. TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

    Aug 4, 2026Wonpyo Park, Seung-won HwangLLM PruningKV Caching

  9. AnchorKV: Anchor-Residual KV Cache Compression

    Aug 3, 2026Malik Khalaf, Yara Shamshoum, Nitzan Hodos +2KV CachingLong-Context Language Model Inference

  10. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction

    Aug 2, 2026Changwoo Baek, Seungjun Shin, Kyeongbo KongKV CachingMemory-Efficient Optimization

  11. HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

    Jul 24, 2026Chao Fang, Jun Yin, Man Shi +1KV CachingMemory-Efficient Optimization

  12. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  13. Stronger Memory-Query Tradeoffs for Convex Optimization: The Limitations of Subquadratic Memory

    Jul 21, 2026Michael Menart, Aleksandar Nikolov, Ohad ShamirQuery ComplexityOracle Complexity

  14. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models

  15. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression

    Jul 7, 2026Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  16. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

    Jul 7, 2026Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo +4KV CachingLong-Context Language Model Inference

  17. FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

    Jun 22, 2026Dikshant Kukreja, Kritarth Prasad, Avinash Anand +6Automatic DifferentiationBackpropagation

  18. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

    Jun 20, 2026Xin GaoTransformer InferenceKV Caching

  19. SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums

    Jun 14, 2026Igor Sokolov, Laurent Condat, Peter RichtárikMemory-Efficient OptimizationNonconvex Stochastic Optimization

  20. Gefen: Optimized Stochastic Optimizer

    Jun 11, 2026Nadav Benedek, Tomer Koren, Ohad FriedDeep Learning OptimizationMemory-Efficient Optimization

  21. ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

    Jun 9, 2026Wenhao Liu, Hao Shi, Yunhe Li +7KV CachingMemory-Efficient Optimization

  22. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels

    Jun 5, 2026Lenore Mullin, Gaetan HainsGPU Kernel OptimizationEnergy-Efficient ML

  23. Value-Aware Stochastic KV Cache Eviction for Reasoning Models

    Jun 2, 2026Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu +3LLM Inference EfficiencyKV Caching

  24. GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning

    Jun 1, 2026Liyan Tan, Yequan Zhao, Yifan Yang +3Fine-TuningMemory-Efficient Fine-Tuning

  25. LoRe: Adaptive Interaction-Evaluation Routing with Per-Step Interaction Budgets for Iterative Graph Solvers

    May 27, 2026Jintao Li, Yong-Yi Wang, Zheng-An Wang +1Efficient InferenceInference-Time Optimization

  26. GONDOR to the Rescue: Satisficing Planning with Low Memory

    May 27, 2026Yonatan Vernik, Alexander Tuisov, Alexander ShleyfmanTree SearchMemory-Efficient Optimization

  27. ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

    May 26, 2026Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang +3LLM Inference EfficiencyExpert Offloading

  28. Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage

    May 25, 2026Alan Milligan, Zikun Xu, Simon Lacoste-Julien +2Deep Learning OptimizationMemory-Efficient Optimization

  29. A Simple Plug-in for Improving Eviction-Based KV Cache Compression

    May 22, 2026Yuping Lin, Jiayuan Ding, Yue Xing +3KV CachingMemory-Efficient Optimization

  30. ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

    May 21, 2026Yeqiu Chen, Ziyan Liu, Zhenxin Huang +3Inference-Time SearchTree of Thoughts

  31. ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

    May 20, 2026Yongkang Liu, Zijing Wang, Mengjie Zhao +7Fine-TuningMemory-Efficient Fine-Tuning

  32. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

    May 17, 2026Jiayi Yao, Samuel Shen, Kuntai Du +7KV-Cache OffloadingKV Caching

  33. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

    May 13, 2026Gergely Szilvasy, Manuel Faysse, Maria Lomeli +5Self-AttentionKV Caching

  34. PowerStep: Memory-Efficient Adaptive Optimization via ℓp\ell_p-Norm Steepest Descent

    May 11, 2026Yao Lu, Dengdong Fan, Shixun Zhang +1Gradient DescentMemory-Efficient Optimization

  35. Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

    May 10, 2026Aojie Yuan, Tianqi Shen, Dajun ZhangKV-Cache OffloadingKV Caching

  36. Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

    May 9, 2026Aditya RanganathDeep Learning OptimizationMemory-Efficient Optimization

  37. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuDeep Learning OptimizationMemory-Efficient Optimization

  38. On Adaptivity in Zeroth-Order Optimization

    May 5, 2026Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser +1Zeroth-Order OptimizationLLM Fine-Tuning

  39. AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

    May 1, 2026Zhijie Cai, Haolong Chen, Guangxu ZhuMemory-Efficient Fine-TuningZeroth-Order Optimization

  40. MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches

    Apr 24, 2026Xin Wang, Chi Ma, Shaobin Chen +14KV-Cache OffloadingKV Caching

  41. LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction

    Apr 22, 2026Enshuai Zhou, Yifan Hao, Chao Wang +7KV CachingLong-Context Language Model Inference

  42. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  43. Neural Garbage Collection: Learning to Forget while Learning to Reason

    Apr 20, 2026Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox +1LLM CompressionMemory-Efficient Optimization

  44. MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

    Apr 20, 2026Libo Sun, Peixiong He, Po-Wei Harn +1LLM InferenceKV Caching

  45. MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration

    Apr 16, 2026Xinyu Liu, Xin Liu, Bo Jin +8Multi-Token PredictionKV Caching

  46. BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models

    Nov 7, 2025Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi +1LLM CompressionLong-Context Language Model Inference