Memory-Efficient Optimization

Latest papers 64

All topics
CardsList
  1. Value-Aware Stochastic KV Cache Eviction for Reasoning Models

    Jun 2, 2026Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu +3LLM Inference EfficiencyKV Caching

  2. GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning

    Jun 1, 2026Liyan Tan, Yequan Zhao, Yifan Yang +3Fine-TuningMemory-Efficient Fine-Tuning

  3. LoRe: Adaptive Interaction-Evaluation Routing with Per-Step Interaction Budgets for Iterative Graph Solvers

    May 27, 2026Jintao Li, Yong-Yi Wang, Zheng-An Wang +1Efficient InferenceInference-Time Optimization

  4. GONDOR to the Rescue: Satisficing Planning with Low Memory

    May 27, 2026Yonatan Vernik, Alexander Tuisov, Alexander ShleyfmanTree SearchMemory-Efficient Optimization

  5. ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

    May 26, 2026Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang +3LLM Inference EfficiencyExpert Offloading

  6. Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage

    May 25, 2026Alan Milligan, Zikun Xu, Simon Lacoste-Julien +2Deep Learning OptimizationMemory-Efficient Optimization

  7. A Simple Plug-in for Improving Eviction-Based KV Cache Compression

    May 22, 2026Yuping Lin, Jiayuan Ding, Yue Xing +3KV CachingMemory-Efficient Optimization

  8. ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

    May 21, 2026Yeqiu Chen, Ziyan Liu, Zhenxin Huang +3Inference-Time SearchTree of Thoughts

  9. ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

    May 20, 2026Yongkang Liu, Zijing Wang, Mengjie Zhao +7Fine-TuningMemory-Efficient Fine-Tuning

  10. VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

    May 17, 2026Jiayi Yao, Samuel Shen, Kuntai Du +7KV-Cache OffloadingKV Caching

  11. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

    May 13, 2026Gergely Szilvasy, Manuel Faysse, Maria Lomeli +5Self-AttentionKV Caching

  12. PowerStep: Memory-Efficient Adaptive Optimization via ℓp\ell_p-Norm Steepest Descent

    May 11, 2026Yao Lu, Dengdong Fan, Shixun Zhang +1Gradient DescentMemory-Efficient Optimization

  13. Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

    May 10, 2026Aojie Yuan, Tianqi Shen, Dajun ZhangKV-Cache OffloadingKV Caching

  14. Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

    May 9, 2026Aditya RanganathDeep Learning OptimizationMemory-Efficient Optimization

  15. Budget-aware Auto Optimizer Configurator

    May 6, 2026Kang Liu, Wei Peng, Jianchen HuDeep Learning OptimizationMemory-Efficient Optimization

  16. On Adaptivity in Zeroth-Order Optimization

    May 5, 2026Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser +1Zeroth-Order OptimizationLLM Fine-Tuning

  17. AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

    May 1, 2026Zhijie Cai, Haolong Chen, Guangxu ZhuMemory-Efficient Fine-TuningZeroth-Order Optimization

  18. MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches

    Apr 24, 2026Xin Wang, Chi Ma, Shaobin Chen +14KV-Cache OffloadingKV Caching

  19. LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction

    Apr 22, 2026Enshuai Zhou, Yifan Hao, Chao Wang +7KV CachingLong-Context Language Model Inference

  20. RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

    Apr 22, 2026Fei Zuo, Zikang Zhou, Hao Cong +2LLM Inference EfficiencyMixed-Precision Quantization

  21. Neural Garbage Collection: Learning to Forget while Learning to Reason

    Apr 20, 2026Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox +1LLM CompressionMemory-Efficient Optimization

  22. MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

    Apr 20, 2026Libo Sun, Peixiong He, Po-Wei Harn +1LLM InferenceKV Caching

  23. MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration

    Apr 16, 2026Xinyu Liu, Xin Liu, Bo Jin +8Multi-Token PredictionKV Caching

  24. BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models

    Nov 7, 2025Chandra Vamsi Krishna Alla, Harish Naidu Gaddam, Manohar Kommi +1LLM CompressionLong-Context Language Model Inference