LLM Inference Efficiency

LLM: Large Language Model

Latest papers 234

All topics
CardsList
  1. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1LLM Inference EfficiencyLLM Serving

  2. Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

    Jul 9, 2026Kalle Kujanpää, Ning Liu, Shahnawaz Alam +4LLM Inference EfficiencyLLM Agent Self-Improvement

  3. Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    Jul 7, 2026Kai Ruan, Zihe Huang, Ziqi Zhou +4LLM Inference EfficiencyEarly Stopping

  4. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4LLM Inference EfficiencyAI Accelerator Inference

  5. Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

    Jul 5, 2026Muhammad Mansoor, Tahir Ahmad, Yeo-Chan YoonLLM Inference EfficiencyRetrieval-Augmented Generation

  6. SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

    Jul 3, 2026Huajun Bai, Weiwei Lv, Huichuan Zheng +2LLM Inference EfficiencyLLM Agent Orchestration

  7. WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

    Jul 2, 2026Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezLLM Inference EfficiencyEnergy-Efficient ML

  8. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    Jul 2, 2026Xuqing Yang, Yi Yuan, Shanzhe Lei +1LLM Inference EfficiencyRL for Language Models

  9. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    Jun 30, 2026Jie Li, Tongyang Wang, Yong ChenLLM Inference EfficiencyLLM Serving

  10. Fork-Think with Confidence

    Jun 30, 2026Zena Al-Khalili, Rafi Hakim, Dietrich Klakow +1LLM Inference EfficiencyEfficient Language Model Reasoning

  11. When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

    Jun 30, 2026Orian Dabod, Amir DN Cohen, Gabriel StanovskyLLM Inference EfficiencyFew-Shot Learning

  12. Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

    Jun 24, 2026Xinyu Lian, Walid Krichene, Beichen Huang +4LLM Inference EfficiencyLLM Quantization

  13. CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

    Jun 23, 2026Xiaolin Lin, Jingcun Wang, Olga Kondrateva +3LLM Inference EfficiencyKV Caching

  14. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

    Jun 20, 2026Naihao Deng, Alissa Shen, Yiming Feng +5LLM Inference EfficiencyMultilingual Language Models

  15. Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study

    Jun 19, 2026Alfarizy Alfarizy, Hung Truong Thanh Nguyen, René Richard +2LLM Inference EfficiencyOn-Device Language Model Inference

  16. Latent Personal Memory: Represent personal memory as dynamic soft prompts

    Jun 18, 2026Debrup Das, Avinash Amballa, Yashas Malur Saidutta +3LLM Inference EfficiencyMemory-Efficient Fine-Tuning

  17. Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning

    Jun 18, 2026Sajib Acharjee Dip, Dawei Zhou, Liqing ZhangLLM Inference EfficiencyCost-Aware Inference

  18. CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference

    Jun 18, 2026Kaizhen Tan, Rong Gu, Mingyuan LiLLM Inference EfficiencyRetrieval-Augmented Generation

  19. DynAMO:Dynamic Asset Management Orchestration via Topological Multi-Agent Scheduling

    Jun 14, 2026Kanishk Kushwaha, Vikrant Vinod Bansode, Harsh Vardhan +1LLM Inference EfficiencyMulti-Agent Orchestration

  20. Service-Induced Congestion in Memory-Constrained LLM Serving

    Jun 14, 2026Ruicheng Ao, Jing Dong, Gan Luo +1LLM Inference EfficiencyLLM Serving

  21. Can I Buy Your KV Cache?

    Jun 11, 2026Luoyuan ZhangLLM Inference EfficiencyKV Caching

  22. MiniPIC: Flexible Position-Independent Caching in <100LOC

    Jun 11, 2026Nathan Ordonez, Thomas ParnellLLM Inference EfficiencyKV Caching