LLM Inference Efficiency

LLM: Large Language Model

Latest papers 234

All topics
CardsList
  1. ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

    Aug 26, 2026Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang WangLLM Inference EfficiencyMulti-Agent Orchestration

  2. The Embedder's Dilemma: LLMs Are Better, but at What Cost?

    Aug 13, 2026Adnan El Assadi, Niklas Muennighoff, Jinhyuk LeeLLM Inference EfficiencyLLM Evaluation

  3. LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

    Aug 9, 2026Minhan Cho, Soyoung Park, Kihyeon Jeong +3LLM Inference EfficiencyInstruction Following

  4. Blast Radius

    Aug 7, 2026MY Pitsane, Hope MogaleLLM Inference EfficiencyAgentic Code Generation

  5. A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems

    Aug 6, 2026Zihan Xu, Haolin Tian, Hai JiangLLM Inference EfficiencyMulti-Agent LLM Systems

  6. Interpretable Adaptive Sampling for LLM Test-Time Scaling

    Aug 4, 2026Mobina Kashaniyan, Ali JannesariLLM Inference EfficiencyTest-Time Scaling

  7. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1LLM Inference EfficiencyLLM Serving

  8. IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

    Jul 31, 2026Penglin Zhu, Linhai Zhang, Jungang Xu +2LLM Inference EfficiencyNatural Language to Optimization Modeling

  9. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

    Jul 29, 2026Amirmohammad Farzaneh, Osvaldo SimeoneLLM Inference EfficiencyAI Agent Reliability

  10. From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

    Jul 29, 2026Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis +5LLM Inference EfficiencyEnergy-Efficient ML

  11. LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

    Jul 29, 2026Ming-Yen Lee, Hanchen Yang, Faaiq Waqar +4LLM Inference EfficiencyLLM Serving

  12. Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

    Jul 27, 2026Yifan Dou, Shikan Lian, Shibo LiLLM Inference EfficiencyLLM Inference Scheduling

  13. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Inference EfficiencyLanguage Model Safety Evaluation

  14. SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

    Jul 27, 2026Yihui Zhang, Tianyu Wo, Jinghao Wang +7LLM Inference EfficiencyLLM Agent Serving

  15. Understanding Tone-Dependent Inference Cost in Large Language Models

    Jul 27, 2026Akhil Kumar, Om DobariyaLLM Inference EfficiencyLLM Evaluation

  16. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  17. CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents

    Jul 20, 2026Mingwei Zheng, David OBrien, Siwei Cui +4LLM Inference EfficiencyAI Coding Agents

  18. VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

    Jul 20, 2026Yu-Chien Tang, Jun-Chen Hung, Wen-Chih Peng +1LLM Inference EfficiencyAdaptive Model Routing

  19. Human Grounded Evaluation of Large Language Models for Optical Network Automation

    Jul 20, 2026Kiarash Rezaei, Omran Ayoub, Paolo Monti +1LLM Inference EfficiencyLLM Evaluation

  20. WaterMoE: Expert-Routing-based Watermarking for High Fidelity and Efficiency

    Jul 14, 2026Z Sun, Q Jiang, S Sheng +1LLM Inference EfficiencyLLM Watermarking

  21. Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

    Jul 13, 2026Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera +1LLM Inference EfficiencyEdge Computing

  22. Valid ≠\ne Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

    Jul 13, 2026Daeyeop Lee, Hwanjo YuLLM Inference EfficiencyOverthinking in Language Models

  23. Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

    Jul 10, 2026Nada Zine, Tristan Coignion, Vincenzo Stoico +3LLM Inference EfficiencyLLM Evaluation

  24. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

    Jul 9, 2026Jiantong Jiang, Peiyu Yang, Rui Zhang +1LLM Inference EfficiencyLLM Serving

  25. Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

    Jul 9, 2026Kalle Kujanpää, Ning Liu, Shahnawaz Alam +4LLM Inference EfficiencyLLM Agent Self-Improvement

  26. Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    Jul 7, 2026Kai Ruan, Zihe Huang, Ziqi Zhou +4LLM Inference EfficiencyEarly Stopping

  27. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4LLM Inference EfficiencyAI Accelerator Inference

  28. Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

    Jul 5, 2026Muhammad Mansoor, Tahir Ahmad, Yeo-Chan YoonLLM Inference EfficiencyRetrieval-Augmented Generation

  29. SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

    Jul 3, 2026Huajun Bai, Weiwei Lv, Huichuan Zheng +2LLM Inference EfficiencyLLM Agent Orchestration

  30. WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

    Jul 2, 2026Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezLLM Inference EfficiencyEnergy-Efficient ML

  31. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    Jul 2, 2026Xuqing Yang, Yi Yuan, Shanzhe Lei +1LLM Inference EfficiencyRL for Language Models

  32. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

    Jun 30, 2026Jie Li, Tongyang Wang, Yong ChenLLM Inference EfficiencyLLM Serving

  33. Fork-Think with Confidence

    Jun 30, 2026Zena Al-Khalili, Rafi Hakim, Dietrich Klakow +1LLM Inference EfficiencyEfficient Language Model Reasoning

  34. When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

    Jun 30, 2026Orian Dabod, Amir DN Cohen, Gabriel StanovskyLLM Inference EfficiencyFew-Shot Learning

  35. Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

    Jun 24, 2026Xinyu Lian, Walid Krichene, Beichen Huang +4LLM Inference EfficiencyLLM Quantization

  36. CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

    Jun 23, 2026Xiaolin Lin, Jingcun Wang, Olga Kondrateva +3LLM Inference EfficiencyKV Caching

  37. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

    Jun 20, 2026Naihao Deng, Alissa Shen, Yiming Feng +5LLM Inference EfficiencyMultilingual Language Models

  38. Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study

    Jun 19, 2026Alfarizy Alfarizy, Hung Truong Thanh Nguyen, René Richard +2LLM Inference EfficiencyOn-Device Language Model Inference

  39. Latent Personal Memory: Represent personal memory as dynamic soft prompts

    Jun 18, 2026Debrup Das, Avinash Amballa, Yashas Malur Saidutta +3LLM Inference EfficiencyMemory-Efficient Fine-Tuning

  40. Think Again or Think Longer? Selective Verification for Budget-Aware Reasoning

    Jun 18, 2026Sajib Acharjee Dip, Dawei Zhou, Liqing ZhangLLM Inference EfficiencyCost-Aware Inference

  41. CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference

    Jun 18, 2026Kaizhen Tan, Rong Gu, Mingyuan LiLLM Inference EfficiencyRetrieval-Augmented Generation

  42. DynAMO:Dynamic Asset Management Orchestration via Topological Multi-Agent Scheduling

    Jun 14, 2026Kanishk Kushwaha, Vikrant Vinod Bansode, Harsh Vardhan +1LLM Inference EfficiencyMulti-Agent Orchestration

  43. Service-Induced Congestion in Memory-Constrained LLM Serving

    Jun 14, 2026Ruicheng Ao, Jing Dong, Gan Luo +1LLM Inference EfficiencyLLM Serving

  44. Can I Buy Your KV Cache?

    Jun 11, 2026Luoyuan ZhangLLM Inference EfficiencyKV Caching

  45. MiniPIC: Flexible Position-Independent Caching in <100LOC

    Jun 11, 2026Nathan Ordonez, Thomas ParnellLLM Inference EfficiencyKV Caching