LLM Inference Efficiency

LLM: Large Language Model

Latest papers 234

All topics
CardsList
  1. Argo: Efficient Importance Labeling for Enterprise Email Systems

    May 20, 2026Siddhant Ray, Ganesh Ananthanarayanan, Kevin Chian +5LLM Inference EfficiencyLLM Serving

  2. PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

    May 20, 2026Can Hankendi, Rana Shahout, Minlan Yu +1LLM Inference EfficiencyLLM Serving

  3. DASH: Fast Differentiable Architecture Search for Hybrid Attention in Minutes on a Single GPU

    May 20, 2026Weizhe Chen, Miao Zhang, Junpeng Jiang +3LLM Inference EfficiencyAttention Mechanisms

  4. PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

    May 20, 2026Yiqi Zhang, Fangzheng Jiao, Tian Tang +13LLM Inference EfficiencyLLM Serving

  5. GraphRAG on Consumer Hardware: Benchmarking Local LLMs for Healthcare EHR Schema Retrieval

    May 20, 2026Peter Fernandes, Ria KanjilalLLM Inference EfficiencyLLM Grounding

  6. Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

    May 19, 2026Mert Yildiz, Pietro Spadaccino, Alexey Rolich +2LLM Inference EfficiencyLLM Serving

  7. Latent Action Reparameterization for Efficient Agent Inference

    May 18, 2026Wenhao Huang, Qingwen Zeng, Qiyue Chen +11LLM Inference EfficiencyLatent Action Learning

  8. Easier to Judge than to Find: Predicting In-Context Learning Success for Demonstration Selection

    May 18, 2026Haochun Wang, Chaofen Yang, Jiatong Liu +5LLM Inference EfficiencyIn-Context Example Selection

  9. LogRouter: Adaptive Two-Level LLM Routing for Log Question Answering in Big Data Systems

    May 18, 2026Mert Coskuner, Merve Zeybel, Melik Mert DolanLLM Inference EfficiencyCost-Aware Inference

  10. ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse

    May 16, 2026Yu Zhu, Aditya Dhakal, Yunming Xiao +2LLM Inference EfficiencyKV-Cache Offloading

  11. Skim: Speculative Execution for Fast and Efficient Web Agents

    May 15, 2026Mike Wong, Kevin Hsieh, Suman Nath +1LLM Inference EfficiencyLLM Agent Workflow Optimization

  12. EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization

    May 14, 2026Zhiye Song, Kyungmi Lee, Eun Kyung Lee +3LLM Inference EfficiencyEnergy-Efficient ML

  13. Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

    May 14, 2026Xiaohua Wang, Kai Yu, XuXiao Liang +2LLM Inference EfficiencyAI Agent Reliability

  14. Good Agentic Friends Do Not Just Give Verbal Advice: They Can Update Your Weights

    May 13, 2026Wenrui Bao, Huan Wang, Jian Wang +3LLM Inference EfficiencyMulti-Agent LLM Systems

  15. Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches

    May 12, 2026Shaoke Fang, Ziang Li, Wenfei Wu +3LLM Inference EfficiencyKV Caching

  16. The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures

    May 12, 2026Bole Ma, Ayesha Afzal, Jan Eitzinger +1LLM Inference EfficiencyLanguage Model Decoding

  17. GAR: Carbon-Aware Routing for LLM Inference via Constrained Optimization

    May 12, 2026Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha +1LLM Inference EfficiencyConstrained Optimization

  18. Compute Where it Counts: Self Optimizing Language Models

    May 11, 2026Yash Akhauri, Mohamed S. AbdelfattahLLM Inference EfficiencyRL for Language Models

  19. Agent-X: Full Pipeline Acceleration of On-device AI Agents

    May 11, 2026Jinha Chung, Byeongjun Shin, Jiin Kim +1LLM Inference EfficiencyOn-Device Language Model Inference

  20. PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

    May 11, 2026Luan Zhang, Dandan Song, Zhijing Wu +8LLM Inference EfficiencyInference-Time Optimization

  21. Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness

    May 10, 2026Zizhao Chen, Yuying Li, Siting Lin +1LLM Inference EfficiencyEfficient Language Model Reasoning

  22. Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

    May 9, 2026Shan Jiang, Zijian Yi, Chenguang ZhuLLM Inference EfficiencyTest-Time Optimization

  23. Large Language Models over Networks: Collaborative Intelligence under Resource Constraints

    May 9, 2026Liangqi Yuan, Wenzhi Fang, Shiqiang Wang +2LLM Inference EfficiencyOn-Device Language Model Inference

  24. LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling

    May 8, 2026Tong Zheng, Haolin Liu, Chengsong Huang +10LLM Inference EfficiencyAutomated Algorithm Discovery