LLM Inference Efficiency

LLM: Large Language Model

Latest papers 234

All topics
CardsList
  1. ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

    Aug 26, 2026Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang WangLLM Inference EfficiencyMulti-Agent Orchestration

  2. The Embedder's Dilemma: LLMs Are Better, but at What Cost?

    Aug 13, 2026Adnan El Assadi, Niklas Muennighoff, Jinhyuk LeeLLM Inference EfficiencyLLM Evaluation

  3. LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

    Aug 9, 2026Minhan Cho, Soyoung Park, Kihyeon Jeong +3LLM Inference EfficiencyInstruction Following

  4. Blast Radius

    Aug 7, 2026MY Pitsane, Hope MogaleLLM Inference EfficiencyAgentic Code Generation

  5. A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems

    Aug 6, 2026Zihan Xu, Haolin Tian, Hai JiangLLM Inference EfficiencyMulti-Agent LLM Systems

  6. Interpretable Adaptive Sampling for LLM Test-Time Scaling

    Aug 4, 2026Mobina Kashaniyan, Ali JannesariLLM Inference EfficiencyTest-Time Scaling

  7. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving

    Aug 4, 2026Xiang Li, Pengcheng Wang, Huazheng Wang +1LLM Inference EfficiencyLLM Serving

  8. IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

    Jul 31, 2026Penglin Zhu, Linhai Zhang, Jungang Xu +2LLM Inference EfficiencyNatural Language to Optimization Modeling

  9. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

    Jul 29, 2026Amirmohammad Farzaneh, Osvaldo SimeoneLLM Inference EfficiencyAI Agent Reliability

  10. From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

    Jul 29, 2026Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis +5LLM Inference EfficiencyEnergy-Efficient ML

  11. LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

    Jul 29, 2026Ming-Yen Lee, Hanchen Yang, Faaiq Waqar +4LLM Inference EfficiencyLLM Serving

  12. Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

    Jul 27, 2026Yifan Dou, Shikan Lian, Shibo LiLLM Inference EfficiencyLLM Inference Scheduling

  13. When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

    Jul 27, 2026Tong Zhang, Zexin Li, Simin Chen +1LLM Inference EfficiencyLanguage Model Safety Evaluation

  14. SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving

    Jul 27, 2026Yihui Zhang, Tianyu Wo, Jinghao Wang +7LLM Inference EfficiencyLLM Agent Serving

  15. Understanding Tone-Dependent Inference Cost in Large Language Models

    Jul 27, 2026Akhil Kumar, Om DobariyaLLM Inference EfficiencyLLM Evaluation

  16. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  17. CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents

    Jul 20, 2026Mingwei Zheng, David OBrien, Siwei Cui +4LLM Inference EfficiencyAI Coding Agents

  18. VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

    Jul 20, 2026Yu-Chien Tang, Jun-Chen Hung, Wen-Chih Peng +1LLM Inference EfficiencyAdaptive Model Routing

  19. Human Grounded Evaluation of Large Language Models for Optical Network Automation

    Jul 20, 2026Kiarash Rezaei, Omran Ayoub, Paolo Monti +1LLM Inference EfficiencyLLM Evaluation

  20. WaterMoE: Expert-Routing-based Watermarking for High Fidelity and Efficiency

    Jul 14, 2026Z Sun, Q Jiang, S Sheng +1LLM Inference EfficiencyLLM Watermarking

  21. Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

    Jul 13, 2026Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera +1LLM Inference EfficiencyEdge Computing

  22. Valid ≠\ne Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

    Jul 13, 2026Daeyeop Lee, Hwanjo YuLLM Inference EfficiencyOverthinking in Language Models

  23. Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

    Jul 10, 2026Nada Zine, Tristan Coignion, Vincenzo Stoico +3LLM Inference EfficiencyLLM Evaluation