LLM Inference

LLM: Large Language Model

Latest papers 187

All topics
CardsList
  1. RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems

    Sep 14, 2026Ziyue Yang, Yuting Jiang, Lei Qu +1LLM InferenceLarge Language Model-Guided Optimization

  2. Dissecting GPU Utilization for LLM Inference on Nvidia Hopper

    Sep 14, 2026Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic +1LLM Inference EfficiencyGPU Acceleration

  3. A Measurement Study of LLM Inference Trade-offs Across Edge Continuum Hardware

    Sep 8, 2026Maysam Khatib, Moysis Symeonides, Demetris Trihinas +2LLM Inference EfficiencyLLM Evaluation

  4. MetaKV: Adaptive KV Cache Compression for Constrained LLM Inference

    Sep 7, 2026Michael Wang, Keith Li, Roozbeh BostandoostLLM Inference EfficiencyLLM Inference

  5. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  6. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching

  7. GVS5H: Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

    Aug 27, 2026Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi +4Zero-Shot LearningMulti-Agent LLM Systems

  8. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLLM InferenceLLM Inference Scheduling

  9. Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

    Aug 7, 2026Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal +1LLM Inference

  10. PPDL: LLM-Based Flows as Probabilistic Programs

    Aug 5, 2026Louis Mandel, Guillaume Baudart, Mandana Vaziri +1LLM InferenceLLM Reliability

  11. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1LLM EvaluationLanguage Model Generation Evaluation

  12. LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

    Aug 3, 2026Zhichen Liu, Ruihan Sun, Hengjie Yang +4Memory-Augmented Language ModelsLLM Inference

  13. TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

    Aug 3, 2026Ruilin Xu, Junyi Li, Pengfei Chen +1LLM InferenceLLM Inference Serving

  14. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4LLM InferenceKV Caching

  15. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaGPU Kernel OptimizationLLM Inference

  16. MOSAIC: Masked Outsourcing of Secure AI Computations

    Jul 31, 2026James Hsin-yu Chiang, Sheila Zingg, Kari Kostiainen +1Efficient Transformer InferenceSecure Multi-Party Computation

  17. Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

    Jul 30, 2026Banruo Liu, Haoran Qiu, Íñigo Goiri +3LLM InferenceAI Coding Agents

  18. From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

    Jul 29, 2026Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis +5LLM Inference EfficiencyEnergy-Efficient ML

  19. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  20. Total Variation Distance Estimation in Autoregressive Models

    Jul 21, 2026Eric Price, Kevin Tian, Zhiyang Xun +1LLM EvaluationLLM Inference