LLM Inference

LLM: Large Language Model

Latest papers 183

All topics
CardsList
  1. DySCo: Dynamic Sharding for Collaborative Edge-Cloud LLM Inference with Depth-Synchronized Batching

    Oct 6, 2026Jingpo Xu, Paul Joe Maliakel, Ivona Brandic +1LLM InferenceEdge Computing

  2. Shared Stopping Decisions Change Answers in HQQ Cache Quantization

    Oct 5, 2026Seunghui Jwa, Minsu Oh, Chanjun Park +1LLM InferenceKV-Cache Quantization

  3. Can Computation from Earlier Problems Help LLMs Solve New Ones?

    Sep 30, 2026Jipei He, Wenhui Tan, Xiaoyi Yu +4Memory-Augmented Language ModelsLLM Inference

  4. SparLeak: Privacy Leakage from Sparse Attention in LLM Inference on Shared GPUs

    Sep 30, 2026Fahao Chen, Linkang Du, Jinhao Zhou +2LLM InferencePrivacy Leakage in Language Models

  5. StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

    Sep 29, 2026Jhen-Ke Lin, Chung Chun WangLLM EvaluationLLM Inference

  6. Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling

    Sep 29, 2026Xinyu Li, Mononito Goswami, Hao Liu +5LLM InferenceInference-Time Scaling

  7. Bits Under ZK-LLM: Evaluating Zero-Knowledge-Friendly Quantization for Verifiable Private LLM Inference

    Sep 29, 2026Taeung Yoon, Yupeng Zhang, Xiaojing LiaoLLM QuantizationLLM Inference

  8. AgentPerfBench: A Benchmarking and Evaluation Suite for Inference Performance of Agentic LLMs

    Sep 28, 2026Cheuk Hang Lau, Zeyu Cao, Kevin Wong Cheuk Yin +6LLM Inference EfficiencyLLM Inference

  9. DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

    Sep 28, 2026Xuan Truong Nguyen, Tien Son Pham, Tuan Duc Chu +2LLM ServingLLM Inference

  10. Kafila: Serving Large Language Models on a Trusted Set of Heterogeneous Commodity Machines

    Sep 28, 2026Murtaza Rangwala, Richard O. Sinnott, Rajkumar BuyyaLLM InferenceLLM Inference Scheduling

  11. Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference

    Sep 22, 2026Gaoyuan Du, Anam Nawaz Khan, Rex Zhou +4Language Model DecodingLLM Inference

  12. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2LLM QuantizationLLM Inference

  13. TriFleetRCA: On-Premise LLM Root Cause Analysis for Kubernetes

    Sep 20, 2026Rohit Patel, Susil Kumar Mohanty, Jeenal ChaudharyLLM InferenceCloud Computing

  14. PrefixBench-H100: Characterizing Prefix Reuse and Time-to-First-Token in H100 LLM Serving

    Sep 17, 2026Omkar Shewale, Deepak Kumar, Divakar Kumar YadavLLM Inference EfficiencyLLM Inference

  15. Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling

    Sep 16, 2026Mobina Kashaniyan, Ali JannesariLLM Inference EfficiencyLLM Inference

  16. Dynamic Semantic Compression for Efficient Latent-Space Inference in Large Language Models

    Sep 14, 2026Peipei Li, Dongsen Zhang, Yuchen Liu +1LLM CompressionLLM Inference

  17. Dissecting GPU Utilization for LLM Inference on Nvidia Hopper

    Sep 14, 2026Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic +1LLM Inference EfficiencyGPU Acceleration

  18. The Battery Price of edge AI: A study of the Environmental Impact of LLM Inference on Mobile Devices

    Sep 14, 2026Édouard Guégain, Tristan CoignionOn-Device Language Model InferenceEnergy-Efficient ML

  19. Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding

    Sep 14, 2026Minoo Ahmadi, Seyedarmin Azizi, Erfan Baghaei Potraghloo +2Language Model DecodingLLM Inference

  20. RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems

    Sep 14, 2026Ziyue Yang, Yuting Jiang, Lei Qu +1LLM InferenceLarge Language Model-Guided Optimization

  21. A Measurement Study of LLM Inference Trade-offs Across Edge Continuum Hardware

    Sep 8, 2026Maysam Khatib, Moysis Symeonides, Demetris Trihinas +2LLM Inference EfficiencyLLM Evaluation

  22. MetaKV: Adaptive KV Cache Compression for Constrained LLM Inference

    Sep 7, 2026Michael Wang, Keith Li, Roozbeh BostandoostLLM Inference EfficiencyLLM Inference

  23. GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

    Sep 3, 2026Qiankun Ma, Yanjiang Zhou, Zinan Xiong +5LLM InferenceKV Caching

  24. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching

  25. GVS5H: Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

    Aug 27, 2026Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi +4Zero-Shot LearningMulti-Agent LLM Systems

  26. Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

    Aug 10, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLLM InferenceLLM Inference Scheduling

  27. Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

    Aug 7, 2026Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal +1LLM Inference

  28. PPDL: LLM-Based Flows as Probabilistic Programs

    Aug 5, 2026Louis Mandel, Guillaume Baudart, Mandana Vaziri +1LLM InferenceLLM Reliability

  29. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1LLM EvaluationLanguage Model Generation Evaluation

  30. LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

    Aug 3, 2026Zhichen Liu, Ruihan Sun, Hengjie Yang +4Memory-Augmented Language ModelsLLM Inference

  31. TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

    Aug 3, 2026Ruilin Xu, Junyi Li, Pengfei Chen +1LLM InferenceLLM Inference Serving

  32. Output-Aware Rotation for INT2 KV-Cache Quantization

    Aug 3, 2026Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong +4LLM InferenceKV Caching

  33. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaGPU Kernel OptimizationLLM Inference

  34. MOSAIC: Masked Outsourcing of Secure AI Computations

    Jul 31, 2026James Hsin-yu Chiang, Sheila Zingg, Kari Kostiainen +1Efficient Transformer InferenceSecure Multi-Party Computation

  35. Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

    Jul 30, 2026Banruo Liu, Haoran Qiu, Íñigo Goiri +3LLM InferenceAI Coding Agents

  36. From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

    Jul 29, 2026Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis +5LLM Inference EfficiencyEnergy-Efficient ML

  37. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  38. Total Variation Distance Estimation in Autoregressive Models

    Jul 21, 2026Eric Price, Kevin Tian, Zhiyang Xun +1LLM EvaluationLLM Inference

  39. The Cost and Network Limits of Space-Based AI Compute

    Jul 15, 2026Kees van BerkelLLM InferenceCost-Aware Inference

  40. Automatic Model-Hardware Co-Adaptation for Heterogeneous AI Accelerators

    Jul 14, 2026Tian Chen, Mingheng Mi, Pu Wang +2AI Accelerator InferenceLLM Inference