LLM Inference

LLM: Large Language Model

Latest papers 187

All topics
CardsList
  1. The Cost and Network Limits of Space-Based AI Compute

    Jul 15, 2026Kees van BerkelLLM InferenceCost-Aware Inference

  2. Automatic Model-Hardware Co-Adaptation for Heterogeneous AI Accelerators

    Jul 14, 2026Tian Chen, Mingheng Mi, Pu Wang +2AI Accelerator InferenceLLM Inference

  3. FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

    Jul 13, 2026Wenzong Yang, Danyang Zhang, Kun Cao +17AI Accelerator InferenceLLM Inference

  4. Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

    Jul 10, 2026Nada Zine, Tristan Coignion, Vincenzo Stoico +3LLM Inference EfficiencyLLM Evaluation

  5. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4LLM Inference EfficiencyAI Accelerator Inference

  6. Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

    Jul 6, 2026MY Pitsane, Hope MogaleLLM Answer VerificationLLM Inference

  7. WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

    Jul 2, 2026Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezLLM Inference EfficiencyEnergy-Efficient ML

  8. Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

    Jul 2, 2026Wenchen Han, Gingfung Matthew Yeung, Marco Barletta +3LLM InferenceKV Caching

  9. Dynamic Bidirectional Pattern Memory: A Production-Scale Empirical Characterisation of Inference-Time Gating in Clinical NLP

    Jul 1, 2026Ali H. Lazem, William TeahanLLM InferenceClinical Information Extraction

  10. KernelSight-LM: A Kernel-Level LLM Inference Simulator

    Jun 26, 2026Xiteng Yao, Taeho Kim, Hengzhi Pei +7LLM InferenceLLM Inference Serving

  11. End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

    Jun 26, 2026Yuhang Chen, Jinhao Duan, Ruichen Zhang +11LLM InferenceStructured Sparsity

  12. Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference

    Jun 22, 2026Yuhang Gan, Yiwei Yang, Yuyi Li +6LLM Inference

  13. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  14. Abstract representational geometry supports inference in large language models

    Jun 22, 2026Yunan Zeng, Yuwang WangLLM InferenceLLM Interpretability

  15. Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

    Jun 19, 2026Zibin Meng, Peng Xie, Kani ChenLLM InferenceTest-Time Scaling

  16. Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

    Jun 19, 2026Zhenting Zhu, Lucas Thai, Shan Yu +5Mixed-Precision QuantizationLLM Inference

  17. Structured Inference with Large Language Gibbs

    Jun 17, 2026Sanghyeok Choi, Henry Gouk, Esmeralda S. WhitammerMarkov Chain Monte CarloLLM Inference

  18. How Inference Compute Shapes Frontier LLM Evaluation

    Jun 16, 2026Jessica McFadyen, Ole Jorgensen, Harry Coppock +2LLM EvaluationLanguage Model Generation Evaluation

  19. Entropy-Gated Latent Recursion

    Jun 15, 2026Soham Bhattacharjee, Dushyant Singh Chauhan, Salem Lahlou +2LLM InferenceInference-Time Scaling

  20. Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

    Jun 15, 2026Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar +1Privacy-Preserving Language ModelsLLM Inference

  21. Communication-Efficient Verifiable Attention for LLM Inference

    Jun 15, 2026Ziqun Chen, Ming Wu, Michael Heinrich +4LLM InferenceTrusted Execution Environments