LLM Inference

LLM: Large Language Model

Latest papers 187

All topics
CardsList
  1. Towards Distributed Inference of LLMs on a P2P Network

    May 7, 2026Shabari S Nair, Krishanu SainiLLM InferenceKV Caching

  2. Quantum-enhanced Large Language Models on Quantum Hardware via Cayley Unitary Adapters

    May 7, 2026Borja Aizpurua, Sukhbinder Singh, Augustine Kshetrimayum +2LLM InferenceLLM Fine-Tuning

  3. A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

    May 6, 2026Chengyi Nie, Nian Si, Zijie ZhouLLM ServingLLM Inference

  4. Tile-Level Activation Overlap for Efficient LLM Inference

    May 5, 2026Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt +3LLM Inference EfficiencyGPU Kernel Optimization

  5. Reasoning emerges from constrained inference manifolds in large language models

    May 2, 2026Yanbiao Ma, Fei Luo, Linfeng Zhang +10LLM InferenceLLM Interpretability

  6. Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

    May 2, 2026Zijie ZhouLLM ServingLLM Inference

  7. Belief-Guided Inference Control for Large Language Model Services via Verifiable Observations

    Apr 30, 2026Wenhao Yuan, Chenchen Lin, Jian Chen +3LLM InferenceCost-Aware Inference

  8. Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

    Apr 29, 2026Zhen Zhang, Changyi Yang, Zijie Xia +11LLM InferenceControllable Text Generation

  9. DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

    Apr 29, 2026Bodon Jeong, Hongsu Byun, Youngjae Kim +4On-Device Language Model InferenceKV-Cache Offloading

  10. Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

    Apr 28, 2026Wenshuo Zhao, Qi Zhu, Xingshan Zeng +4LLM InferenceTest-Time Scaling

  11. Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

    Apr 25, 2026Divakar Kumar Yadav, Tian ZhaoLLM InferenceLLM Inference Acceleration

  12. Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

    Apr 24, 2026Harri Renney, Fouad Trad, Michael Mattarock +1AI Accelerator InferenceOn-Device Language Model Inference

  13. Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models

    Apr 24, 2026Alberto Messina, Stefano ScottaLLM InferenceML Reproducibility

  14. Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

    Apr 20, 2026Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala +13On-Device Language Model InferenceLLM Inference

  15. DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

    Apr 20, 2026You-Liang Huang, Xinhao Huang, Chengxi Liao +1LLM InferenceLLM Inference Acceleration

  16. MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression

    Apr 20, 2026Libo Sun, Peixiong He, Po-Wei Harn +1LLM InferenceKV Caching

  17. Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

    Apr 18, 2026Minghao Shao, Zeng Wang, Weimin Fu +5LLM EvaluationLanguage Model Generation Evaluation

  18. LACE: Lattice Attention for Cross-thread Exploration

    Apr 16, 2026Yang Li, Zirui Zhang, Yang Liu +1LLM InferenceAttention Mechanisms

  19. Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines

    Apr 16, 2026Otto White, Marcel Wagenländer, Britannio Jarrett +7LLM InferenceLLM Inference Scheduling

  20. The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference

    Apr 16, 2026Ranjith Chodavarapu, Lei XuLLM Inference

  21. Suffix-Constrained Greedy Search Algorithms for Causal Language Models

    Mar 1, 2026Ayoub Hammal, Pierre Zweigenbaum, Caio CorroConstrained Generative ModelingConstrained Decoding

  22. TensorCommitments: A Lightweight Verifiable Inference for Language Models

    Feb 13, 2026Oguzhan Baser, Elahe Sadeghi, Eric Wang +5LLM InferenceLLM Security