LLM Inference

LLM: Large Language Model

Latest papers 187

All topics
CardsList
  1. Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

    Jun 14, 2026Shun Usami, Venkatram Vishwanath, E. Wes BethelAI Accelerator InferenceLLM Inference

  2. STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

    Jun 11, 2026Anas Nassar, Steve Mohr, Leonard Apanasevich +1LLM ServingLLM Inference

  3. Real-Time Language Model Jamming: A Case Study for Live Music Accompaniment Generation

    Jun 10, 2026Bowen Zheng, Andrew H. Yang, Jiaqi Ruan +5LLM Inference

  4. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  5. Steganography Without Modification: Hidden Communication via LLM Seeds

    Jun 8, 2026Felix Mächtle, Jonas Sander, Sebastian Berndt +3Language Model DecodingLLM Inference

  6. Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

    Jun 7, 2026Ting Wang, Yuanjie Shi, Yan Yan +1LLM InferenceLLM Reasoning with Graphs

  7. Cross-LLM Consistency in Inference: Evidence from Shared Interactions

    Jun 6, 2026Siyu Lou, Yao Yan, Yuntian Chen +1LLM InferenceLLM Interpretability

  8. Breaking the Ice: Analyzing Cold Start Latency in vLLM

    Jun 5, 2026Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin WangLLM InferenceLLM Inference Serving

  9. Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

    Jun 4, 2026Ziyue Li, Yang Li, Tianyi ZhouLLM InferenceLLM Inference Acceleration

  10. Closing the Loop on Latent Reasoning via Test-Time Reconstruction

    Jun 4, 2026Xiaopeng Yuan, Haibo Jin, Ye Yu +4LLM InferenceTest-Time Training

  11. Generative Criticality in Large Language Model Temperature Scaling

    Jun 4, 2026Huajian Ruan, Jinyang Li, Xingyu Guo +1LLM InferencePhase Transitions

  12. MolE-RAG: Molecular Structure-Enhanced Retrieval-Augmented Generation for Chemistry

    Jun 4, 2026Joey Chan, Wonbin Kweon, Ashley Shin +4Retrieval-Augmented GenerationLLM Inference

  13. SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

    Jun 3, 2026Peihua Mai, Xuanrong Gao, Youlong Ding +3Privacy-Preserving Language ModelsLLM Inference

  14. NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference

    Jun 2, 2026Mubarak Adetunji OjewaleLLM InferenceKV Caching

  15. DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

    Jun 2, 2026Kathiravan PalaniappanLLM InferenceLLM Inference Serving

  16. Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference

    Jun 1, 2026Yafan Huang, Sheng Di, Guanpeng LiLLM InferenceLanguage Model Robustness

  17. Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

    May 31, 2026Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya +2LLM EvaluationLLM Inference

  18. ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

    May 30, 2026Junlong Tong, Yao Zhang, Anhao Zhao +3LLM InferenceLLM Inference Acceleration

  19. Threshold-Based Exclusive Batching for LLM Inference

    May 30, 2026Weifang Zhang, Yuzhou Nie, Bowen Pang +2GPU AccelerationLLM Inference

  20. Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture

    May 29, 2026Hai Lin, Hoilam Pao, Shaoxiong Zhan +1LLM InferencePersistent Memory for Language Models

  21. CoMem: Context Management with A Decoupled Long-Context Model

    May 29, 2026Yuwei Zhang, Chengyu Dong, Shuowei Jin +11LLM InferenceLLM Inference Acceleration