LLM Inference Optimization

Latest papers 464

All topics
CardsList
  1. TopK-Guided: Adaptive, Budget-Aware Activation Sparsity for Efficient LLM Inference

    Oct 1, 2026Mukund Agarwalla, Chih-Jen LinLLM Inference OptimizationSparsity

  2. HHR: Hierarchical Hash Retrieval for Efficient LLM Generation

    Oct 1, 2026Lianjun Liu, Tiantian Zheng, You Huang +5LLM Inference OptimizationDynamic Sparse Attention

  3. AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing

    Sep 30, 2026Zhihui Gao, Tingjun Chen, Dirk EnglundLLM Inference OptimizationEdge Devices

  4. QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs

    Sep 30, 2026Weili Xu, Jisen Li, Yuqing Jian +8Large Language Model QuantizationQuantization-Aware Training

  5. SparLeak: Privacy Leakage from Sparse Attention in LLM Inference on Shared GPUs

    Sep 30, 2026Fahao Chen, Linkang Du, Jinhao Zhou +2Dynamic Sparse AttentionLLM Inference Optimization

  6. Code to Control: Synthesizing Parameterized Reactive Controllers

    Sep 30, 2026Zergham Ahmed, Joshua B. Tenenbaum, Chris Bates +1Llm-Driven Code SynthesisReactive

  7. FlexRouter: Learning Complementary Model Sets for Flexible LLM Routing

    Sep 29, 2026Wang Wei, Harry Yang, Tiankai Yang +6Large Language Model RoutingLLM Inference Optimization

  8. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10Large Language Model QuantizationKimi Delta Attention

  9. You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference

    Sep 29, 2026Liang He, Jingbo Wen, Yixiong Chen +4Large Language Model RoutingLLM Inference Optimization

  10. Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing

    Sep 29, 2026Guannan Lai, Han-Jia YeLarge Language Model RoutingLLM Inference Optimization

  11. IronLLM: Forging Compact Edge-Native Language Models for Real-Time Embodied Intelligence

    Sep 29, 2026Changdi Yang, Fengquan Jiao, Haochih Lin +14LLM Inference OptimizationLanguage Modeling

  12. Bits Under ZK-LLM: Evaluating Zero-Knowledge-Friendly Quantization for Verifiable Private LLM Inference

    Sep 29, 2026Taeung Yoon, Yupeng Zhang, Xiaojing LiaoLarge Language Model QuantizationLLM Inference Optimization

  13. From Search to Research: Exploring Search Scaling in Autonomous Quantitative Factor Mining

    Sep 28, 2026Kangcheng Deng, Hui Cai, Jiacheng Lu +6Research AutomationSequential Scaling

  14. PROACT-Agent: Progressive Runtime Oversight and Active Circuit-breaking for Real-Time Safety

    Sep 28, 2026Ding Jia, Wei Liu, Xianglong Du +5Large Language Model SafetySafety-Critical Scenarios

  15. Spexis: Speculative Lookahead Scheduling for LLM Inference

    Sep 28, 2026Hyungyu Jung, Jaehyeok Yu, Hoonseo Choi +3LLM Inference OptimizationCpu-Gpu Hybrid Designs

  16. MiCo: Mutual Information Coverage Optimization through Semantic Erasure Modeling for Efficient MLLM Inference

    Sep 28, 2026Tinghao Wang, Yichen Guo, Qizhe Zhang +11Long Visual-Token SequencesMultimodal Understanding

  17. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4Large Language Model QuantizationLLM Inference Optimization

  18. OLED-MoE: Accelerating MoE-Based dLLM Inference via Inter-Iteration Locality-Aware Expert Offloading

    Sep 27, 2026Jingyuan Xiao, Jiayue Wang, Yitao Hu +7Mixture-Of-Expert InferenceOffloading

  19. Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits

    Sep 24, 2026Michael Jerge, Suman JanaTree SearchMulti-Fidelity

  20. Greedy Decoding Is Not Precision-Invariant: Cross-Precision Output Divergence in LLM Inference

    Sep 22, 2026Gaoyuan Du, Anam Nawaz Khan, Rex Zhou +4Constrained DecodingLLM Inference Optimization

  21. CompKV: Compensation-Aware KV Selection for Long-Context LLM Inference

    Sep 22, 2026Zhen Huang, Ruizhe Yao, Danyi Liu +8Dynamic Sparse AttentionLLM Inference Optimization

  22. Accelerating the Mitigation of LLM Inference Nondeterminism Across GPU Architectures

    Sep 22, 2026Liam Cooper, Shinnung Jeong, Hyeran Jeon +2LLM Inference OptimizationFloating-Point

  23. Compressing Long Context into Answer-Aligned Memory Embeddings for LLM Inference

    Sep 22, 2026Md Mostafizer Rahman, Md Faizul Ibne Amin, Md Shahajada Mia +2LLM Inference OptimizationLarge Language Model Memory

  24. LoRA-generating hypernetworks for efficient on-device LLM generative personalization

    Sep 21, 2026Sean Augenstein, Li Ding, Jihwan Lee +2Large Language Model PersonalizationPersonalization

  25. ARM: Attention with Routed-Memory for Learnable Sparse Control

    Sep 21, 2026Qiuhao Zeng, Jerry Huang, Peng Lu +7Efficient Long-Context InferencePeak Memory

  26. TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching

    Sep 18, 2026Zhihao Shu, Md Musfiqur Rahman Sanim, Jie Hu +4Kv-Cache ManagementDepthweave-Kv

  27. Replan, Repair, or Edit? A Unified Empirical Evaluation of Travel Agents for Itinerary Revision under Resource Disruptions

    Sep 17, 2026Xiaofei Yuan, Yan Zhang, Shaobo Qiao +7JourneyIterative Re-Planning

  28. Semantic Layer Induction from Raw Telemetry via Hierarchical LLM and RAG Abstraction

    Sep 17, 2026Yuanzhe Jia, Ali AnaissiMultivariate Telemetry DataInsights

  29. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM Inference OptimizationQuantizer

  30. ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

    Sep 16, 2026Amir Ziashahabi, Hossein Entezari Zarch, Lei Gao +2Speculative DecodingLLM Inference Optimization

  31. Long-Context Demonstration Selection Using State Space Models

    Sep 15, 2026Ziniu Zhang, Zhenshuo Zhang, Ruoxuan Xiong +2Efficient Long-Context InferenceIn-Context Learning

  32. ECHO: Early-layer Collaborative Hierarchical Orchestration with Bonus Logits in Speculative Decoding

    Sep 15, 2026Ziyang Ma, Zihong Zhang, Zuchao Li +4Speculative DecodingLLM Inference Optimization

  33. LLM Inference in a Flash!

    Sep 14, 2026Sebastian Zhao, Minseo Kim, Coleman Hooper +5LLM Inference OptimizationInference-Time

  34. Dynamic Semantic Compression for Efficient Latent-Space Inference in Large Language Models

    Sep 14, 2026Peipei Li, Dongsen Zhang, Yuchen Liu +1LLM Inference OptimizationTask-Aware Compression

  35. SpliTEE: Improving LLM Inference on Trusted Hardware with Differentially Private GPU Outsourcing

    Sep 14, 2026Shashie Dilhara Batan Arachchige, Robin Carpentier, Hassan Jameel Asghar +1LLM Inference OptimizationDiffie-Hellman

  36. The Battery Price of edge AI: A study of the Environmental Impact of LLM Inference on Mobile Devices

    Sep 14, 2026Édouard Guégain, Tristan CoignionLLM Inference OptimizationDevice

  37. Dissecting GPU Utilization for LLM Inference on Nvidia Hopper

    Sep 14, 2026Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic +1Graphics Processing Unit ResourcesLLM Inference Optimization

  38. RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems

    Sep 14, 2026Ziyue Yang, Yuting Jiang, Lei Qu +1LLM Inference OptimizationDeepseek

  39. Self-Orchestrating Language Models: Leveraging Semantic Dependence for Efficient Inference

    Sep 13, 2026Tian JinLLM Inference OptimizationAutoregressive Language Models

  40. SpecGuard: Inference-Time Backdoor Detection For Free

    Sep 11, 2026Rui Wen, Ahmed Salem, Andrew Paverd +2Clean Label Backdoor AttackInference-Time Defense

  41. Forward-Free LLM Depth Pruning via Weight Redundancy

    Sep 9, 2026Vincent-Daniel Yun, Woosang LimUnstructured PruningLarge Language Model Compression