LLM Inference Efficiency

LLM: Large Language Model

Latest papers 234

All topics
CardsList
  1. MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

    Jun 11, 2026Wenbo Chen, Puheng Li, Mengyang Liu +2LLM Inference EfficiencySelf-Consistency Decoding

  2. Arbor: Tree Search as a Cognition Layer for Autonomous Agents

    Jun 10, 2026Neha Prakriya, Chaojun Hou, Zheng Gong +5LLM Inference EfficiencyMulti-Agent System Optimization

  3. RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

    Jun 7, 2026Anirudh SekarLLM Inference EfficiencyKV Caching

  4. Value-Aware Stochastic KV Cache Eviction for Reasoning Models

    Jun 2, 2026Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu +3LLM Inference EfficiencyKV Caching

  5. MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency

    Jun 2, 2026Saptarshi Mitra, Yifan Zhang, Rachid Karami +5LLM Inference EfficiencyMulti-Agent System Optimization

  6. RASER: Recoverability-Aware Selective Escalation Router for Multi-Hop Question Answering

    Jun 1, 2026Yuyang Li, Zihe Yan, Tobias KäferMulti-Hop QALLM Inference Efficiency

  7. Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability

    May 31, 2026Xianyou Li, Weiran Yan, Yichao Wu +4LLM Inference EfficiencyMulti-Agent LLM Systems

  8. Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs

    May 31, 2026Yubo Gao, Haotian Wu, Hong Chen +8LLM Inference EfficiencyCoT Reasoning

  9. Leyline: KV Cache Directives for Agentic Inference

    May 31, 2026Bole Ma, Jan Eitzinger, Harald KoestlerLLM Inference EfficiencyKV Caching

  10. SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs

    May 29, 2026Sijia Wang, Dhanajit Brahma, Ricardo HenaoLLM Inference EfficiencyAgent Memory

  11. Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching

    May 28, 2026Alaa Khamis, Alaa MaaloufLLM Inference EfficiencyFine-Tuning

  12. Anchorless Diversification for Parallel LLM Ideation

    May 28, 2026Fares Nabil Ibrahim, Nafis Saami Azad, Raiyan Abdul BatenLLM Inference EfficiencyLLM Inference

  13. ParaTool: Shifting Tool Representations from Context to Parameters

    May 28, 2026Zekai Yu, Qi Meng, Qizhi Chu +3LLM Inference EfficiencyLLM Tool Use

  14. A Policy-Driven Runtime Layer for Agentic LLM Serving

    May 26, 2026Rui Zhang, Chaeeun Kim, Liting HuLLM Inference EfficiencyMulti-Agent LLM Systems

  15. ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference

    May 26, 2026Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang +3LLM Inference EfficiencyExpert Offloading

  16. A general tensor-structured compression scheme for efficient large language models

    May 25, 2026Ying Lu, Peng-Fei Zhou, Qi-Xuan Fang +3LLM Inference EfficiencyLLM Compression

  17. MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation

    May 24, 2026Ali Noshad, Zishan Zheng, Yinjun WuLLM Inference EfficiencyRL for Combinatorial Optimization

  18. Inference Time Context Sparsity: Illusion or Opportunity?

    May 22, 2026Sahil Joshi, Prithvi Dixit, Agniva Chowdhury +5LLM Inference EfficiencyStructured Sparsity

  19. Parallel Context Compaction for Long-Horizon LLM Agent Serving

    May 22, 2026Musa Cim, Burak Topcu, Chita Das +1LLM Inference EfficiencyLLM Agent Workflow Optimization

  20. ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

    May 21, 2026Aman Sunesh, Ali Alshehhi, Hivansh DhakneLLM Inference EfficiencyLLM Serving

  21. E3E^3-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

    May 21, 2026Rui Bao, Yaping Sun, Zhiyong Chen +4LLM Inference EfficiencyEdge Inference

  22. IdleSpec: Exploiting Idle Time via Speculative Planning for LLM Agents

    May 21, 2026Daewon Choi, Kyunghyun Park, Woomin Song +4LLM Inference EfficiencyLong-Horizon LLM Agents

  23. Planning in the LLM Era: Building for Reliability and Efficiency

    May 21, 2026Michael Katz, Harsha Kokel, Kavitha Srinivas +1LLM Inference EfficiencyLLM Planning