Inference-Time Compute Allocation

Latest papers 53

All topics
CardsList
  1. DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

    Jun 2, 2026Kathiravan PalaniappanLLM InferenceLLM Inference Serving

  2. ATLAS: Agentic Test-time Learning-to-Allocate Scaling

    Jun 1, 2026Peijia Qin, Qi Cao, Pengtao XieTest-Time ScalingInference-Time Compute Allocation

  3. Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning

    May 26, 2026Manh Nguyen, Sunil Gupta, Hung LeEfficient Language Model ReasoningAdaptive Sampling

  4. Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents

    May 25, 2026Haoyi Hu, Qirong Lyu, Xianghan Kong +7AI Agent EvaluationAI Agent Benchmarks

  5. Computational Challenges in Token Economics: Bridging Economic Theory and AI System Design

    May 17, 2026Ou Wu, Yingjun DengLLM InferenceCost-Aware Inference

  6. Reasoning Can Be Restored by Correcting a Few Decision Tokens

    May 16, 2026Changshuo Shen, Leheng Sheng, Yuxin Chen +2Efficient Language Model ReasoningInference-Time Compute Allocation

  7. Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

    May 12, 2026Zhaomeng Zhou, Lan Zhang, Junyang Wang +2RL for Language Model ReasoningEfficient Language Model Reasoning

  8. Compute Where it Counts: Self Optimizing Language Models

    May 11, 2026Yash Akhauri, Mohamed S. AbdelfattahLLM Inference EfficiencyRL for Language Models

  9. Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

    May 7, 2026Ziming Li, Jiatan Huang, Xiaoguang Guo +2LLM Agent TrainingInference-Time Compute Allocation

  10. On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

    May 7, 2026Xinglin Wang, Zishen Liu, Shaoxiong Feng +9Stochastic OptimizationCost-Aware Inference

  11. Adaptive Test-Time Compute Allocation with Evolving In-Context Demonstrations

    Apr 22, 2026Bowen Zuo, Dongruo Zhou, Yinglun ZhuEfficient InferenceTest-Time Optimization

  12. Weak-Link Optimization for Multi-Agent Reasoning and Collaboration

    Apr 17, 2026Haoyu Bian, Chaoning Zhang, Jiaquan Zhang +4Multi-Agent CollaborationInference-Time Compute Allocation

  13. Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

    Apr 16, 2026Zhiyuan Zhai, Bingcong Li, Bingnan Xiao +2Test-Time ScalingConstrained Optimization

  14. What If We Allocate Test-Time Compute Adaptively?

    Feb 1, 2026Ahsan Bilal, Ahmed Mohsin, Muhammad Umer +4Inference-Time SearchTest-Time Scaling

  15. More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

    Jan 29, 2026Sagi Meir, Tommer D. Keidar, Noam Levi +2LLM Inference EfficiencyLLM Evaluation

  16. Optimal Self-Consistency for Efficient Reasoning with Large Language Models

    Nov 15, 2025Austin Feng, Marius Alonso, Ambroise Odonnat +2Self-Consistency DecodingInference-Time Scaling

  17. Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

    Oct 2, 2025Joykirat Singh, Justin Chih-Yao Chen, Archiki Prasad +3RL for Language Model ReasoningLLM Inference Acceleration