Inference-Time Compute Allocation

Latest papers 53

All topics
CardsList
  1. Readout Stability in Prefill-Only Decision Models:Zero-Label Prediction and Inference-Time Compute Allocation

    Oct 6, 2026Ran Li, Lei ChenInference-Time Compute AllocationEfficient Language Model Inference

  2. Expanding LLM Reasoning

    Oct 4, 2026Rian Atri, Evan LuoLLM Inference EfficiencyInference-Time Scaling

  3. ReSolve: Reusing Candidate Reasoning through Selective Generative Moderation

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongba Ma +6Efficient Language Model ReasoningInference-Time Compute Allocation

  4. The Decision Value of Perception Compute

    Sep 28, 2026Hoang Pham Cong, Ho Viet Duc LuongCost-Aware InferenceAutonomous Driving Perception

  5. ReSync: Re-Aligning the Two Clocks of Asynchronous World-Action Models

    Sep 27, 2026Xi Lin, Feihong Zhang, Yulong Shi +6Action-Conditioned Video GenerationVideo Diffusion Models

  6. The Organization of Inference: Information, Resource Constraints, and AI Production

    Sep 17, 2026Yukun Zhang, Kemu Xu, Yishen ChenLLM PlanningInference-Time Scaling

  7. When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis

    Sep 14, 2026Kaiyuan Liu, Qiuyang Mang, Bo Peng +6LLM Agent EvaluationTest-Time Scaling

  8. Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language Models

    Sep 12, 2026Yixiang Liu, Zhongxing Xu, Zhonghua Wang +1Diffusion Language Model InferenceVLM Reasoning

  9. Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

    Aug 13, 2026Ahmet Bugra Gundogan, Yigit Turkmen, Melih BastopcuLLM ServingInference-Time Compute Allocation

  10. Sampling Luck Masquerades as Allocation Gain: Auditing Test-Time Budget Allocation for Neural Combinatorial Optimization

    Aug 13, 2026Jinhyung BaeAlgorithmic AuditingInference-Time Compute Allocation

  11. Thought-Level Beam Search for Reasoning

    Aug 8, 2026Lijie Yang, Hongyin Luo, Jiawei Zhao +2Inference-Time SearchEfficient Language Model Reasoning

  12. Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

    Aug 8, 2026Chenrui Fan, Yize Cheng, Ming Li +3LLM EvaluationInference-Time Compute Allocation

  13. CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

    Aug 7, 2026Yan Zhou, Yue Ouyang, Kaiyang Zheng +1Cost-Aware InferenceTest-Time Scaling

  14. Search as Computation Allocation

    Jul 30, 2026Alexander TuisovInference-Time Compute Allocation

  15. Exploring Budgeted Image Classification with Content-Sensitive Resource Allocation

    Jul 27, 2026Athanasios G. PapadopoulosCost-Aware InferenceClassification

  16. Resample or Reroute? Recoverable Stopping Debt Without Identified Action Selection

    Jul 9, 2026Teng-Ruei ChenCode GenerationLLM Reliability

  17. End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference

    Jun 26, 2026Yuhang Chen, Jinhao Duan, Ruichen Zhang +11LLM InferenceStructured Sparsity

  18. DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

    Jun 10, 2026Jadelynn Dao, Milan Ganai, Yasmina Abukhadra +7Test-Time Scaling for VLMsInference-Time Scaling

  19. Intrinsic Selection and Particle Resampling for Inference-Time Scaling Beyond Domain Verifiability

    Jun 7, 2026Giorgio Giannone, Mustafa Eyceoz, Shabana Baig +5Particle FilteringInference-Time Scaling

  20. Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation

    Jun 3, 2026Liang He, Jingbo Wen, Haoyu Wang +4Cost-Aware InferenceInference-Time Compute Allocation

  21. The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

    Jun 2, 2026Xu Wan, Speed Zhu, Jianwei Cai +4Cost-Aware InferenceInference-Time Scaling