Cost-Aware Inference

Latest papers 183

All topics
CardsList
  1. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

    Sep 1, 2026Xiaowei Sun, Jin Li, Yili Hong +2Cost-Aware InferenceConstrained RL

  2. The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

    Aug 25, 2026Elioth SanabriaLLM ServingLLM Inference Scheduling

  3. SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

    Aug 13, 2026Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar HanawalEdge ComputingCost-Aware Inference

  4. Error-Aware Reverse Auction Mechanism for Large Language Model Routing

    Aug 13, 2026Haolong Chen, Zhengyuan Xin, Liang Zhang +2Cost-Aware InferenceLLM Routing

  5. How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

    Aug 12, 2026Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics +4Protein Structure PredictionInference-Time Optimization

  6. Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Aug 12, 2026Natchanon Pollertlam, Witchayut KornsuwannawitLLM ServingLLM Agent Memory

  7. RAISE: Diagnosing Acquisition Collapse in Costly LLM Signals

    Aug 11, 2026Ying Yuan, Yu Wang, Yize Cheng +1Cost-Aware InferenceLLM Routing

  8. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

    Aug 10, 2026Björn Engdahl, Adrian Kosowski, Jan Chorowski +6Cost-Aware InferenceEfficient Language Model Reasoning

  9. Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

    Aug 9, 2026Sourav Das, Tanmay Joshi, Kripabandhu GhoshFine-TuningLLM Fine-Tuning

  10. CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

    Aug 7, 2026Yan Zhou, Yue Ouyang, Kaiyang Zheng +1Cost-Aware InferenceTest-Time Scaling

  11. Pre-Inference Routing for Cost-Efficient Document Field Extraction

    Aug 6, 2026Sreerekha RajendranAdaptive Model RoutingDocument Information Extraction

  12. AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

    Aug 5, 2026Chengyu Qiu, Xiao Fu, Fengcun Li +6Mixture-of-Experts Language ModelsDisaggregated LLM Serving

  13. BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

    Aug 3, 2026Chong Peng, Pin Qian, Su Wang +2Cost-Aware InferenceText-to-SQL

  14. Uncertainty Is Not Enough: Value-of-Information Routing for Mixtures of LoRA Experts

    Aug 3, 2026Tom Saliencro, Rohan Desai, Priya Nair +2Adaptive Model RoutingSelective Prediction

  15. BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition

    Aug 3, 2026Jiaorong Feng, Qian Li, Ying LiCost-Aware InferenceActive Learning

  16. CARE: A Cascaded Framework for Efficient and Reliable Time Series Anomaly Detection

    Aug 3, 2026Zemin Chao, Qianhui Xu, Jianhe Cen +3Efficient Neural Network InferenceCost-Aware Inference

  17. Computing with Agentic Oracles

    Aug 2, 2026Jie WangCost-Aware Inference

  18. When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

    Aug 1, 2026Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller +1LLM EvaluationLLM Self-Refinement

  19. HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

    Aug 1, 2026Xin Yuan, Ning Li, Wenchao Xu +2Edge InferenceCost-Aware Inference

  20. ARES: Adaptive Reasoning-Effort Steering for PPA- and Cost-Aware RTL Optimization with LLM Agents

    Jul 30, 2026Stef Cuyckens, Mihaela Jivanescu, Jun Yin +2Inference-Time OptimizationLarge Language Model-Guided Optimization

  21. Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

    Jul 29, 2026Yansen Zhang, Yilu Liu, Tianyu Liu +6Inference-Time SearchAutomated Algorithm Discovery