Cost-Aware Inference

Latest papers 180

All topics
CardsList
  1. Evaluating Inference Compute for Generative AI: A Framework for Enterprise Workloads

    Oct 5, 2026Abbas Raza Ali, Muhammad Ajmal Siddiqui, Moona ZahidLLM Inference EfficiencyDisaggregated LLM Serving

  2. From Token-Max to Outcome-Max: How You Use AI Determines Its Productivity

    Oct 5, 2026Chen Xu, Mengqiao Liu, Beibei Li +1Cost-Aware InferenceHuman-AI Collaboration

  3. SCOPE-AD: Sequential cost-aware ordinal-belief planning with energy-based models for diagnostic agents

    Oct 1, 2026Ziwen Yu, Ivan Koychev, Elizabeth Coulthard +7Cost-Aware InferenceModel-Based Planning

  4. Denoising Surface: Modeling and Predicting Inference Cost for Diffusion LLM Serving

    Sep 30, 2026Haoyu Zheng, Fangcheng Fu, Binhang Yuan +6Cost-Aware InferenceDiffusion Model Serving

  5. Metacognitive Reasoning in Energy Based Models using Instance Based Learning Theory

    Sep 30, 2026Tailia Malloy, Prateek Kumar Rajput, Serge Lionel Nikiema +2Cost-Aware InferenceEnergy-Based Models

  6. You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference

    Sep 29, 2026Liang He, Jingbo Wen, Yixiong Chen +4LLM ServingCost-Aware Inference

  7. Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

    Sep 29, 2026Guannan Lai, Gelin Bian, Hao-Xuan Ma +5LLM ServingCost-Aware Inference

  8. When Should Agents Check External State? Budgeting Observations for Stored Intentions

    Sep 29, 2026Zhengkun Di, Bin Shi, Kai Sun +2Cost-Aware InferenceAgent Memory Management

  9. CADOC: Cache-Aware Dynamic Object Context for Long-Horizon Agents

    Sep 29, 2026Junjie Yao, Zhangchen Zhou, Zhi-Qin John XuCost-Aware InferencePrefix Caching

  10. LoopICL: Looping a single transformer block to solve tabular tasks

    Sep 28, 2026Amir Rezaei Balef, Katharina EggenspergerTabular Foundation ModelsCost-Aware Inference

  11. TokenCast: Forecasting Token Consumption During LLM Agent Execution

    Sep 28, 2026Chaoqian Ouyang, Ling Yue, Libin Zheng +7Cost-Aware InferenceEfficient Language Model Inference

  12. Long-Horizon Scaling: How Model Capabilities Shape the Returns to Computation

    Sep 28, 2026Haoyu Zheng, Zhengyu Chen, Huaisheng Zhu +5Cost-Aware InferenceInference-Time Scaling

  13. RSI-Router: Evolving Subtask-Level LLM Routing and Skills for Cost-Efficient Agents

    Sep 28, 2026Hao Li, Hangfan Zhang, Zhiyao Cui +5Cost-Aware InferenceLLM Agent Workflow Optimization

  14. The Decision Value of Perception Compute

    Sep 28, 2026Hoang Pham Cong, Ho Viet Duc LuongCost-Aware InferenceAutonomous Driving Perception

  15. Test-Time Scaling via Budgeted Multi-Attribute Verification

    Sep 28, 2026Bo Xue, Ji Cheng, Shen-Huan Lyu +2Multi-Armed BanditsLLM Answer Verification

  16. Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents

    Sep 25, 2026Yiran Hu, Nan Jiang, Shanchao Liang +3Coding AgentsCost-Aware Inference

  17. Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation

    Sep 24, 2026Dae Woong, Ham, Xuejun Zhao +2Cost-Aware InferenceHuman-in-the-Loop Evaluation

  18. Learning the Cost of Reliable Inference

    Sep 23, 2026Dimitrios Rontogiannis, Ander Artola Velasco, Manuel Gomez RodriguezCost-Aware InferenceLLM Routing

  19. Total Cost of Agency: Exact Attribution of Memory Injection Cost in Multi-Agent LLM Workflows

    Sep 20, 2026Vivek Kumar Singh, Preeti Priyam, Gautam BhowmickLLM Agent MemoryCost-Aware Inference

  20. Designing Agentic AI Workflow Portfolios under Imperfect Selection and Compute Cost

    Sep 16, 2026Mojtaba Abdolmaleki, Stefanus Jasin, Boyu WangCost-Aware InferenceAgentic Workflows

  21. Explanations-Driven Active Feature Acquisition for Algorithmic Recourse

    Sep 14, 2026Vinura Galwaduge, Jagath SamarabanduCounterfactual ExplanationsCost-Aware Inference

  22. Calibration-Aware Uncertainty Cascades for Efficient Heterogeneous Model Collaboration

    Sep 12, 2026Yilin Zhang, Han Jiang, Cai Xu +2Selective PredictionCost-Aware Inference

  23. A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark

    Sep 7, 2026Yoga Sri Varshan Varadharajan, Ajay Yadav, Ritesh Goru +5Cost-Aware InferenceText-to-SQL

  24. Task-Aware QUBO Allocation for Mixed-Precision Quantization

    Sep 4, 2026Osama Orabi, Artur Zagitov, Hadi Salloum +2Mixed-Precision QuantizationCost-Aware Inference

  25. CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

    Sep 1, 2026Chaohui Guo, Michel Klein, Zhisheng HuangReinforcement LearningLLM Inference Scheduling

  26. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

    Sep 1, 2026Xiaowei Sun, Jin Li, Yili Hong +2Cost-Aware InferenceConstrained RL

  27. SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

    Aug 13, 2026Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar HanawalEdge ComputingCost-Aware Inference

  28. Error-Aware Reverse Auction Mechanism for Large Language Model Routing

    Aug 13, 2026Haolong Chen, Zhengyuan Xin, Liang Zhang +2Cost-Aware InferenceLLM Routing

  29. How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

    Aug 12, 2026Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics +4Protein Structure PredictionInference-Time Optimization

  30. Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Aug 12, 2026Natchanon Pollertlam, Witchayut KornsuwannawitLLM ServingLLM Agent Memory

  31. RAISE: Diagnosing Acquisition Collapse in Costly LLM Signals

    Aug 11, 2026Ying Yuan, Yu Wang, Yize Cheng +1Cost-Aware InferenceLLM Routing

  32. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

    Aug 10, 2026Björn Engdahl, Adrian Kosowski, Jan Chorowski +6Cost-Aware InferenceEfficient Language Model Reasoning

  33. Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

    Aug 9, 2026Sourav Das, Tanmay Joshi, Kripabandhu GhoshFine-TuningLLM Fine-Tuning

  34. CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing

    Aug 7, 2026Yan Zhou, Yue Ouyang, Kaiyang Zheng +1Cost-Aware InferenceTest-Time Scaling

  35. Pre-Inference Routing for Cost-Efficient Document Field Extraction

    Aug 6, 2026Sreerekha RajendranAdaptive Model RoutingDocument Information Extraction

  36. AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation

    Aug 5, 2026Chengyu Qiu, Xiao Fu, Fengcun Li +6Mixture-of-Experts Language ModelsDisaggregated LLM Serving

  37. BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

    Aug 3, 2026Chong Peng, Pin Qian, Su Wang +2Cost-Aware InferenceText-to-SQL

  38. Uncertainty Is Not Enough: Value-of-Information Routing for Mixtures of LoRA Experts

    Aug 3, 2026Tom Saliencro, Rohan Desai, Priya Nair +2Adaptive Model RoutingSelective Prediction

  39. BRiG-AFA: Bellman Risk-to-Go Learning for Non-Myopic Active Feature Acquisition

    Aug 3, 2026Jiaorong Feng, Qian Li, Ying LiCost-Aware InferenceActive Learning

  40. CARE: A Cascaded Framework for Efficient and Reliable Time Series Anomaly Detection

    Aug 3, 2026Zemin Chao, Qianhui Xu, Jianhe Cen +3Efficient Neural Network InferenceCost-Aware Inference

  41. Computing with Agentic Oracles

    Aug 2, 2026Jie WangCost-Aware Inference

  42. When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

    Aug 1, 2026Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller +1LLM EvaluationLLM Self-Refinement

  43. HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

    Aug 1, 2026Xin Yuan, Ning Li, Wenchao Xu +2Edge InferenceCost-Aware Inference

  44. ARES: Adaptive Reasoning-Effort Steering for PPA- and Cost-Aware RTL Optimization with LLM Agents

    Jul 30, 2026Stef Cuyckens, Mihaela Jivanescu, Jun Yin +2Inference-Time OptimizationLarge Language Model-Guided Optimization

  45. Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

    Jul 29, 2026Yansen Zhang, Yilu Liu, Tianyu Liu +6Inference-Time SearchAutomated Algorithm Discovery

  46. RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

    Jul 29, 2026Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha +2Human Activity RecognitionCost-Aware Inference

  47. Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs

    Jul 28, 2026José Thiéry Messigbédé Hagbe, Gani Kawsar Gounou, Songbian Karim ZiméAgricultural Image AnalysisAgricultural Remote Sensing