Inference Workloads

Momentum

4 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 47

All topics
CardsList
  1. FlexiFlow: Bandit-based Model Switching in ML Workflows

    Oct 5, 2026Abhilash Jindal, Todd Nief, Bhanu Prakash Vangala +6Inference WorkloadsHeterogeneous Modeling Tools

  2. CIPHER-MoE: Balancing Efficiency and Routing Fidelity in Trillion-Scale MoE Training

    Oct 5, 2026Jing Li, Jian Meng, Yingmeng Gao +8Inference Workloads

  3. The Output-Space Hypothesis: Enumerative Equivalence Checking for Tensor Programs

    Sep 17, 2026Paul Biberstein, Joseph Devietti, Mayur NaikCudaBug

  4. SeqMoE: Toward Full-Load Performance via Predictive and Graph-Compatible MoE Offloading

    Sep 14, 2026Zihan Wang, Yuqi Wang, Lei Gong +5Mixture-Of-Expert InferenceOffloading

  5. Memory Compression for High-Fanout Agent Sandboxes

    Sep 12, 2026Mengming Li, Ceyu XU, Qijun Zhang +4SandboxTask-Aware Compression

  6. Network-Aware Forecasting on Wireless Access Points

    Sep 2, 2026Niloo Bahadori, Swadhin Pradhan, Peiman AminiWifiInference Workloads

  7. Prof-K: Probabilistic One-Pass Filtering for Efficient Top-k Selection

    Aug 12, 2026Tadeusz Dziarmaga, Witold Sikora, Łukasz Struski +2Top-KInference Workloads

  8. EasyBalance: Cross-Layer Load Balancing in Distributed MoE Inference

    Aug 8, 2026Yize Wu, Ke Gao, Ling Li +1Load BalancingMixture-Of-Expert Inference

  9. ML-for-ML

    Aug 6, 2026Yutong Zhao, Noga H. Rotman, Gianni Antichi +1Inference WorkloadsBringing Network Coding

  10. On the Limits of Machine-Learned Ranking for Modern Microarchitectural Policies

    Aug 2, 2026Yanxin Zhang, Shayne Wadle, Yuxuan Xiong +3Hardware EfficiencyMle-Bench Lite

  11. The SpiNNaker2 chip: a many-core platform for flexible and scalable brain-inspired computing

    Jul 27, 2026Stefan Scholze, Johannes Partzsch, Sebastian Höppner +27Neuromorphic ComputingChip Design

  12. Relaxed activation analysis of dataflow networks - A clock calculus for machine learning and real-time scheduling

    Jul 23, 2026William Gaudelier, Albert Cohen, Dumitru Potop ButucaruTaxonomy-Driven Dataflow ModelClocks

  13. BRIM: Workload-Balanced Dual-Sided Bit-Serial Sparse Inference Accelerator

    Jul 20, 2026Varun Manjunath, Ruokai Yin, Donghyun Lee +2Inference WorkloadsNeural Network Inference

  14. A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing

    Jul 17, 2026Owen Lockwood, Jérémy Béjanin, Joost Bus +4ThermodynamicsInference Workloads

  15. Quota Marketplace: Dynamic Pricing for Efficient Allocation of ML Training Resources

    Jul 9, 2026Balasubramanian Sivan, Renato Paes Leme, Mihai Tiuca +6SchedulersDynamic Pricing

  16. Optimizing ML Workload Partitioning between CPUs and CIM Accelerators for Heterogeneous Computing

    Jul 6, 2026Joel Klein, Rebecca Pelke, Roberto Laudani +2Inference WorkloadsIn-Memory Computing

  17. WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

    Jul 2, 2026Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezGraphics Processing Unit ArchitecturesLLM Inference Optimization

  18. DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

    Jun 25, 2026Vincent Chen, Starrick Liu, Regis Cheng +8MuonInference Workloads

  19. Load Testing for Machine Learning Model Serving Systems at Scale

    Jun 20, 2026Amr S. Abdelfattah, Nakul Tirumalai, Indu Mohanan +4Large Language Model ServingInference Workloads

  20. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

    Jun 19, 2026Yang Shen, Meghana Madhyastha, Robert Underwood +2Key-Value CacheLLM Inference Optimization

  21. Agentic Framework for Deep Learning workload migration via In-Context Learning

    Jun 14, 2026Qiyue Liang, Steven Ingram, George Vanica +4PytorchAgentic Framework

  22. FMplex: Model Virtualization for Serving Extensible Foundation Models

    Jun 8, 2026Hetvi Shastri, Pragya Sharma, Walid A. Hanafy +3Wireless Foundation ModelsLarge Language Model Serving

  23. Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads

    Jun 8, 2026Minyu Cui, Miquel PericasCpu-Gpu Hybrid DesignsInference Workloads

  24. Breaking the Ice: Analyzing Cold Start Latency in vLLM

    Jun 5, 2026Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin WangLLM Inference OptimizationLarge Language Models(Llms

  25. Terastal: Layer-Variant-based Scheduling for Real-Time Multi-DNN Workloads on Heterogeneous Accelerators

    Jun 5, 2026Sing-Yao Wu, Fengshuo Song, Eli BozorgzadehInference WorkloadsReal-Time Systems

  26. Uncertainty-Aware End-to-End Co-Design of Neural Network Processors: From Training and Mapping to Fabrication

    Jun 3, 2026Yuyang Du, Yujun Huang, Gioele ZardiniCo-DesignNeural Processing Units

  27. EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

    Jun 2, 2026Guilin Zhang, Chuanyi Sun, Kai Zhao +3Reinforcement Learning From Human FeedbackSchedulers

  28. NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference

    Jun 2, 2026Mubarak Adetunji OjewaleKv-Cache ManagementTime-To-First-Token

  29. ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

    May 30, 2026Seokjin Go, Marko Scrbak, Ephrem Wu +2Mixture-Of-Expert InferenceInference Workloads

  30. Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging

    May 28, 2026Yuanyi Wang, Yanggan Gu, Su Lu +5MergeInference Workloads

  31. Accelerating Divisible Load Processing Through Machine Learning: A Practical Framework for Large-Scale Workloads

    May 22, 2026Bharadwaj VeeravalliInference WorkloadsWorkload

  32. MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces

    May 11, 2026Srinivas Sridharan, Theodor-Adrian Badea, Andy Balogh +26Inference WorkloadsCo-Design

  33. BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

    May 11, 2026Ting Sun, Junjie Zhang, Xiao Yan +7Inference WorkloadsWireless Foundation Models

  34. Direction-Preserving Number Representations

    May 8, 2026Bardia Zadeh, George A. ConstantinidesFull-Precision PerformanceVectors

  35. DBLP: Phase-Aware Bounded-Loss Transport for Burst-Resilient Distributed ML Training

    May 3, 2026Zechen Ma, Zixi Qu, Jinyan Yi +2Inference WorkloadsTransport

  36. MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving

    May 3, 2026Zhaoyuan Su, Olatunji Ruwase, Karthik Ganesan +5Mixture-Of-Expert InferencePrefill

  37. Strait: Perceiving Priority and Interference in ML Inference Serving

    Apr 30, 2026Haidong Zhao, Nikolaos GeorgantasInference WorkloadsDeadlines

  38. Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

    Apr 23, 2026Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif +3Multimodal Foundation ModelInference Workloads

  39. One-Block Transformer (1BT) for EEG-Based Cognitive Workload Assessment

    Apr 21, 2026Stefanos Gkikas, Christian Arzate Cruz, Thomas Kassiotis +3Inference WorkloadsCognitive Load

  40. A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs

    Feb 23, 2026Zijie Liu, Jie Peng, Jinhao Duan +7Load BalancingLLM Inference Optimization

  41. VTC: DNN Compilation with Virtual Tensors for Data Movement Elimination

    Feb 11, 2026Muyan Hu, Ahan Gupta, Jiachen Yuan +7Inference WorkloadsNeural Network Inference

  42. DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

    Nov 19, 2025Peiming Yang, Sankeerth Durvasula, Ivan Fernandez +4Inference WorkloadsCode Optimization

  43. FuseSampleAgg: One-Pass Neighborhood Estimation for Budgeted Knowledge-Graph Refresh and Validation

    Nov 17, 2025Aleksandar Stanković, Haoran Du, Xinming WangSubgraphsKnowledge Graph Embeddings

  44. Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs

    Nov 13, 2025Changhai Man, Joongun Park, Hanjiang Wu +3Inference WorkloadsLarge Language Model Workflows