Workload

Momentum

3 papers in the last four weeks, down 25% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 69

All topics
CardsList
  1. AgBench: Agentic AI Benchmarks for Personal AI Devices

    Sep 29, 2026Yizhou Han, Di Wu, Dhananjay Saikumar +1Agentic BenchmarksArtificial Intelligence Systems

  2. When Fancy Eviction Fails: Rethinking Cache Replacement For LLM Prefix Reuse

    Sep 24, 2026Yiyu Liu, Minlan Yu, Juncheng YangEvictionCache

  3. Artificial Intelligence for Energy Optimization in Data Centers

    Sep 3, 2026Mohammed Basharath Ullah, Summaiya Unnisa Begum, Mohammed Nadeem UllahEnergy-EfficientEnergy Resources

  4. Workload Identification with Physical Side Channels for AI Governance

    Aug 31, 2026Simone Gargiulo, Gabriel KulpGraphics Processing Unit ResourcesWorkload

  5. Intelligent Edge Computing

    Aug 31, 2026Kalgi Gandhi, Minal BhiseIntelligent EdgeWorkload

  6. LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm

    Aug 6, 2026Anjali Gangadhar Katageria, Shobha Rani, Raghu Nandan SenguptaWorkloadQueue Control

  7. DeGS: A Scalable 3DGS Architecture via Decoupled Workload Parsing and Reorganization

    Aug 3, 2026Minnan Pei, Gang Li, Zeyu Zhu +7Dynamic 3D Gaussian SplattingScalability

  8. Understanding Online Failure Prediction in Linux Through Complementary Multi-View Explainability

    Aug 1, 2026Diogo Dória, João R. CamposEarly Failure PredictionWorkload

  9. Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces

    Aug 1, 2026Liming Liu, Chao Hu, Mingfei Lu +7Large Language Model ServingWorkload

  10. Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

    Jul 30, 2026Banruo Liu, Haoran Qiu, Íñigo Goiri +3Coding AgentsCopilot

  11. WISERouter: LLM Routing with Workload Budget Constraint

    Jul 26, 2026Yifei Li, Zihui Gao, Laks V. S. LakshmananLarge Language Model RoutingWorkload

  12. Workload-Driven Optimization for On-Device Real-Time Subtitle Translation

    Jul 10, 2026Tsz-To WongTranslation QualitySmall Large Language Models

  13. Workload-Preserving Differentially Private Synthetic Data for Causal Inference via Maximum-Entropy Calibration

    Jul 9, 2026Amir Asiaee, Kaveh AryanCausal InferencesSynthetic Data

  14. Optimizing ML Workload Partitioning between CPUs and CIM Accelerators for Heterogeneous Computing

    Jul 6, 2026Joel Klein, Rebecca Pelke, Roberto Laudani +2Inference WorkloadsIn-Memory Computing

  15. ProWAFT: A ROMA-LPD Instance for Workload-Aware and Dynamic Fault Tolerance in FPGA-Based CNN Accelerators

    Jul 2, 2026Xinxin Chen, Haoran Qiao, Yiming Guo +3Field-Programmable Gate ArraysFault Tolerance

  16. Atompack: A Storage and Distribution Layer for Read-Heavy Atomistic ML Training Datasets

    Jun 29, 2026Ali Ramlaoui, Daniel T. Speckhard, Sagar Pal +3Molecular DynamicsModel Training

  17. Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure

    Jun 24, 2026Maxwell Twelftree, David Lemphers, An-chi He +1WorkloadArtificial Intelligence Infrastructure

  18. Managing Task Execution for Unknown Workloads in Batteryless IoT: A Hardware-Agnostic Evaluation

    Jun 23, 2026Samer Nasser, Henrique Duarte Moura, Ritesh Kumar Singh +2WorkloadResource-Constrained Edge Devices

  19. Recency/Frequency Adaptive KV Caching for Large Language Model Serving

    Jun 19, 2026Yang Shen, Meghana Madhyastha, Robert Underwood +2Key-Value CacheLLM Inference Optimization

  20. Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers

    Jun 19, 2026Zihan Yu, Xianling Zeng, Zhiming Xue +2Artificial Intelligence InfrastructureWorkload

  21. Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

    Jun 17, 2026Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar +2Large Language Model AgentsDecoupling

  22. OmniPlan: An Adaptive Framework for Timely and Near-Optimal Network Planning Optimization

    Jun 16, 2026Longlong Zhu, Jiashuo Yu, Zedi Chen +12Bringing Network CodingOptimization Modeling

  23. AIChilles: Automatically Uncovering Hidden Weaknesses in AI-Evolved Systems

    Jun 14, 2026Yajie Zhou, Ao Li, Ashwin Silla +2Self-Evolving AgentsSelf-Evolution

  24. Service-Induced Congestion in Memory-Constrained LLM Serving

    Jun 14, 2026Ruicheng Ao, Jing Dong, Gan Luo +1Large Language Model ServingLarge Language Model Memory

  25. Multimodal Physiological Assessment of Contact-Rich Physical Human-Robot Interaction Under Varying Environmental Conditions

    Jun 12, 2026Yanyi Chen, Xi Wang, Min DengPhysiological DataPhysiological Signals

  26. Complexity-Balanced Diffusion Splitting

    Jun 4, 2026Noam Issachar, Dani Lischinski, Raanan FattalGenerative ModelsWorkload

  27. Multi-Camera AR Guidance System for Surgical Instrument Handling and Assembly: Investigating Workload and Efficiency

    Jun 3, 2026Shiyu Li, Julian Kreimeier, Hannah Schieber +4Surgical RobotsAugmented Reality

  28. MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency

    Jun 2, 2026Saptarshi Mitra, Yifan Zhang, Rachid Karami +5Mixture-Of-Expert InferenceWorkload

  29. DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

    Jun 2, 2026Kathiravan PalaniappanSchedulersWorkload

  30. ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

    May 30, 2026Seokjin Go, Marko Scrbak, Ephrem Wu +2Mixture-Of-Expert InferenceInference Workloads

  31. SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition

    May 29, 2026Yunkai Lou, Longbin Lai, Shunyang Li +2Large DatabasesWorkload

  32. An Empirical Audit of k-NAF Budget Accounting for Anchored Decoding

    May 27, 2026J. VijayavallabhToken Budget AllocationModel Auditing

  33. A Policy-Driven Runtime Layer for Agentic LLM Serving

    May 26, 2026Rui Zhang, Chaeeun Kim, Liting HuMulti-Llm AgentsProduction Agentic Systems

  34. AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory

    May 24, 2026Aojie Yuan, Haiyue Zhang, Shahin NazarianConversational MemoryWorkload

  35. Accelerating Divisible Load Processing Through Machine Learning: A Practical Framework for Large-Scale Workloads

    May 22, 2026Bharadwaj VeeravalliInference WorkloadsWorkload

  36. Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

    May 19, 2026Mert Yildiz, Pietro Spadaccino, Alexey Rolich +2PreemptionOffloading

  37. TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

    May 16, 2026Hanzhang Shen, Haoran Wu, Yiren Zhao +1Key-Value Cache QuantizationAgentic Inference

  38. Driving Through the Network: Performance and Workload Under Latency and Video Impairment

    May 15, 2026Ines Trautmannsheimer, Ahmed Azab, Frank DiermeyerVideo QualityTeleoperation

  39. APWA: A Distributed Architecture for Parallelizable Agentic Workflows

    May 14, 2026Evan Rose, Tushin Mallick, Matthew D. Laws +2Multi-Agent WorkflowsAgentic Workflows

  40. BlitzGS: City-Scale Gaussian Splatting at Lightning Speed

    May 13, 2026Zhongtao Wang, Huishan Au, Yilong Li +6Gaussian PrimitivesSpeeds

  41. ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload

    May 11, 2026Ziyue Liu, Zhengyang Wang, Ruijie Zhang +7Large Language Model TrainingFault Tolerance

  42. Agent-X: Full Pipeline Acceleration of On-device AI Agents

    May 11, 2026Jinha Chung, Byeongjun Shin, Jiin Kim +1Workload

  43. From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs

    May 10, 2026Daemyung Kang, Eunjin Hwang, Hanjeong Lee +11NvidiaWorkload

  44. Regulating Branch Parallelism in LLM Serving

    May 7, 2026Swapnil Gandhi, Siva Hari, William J. Dally +1Large Language Model ServingWorkload

  45. Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management

    May 7, 2026Haoyu Zheng, Fangcheng Fu, Jia Wu +6Kv-Cache ManagementWorkload

  46. Human-Less LLM Serving: Quantifying the Human Tax on Throughput

    May 3, 2026Jianhui Lian, Li Chen, Dan Li +1Large Language Model ServingTime-To-First-Token

  47. MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving

    May 3, 2026Zhaoyuan Su, Olatunji Ruwase, Karthik Ganesan +5Mixture-Of-Expert InferencePrefill

  48. Pythia: Exploiting Workflow Predictability for Efficient Agent-Native LLM Serving

    Apr 28, 2026Shan Yu, Junyi Shu, Yuanjiang Ni +14WorkloadCache

  49. Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

    Apr 28, 2026Srikanta Prasad S, Utkarsh AroraAgentic InferenceArtificial Intelligence Deployment