Preemption

Momentum

7 papers in the last four weeks, up 75% on the four weeks before. 0.1% of all new papers.

Jul 6Week of Sep 21

Latest papers 27

All topics
CardsList
  1. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6Kv-Cache ManagementNeural Processing Units

  2. OLED-MoE: Accelerating MoE-Based dLLM Inference via Inter-Iteration Locality-Aware Expert Offloading

    Sep 27, 2026Jingyuan Xiao, Jiayue Wang, Yitao Hu +7Mixture-Of-Expert InferenceOffloading

  3. Hard Stop: Kernel-Level Preemption and Containment for Rogue Agentic Execution

    Sep 24, 2026José Luis PinoIncident ResponseCyberattacks

  4. ClashBench: Conflicts Leading Agents to Seize and Harm

    Sep 17, 2026Yuejin Xie, Yu Li, Dadi Guo +6Runtime Safety FilteringPreemption

  5. SeqMoE: Toward Full-Load Performance via Predictive and Graph-Compatible MoE Offloading

    Sep 14, 2026Zihan Wang, Yuqi Wang, Lei Gong +5Mixture-Of-Expert InferenceOffloading

  6. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKv-Cache ManagementKey-Value Cache

  7. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3Large Language Model ServingPrefill

  8. Disentangling Statistical Preemption from Entrenchment in Language Models' Avoidance of Overgeneralization

    Sep 1, 2026Yixuan Wang, Freda Shi, Kanishka MisraPreemptionWar

  9. APEX: Adaptive Expert Prefetching for Memory-Efficient Edge MoE Inference

    Aug 12, 2026Alish Kanani, Layan Badawi, Umit Y. OgrasMixture-Of-Expert InferenceMixture-Of-Experts

  10. ArchAgent v2: A Case Study with the Data Prefetching Championship

    Aug 10, 2026Abraham Gonzalez, Raghav Gupta, Akanksha Jain +12Hardware EfficiencyPreemption

  11. TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models

    Jul 8, 2026Yutang Ma, Kecheng Huang, Xikun Jiang +1Large Language Model MemoryLLM Inference Optimization

  12. Beyond Prediction: Tail-Aware Scheduling for LLM Inference

    Jun 16, 2026Yueying Li, Yuanfan Chen, Jiayang Chen +6Large Language Model ServingPreemption

  13. A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

    Jun 13, 2026Yingnan Zhao, Razvan Bunescu, Ahmed Louri +2Mixture-Of-Expert InferenceLLM Inference Optimization

  14. SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

    Jun 3, 2026Yaosheng Fu, Guangxuan Xiao, Xin Dong +2Dynamic Sparse AttentionLLM Inference Optimization

  15. Learning-Augmented Online Scheduling with Parsimonious Preemption

    May 22, 2026Mugen Blue, Sungjin Im, Alexander LindermayrSchedulersPreemption

  16. Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs

    May 21, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuLarge Language Models FailLinguistics

  17. Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

    May 19, 2026Mert Yildiz, Pietro Spadaccino, Alexey Rolich +2PreemptionOffloading

  18. Predictive Prefetching for Retrieval-Augmented Generation

    May 18, 2026Wuyang Zhang, Shichao PeiPreemptionAsynchronous Execution

  19. Fast MoE Inference via Predictive Prefetching and Expert Replication

    May 12, 2026Ankit Jyothish, Ali Jannesari, Aishwarya Sarkar +1Mixture-Of-Expert InferenceLLM Inference Optimization

  20. ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference

    May 11, 2026Han Meng, Danny Willow Liu, Dong LiOffloadingPreemption

  21. PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

    May 10, 2026Bing Xie, Zhipeng Wang, Masahiro Tanaka +1Kv-Cache ManagementEviction

  22. Asymptotically Robust Learning-Augmented Algorithms for Preemptive FIFO Buffer Management

    Apr 29, 2026Wen-Han Hsieh, Ya-Chun LiangLearning-Augmented AlgorithmsQueue Control

  23. Scheduling Analysis of UAV Flight Control Workloads on PREEMPT_RT Linux Using a Raspberry Pi 5

    Apr 21, 2026Luiz Giacomossi, Håkan Forsberg, Ivan Tomasic +2SchedulersPreemption