Prefill

Momentum

7 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 38

All topics
CardsList
  1. HARISSA: Inference-Time Self-Checks for Efficient and Safe Local Language Model Deployment

    Sep 29, 2026Kenan Alkiek, Moontae Lee, David Jurgens +1Inference-TimePrefill

  2. PrefLUT: Reusable and Refinable Personalized Color Editing from Pairwise Preferences

    Sep 28, 2026Chuanzhi Xu, Langyi Chen, Chengkun Yue +5Image EditingPreference Alignment Learning

  3. Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs

    Sep 26, 2026Vincent-Daniel Yun, Woosang Lim, Haneul Yoo +3PrefillMulti-Agent Large Language Model Systems

  4. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2Large Language Model QuantizationQuantizer

  5. Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving

    Sep 7, 2026Siyu Song, Qi Bai, Jinbo Hao +3Large Language Model ServingPrefill

  6. A Universal Context-Reuse Layer for Cross-Model KV Sharing

    Aug 31, 2026Yi Li, Dongming Jiang, Yi Zhao +1Kv-Cache ManagementKeys And Value

  7. Decode-Branch Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation

    Jul 31, 2026Liming Liu, Mingze Wang, Tuo ZhaoPrefillInference Cost

  8. Sangam: Efficiently Serving Diffusion LLMs with the AR Stack

    Jul 5, 2026Nitin Kedia, Saurabh Agarwal, Myungjin Lee +1Large Language Model ServingDiffusion Language Models

  9. Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

    Jul 2, 2026Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj +2PrefillTime-To-First-Token

  10. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Large Language Model QuantizationGradient Quantization

  11. Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

    Jun 14, 2026Shun Usami, Venkatram Vishwanath, E. Wes BethelLLM Inference OptimizationPrefill

  12. Can I Buy Your KV Cache?

    Jun 11, 2026Luoyuan ZhangKey-Value CacheCache

  13. MiniPIC: Flexible Position-Independent Caching in <100LOC

    Jun 11, 2026Nathan Ordonez, Thomas ParnellPrefillKey-Value Cache

  14. Prefill Awareness in Large Language Models

    Jun 10, 2026Andy Wang, Parv Mahajan, David Demitri Africa +3Prefill

  15. Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

    Jun 9, 2026Jing Xiong, Qi Han, Shansan Gong +5Diffusion Language ModelsPrefill

  16. QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving

    Jun 4, 2026Jianxin Yan, Wangze Ni, Zhenxin Li +8Prefill

  17. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

    May 22, 2026Pu Li, Jiawen Qi, Qinyu ChenNeural Processing UnitsLLM Inference Optimization

  18. Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

    May 19, 2026Haiquan Lu, Zigeng Chen, Gongfan Fang +2PrefillMix

  19. CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

    May 16, 2026Jiwon Song, Dongwon Jo, Beomseok Kang +1PrefillLinear Attention

  20. PreFT: Prefill-only finetuning for efficient inference

    May 14, 2026Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu +4Parameter-Efficient Fine-Tuning MethodsPrefill

  21. What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

    May 10, 2026Jiaping Lin, Fei Shen, Junzhe Li +4Attention-Guided TrainingPrefill

  22. UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification

    May 7, 2026Qihang Fan, Huaibo Huang, Zhiying Wu +2PrefillLLM Inference Optimization

  23. Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility

    May 7, 2026Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji +2Efficient Long-Context InferencePrefill

  24. MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving

    May 3, 2026Zhaoyuan Su, Olatunji Ruwase, Karthik Ganesan +5Mixture-Of-Expert InferencePrefill

  25. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

    Apr 28, 2026Chengsheng Zhang, Chenghao Sun, Xinyan Jiang +2Hallucination MitigationRecent Vision-Language Models

  26. Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

    Apr 20, 2026Yujie Chen, Tailai Chen, Yifeng Gao +4PrefillEfficient Long-Context Inference

  27. LLM Serving Optimization with Variable Prefill and Decode Lengths

    Aug 8, 2025Meixuan Wang, Yinyu Ye, Zijie ZhouLarge Language Model ServingPrefill