14 papers in the last four weeks, up 367% on the four weeks before. 0.1% of all new papers.
Oct 5, 2026·Tiffany Gu, Annie Guan, Manshu Huang +3KV-Cache ManagementLLM Inference Acceleration
Capital One · University of Washington
Sep 30, 2026·Sietse SchelpeLLM ServingLong-Context Language Model Inference
Corbenic AI
Sep 28, 2026·Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6AI Accelerator InferenceOn-Device Language Model Inference
Shanghai Jiao Tong University Shanghai, China · Alibaba Group Hangzhou, China · Alibaba Group Hangzhou, Zhejiang, China
Sep 28, 2026·Hyesung Jeon, Hyeongju Ha, Seoyoung Lee +2Multi-Agent LLM SystemsKV-Cache Management
Department of Electrical and Computer Engineering Seoul National University
Sep 28, 2026·Hyesung Jeon, Hyeongju Ha, Jae-Joon KimMulti-Agent LLM SystemsMemory-Efficient Inference
Sep 28, 2026·Timothy DeLise, Seth CromelinLong-Context Language Model InferenceKV-Cache Reuse
Sep 27, 2026·Ruoling Qi, Yirui Liu, Xuaner Wu +5Retrieval-Augmented GenerationKV-Cache Management
Shanghai Jiao Tong University · Institute of Artificial Intelligence, China Telecom (TeleAI) · State University of New York at Buffalo
Sep 26, 2026·Yikai Wang, Xiao Han, Mengmeng Xu +9Long-Horizon Video GenerationDiffusion Model Caching
Meta · S-Lab, Nanyang Technological University
Sep 16, 2026·Mingyang Mao, Wyatt Mackey, Xiaomin LinRetrieval-Augmented GenerationKV Caching
University of South Florida, Electrical and Computer Engineering · DEVCOM Army Research Laboratory
Sep 15, 2026·Dushyant RajputLLM Inference EfficiencyLLM Serving
AltSlate Labs LLP
Sep 14, 2026·Frank LiKV CachingKV-Cache Management
UNSW Sydney
Sep 9, 2026·Hongjian Fan, Kevin Zhang, David Habinsky +1LLM Inference EfficiencyKV Caching
Research Group, Seagate Technology, LLC
Sep 9, 2026·Xi Shi, Mengxin Zheng, Qian LouKV CachingLLM Inference Acceleration
University of Central Florida
Sep 9, 2026·Fumihiko Tachibana, Daisuke Miyashita, Jun DeguchiRetrieval-Augmented GenerationKV Caching
Kioxia Corporation
Sep 7, 2026·Yang Liu, Zhaokai Luo, Huayi Jin +10KV CachingLLM Inference Acceleration
Xiaohongshu Inc., China · Huawei Cloud · Shanghai Jiao Tong University +2
Sep 1, 2026·Xingyu Qu, Siyuan Lu, Zhiyu Chen +2Transformer InferenceKV Caching
Westlake University. · †Work conducted during an internship at Westlake University. · Amazon. +1
Aug 31, 2026·Yi Li, Dongming Jiang, Yi Zhao +1LLM InferenceKV Caching
University of Texas at Dallas
Aug 10, 2026·Tejasvi C. AddagadaKV CachingKV-Cache Management
Aug 7, 2026·Gyuwan Kim, Cheoneum Park, Tao YangLong-Context RetrievalRetrieval-Augmented Generation
University of California, Santa Barbara · Hanbat National University
Aug 4, 2026·Taekyung Heo, Rasoul Shafipour, Ritchie Zhao +6KV CachingLLM Inference Acceleration
NVIDIA
Jul 30, 2026·Alexander Boesgaard LorupLLM InferenceKV Caching
Openhagen
Jul 30, 2026·Hui Xie, Peng Xiao, Yutong Deng +3KV CachingMemory-Efficient Inference
Institute of Artificial Intelligence, Beihang University · State Key Laboratory of Complex & Critical Software Environment · Shen Yuan Honors College, Beihang University +1
Jul 29, 2026·Peter Li, Prashant PandeyLLM ServingMemory-Augmented Language Models
Northeastern University Boston, Massachusetts, USA
Jul 26, 2026·Hojae Son, Md Ashraful Islam, Huy Gia Cao +2LLM ServingLLM Inference Scheduling
UMass Amherst, USA
Jul 22, 2026·Yichi Zhang, Zhiqi Wang, Huan Zhang +1KV CachingLLM Security
The Pennsylvania State University · University of Illinois Urbana-Champaign
Jul 20, 2026·Chuheng Du, Junyi Chen, Hanlin Tang +7KV CachingLLM Inference Acceleration
School of Computer Science Shanghai Jiao Tong University Shanghai, China · Alibaba Group Hangzhou, China
Jul 15, 2026·Sietse SchelpeMemory-Augmented Language ModelsKnowledge Augmentation for Language Models
Jul 11, 2026·Daming Luo, Christy Liang, Junyu XuanKV CachingKV-Cache Reuse
University of Technology Sydney
Jul 10, 2026·Peng Kuang, Haibo Jin, Xiaoyu Han +5Process Reward ModelsKV Caching
University of Illinois Urbana-Champaign · Imperial College London · City University of Hong Kong
Jun 26, 2026·Kaihua Liang, An Zhong, Xin Tan +4KV CachingMemory-Efficient Inference
KAUST · CUHK · LUMS
Jun 25, 2026·Mengzhao Wang, Yanli Ji, Wangmeng Zuo +2Efficient Multimodal InferenceKV Caching
Sun Yat-sen University · Shenzhen Loop Area Institute · Harbin Institute of Technology (HIT) +3
Jun 22, 2026·Bole Ma, Jan Eitzinger, Harald Koestler +1Efficient Multimodal InferenceKV Caching
Jun 14, 2026·Bojie LiKV CachingKV-Cache Management
Pine AI
Jun 11, 2026·Luoyuan ZhangLLM Inference EfficiencyKV Caching
Harbin Institute of Technology, Shenzhen (HITSZ)
Jun 11, 2026·Saehun Chun, Wonje Choi, Sera Choi +2LLM-Based Program SynthesisAgentic Code Generation
Department of Computer Science and Engineering, Sungkyunkwan University, Suwon, Republic of Korea.
Jun 7, 2026·Anirudh SekarLLM Inference EfficiencyKV Caching
Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems, Seoul, South Korea, 2026.
Jun 4, 2026·Yang Liu, ZhaoKai Luo, HuaYi Jin +5LLM ServingKV Caching
†Xiaohongshu Inc., China · ¶Huawei Cloud · §Peking University
Jun 4, 2026·Jianxin Yan, Wangze Ni, Zhenxin Li +8Retrieval-Augmented GenerationKV Caching
Zhejiang University, Hangzhou, China · Ant Group, Shanghai, China · The Hong Kong Polytechnic University, Hong Kong, China +5
Jun 3, 2026·Haocheng Xia, Mihir Pamnani, Hanxi Fang +2Retrieval-Augmented GenerationKV Caching
Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign · Nexla · Amazon +1
May 25, 2026·Victor NorgrenLLM Inference EfficiencyMulti-Agent LLM Systems
LayerScale, Inc.
May 16, 2026·Yu Zhu, Aditya Dhakal, Yunming Xiao +2LLM Inference EfficiencyKV-Cache Offloading
ETH Zurich Switzerland · HPE Labs United States of America · The Chinese University of Hong Kong, Shenzhen China
May 10, 2026·Bing Xie, Zhipeng Wang, Masahiro Tanaka +1LLM ServingKV Caching
†Corresponding author.
May 7, 2026·Haoyu Zheng, Fangcheng Fu, Jia Wu +6LLM Inference EfficiencyKV Caching
Wuhan University · Shanghai Jiao Tong University · Macquarie University +2
Apr 29, 2026·Tianyu Liu, Yuhao Shen, Xinyi Hu +8Speculative DecodingLLM Inference Acceleration
1Qwen Applications Business Group of Alibaba · University of Science and Technology of China · 3Zhejiang University
Apr 27, 2026·Ishan Patel, Ishan JoshiLLM Inference EfficiencyMulti-Agent LLM Systems
Independent Researcher
Apr 24, 2026·Xin Wang, Chi Ma, Shaobin Chen +14KV-Cache OffloadingKV Caching
School of Computer Science, Wuhan University · Meituan · Nvidia
Apr 19, 2026·Sanjeev Rao GanjihalKV-Cache OffloadingKV Caching