18 papers in the last four weeks, up 157% on the four weeks before. 0.2% of all new papers.
Apr 20, 2026·Tobias Grantner, Emanuel Sallinger, Martin FlechlMemory-Efficient InferenceText Embedding Models
Dynatrace Research · TU Wien · University of Oxford
Apr 18, 2026·Nges Brian Njungle, Eric Jahns, Michel A. KinsyEfficient Neural Network InferenceMemory-Efficient Inference
STAM Center, Ira A. Fulton Schools of Engineering · Arizona State University, Tempe, AZ 85281, USA
Apr 16, 2026·Xinyu Liu, Xin Liu, Bo Jin +8Multi-Token PredictionKV Caching
School of Computer Science and Engineering, Northeastern University, China · Meituan Inc. · NiuTrans Research, Shenyang, China
Feb 11, 2026·Muyan Hu, Ahan Gupta, Jiachen Yuan +7Efficient Neural Network InferenceMemory-Efficient Inference
University of Illinois Urbana-Champaign · Georgia Institute of Technology · Microsoft
Jan 22, 2026·Byeongju Kim, Jungwan Lee, Donghyeon Han +2Edge InferenceMixture-of-Experts Inference
Oct 15, 2025·Yuxiang Huang, Pengjie Wang, Jicheng Han +9KV-Cache OffloadingGPU Acceleration
NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China. · OpenBMB, China. · BUPT, Beijing, China. +1
Jun 2, 2025·Yimin DuText EmbeddingsWord Embeddings
Independent Researcher Beijing, China
Feb 24, 2025·Xuanfan Ni, Liyan Xu, Chenyang Lyu +6KV CachingMemory-Efficient Optimization
Nanjing University of Aeronautics and Astronautics · WeChat AI, Tencent · Independent Researcher +1
Jan 13, 2025·Yuji Chai, Mujin Kwun, David Brooks +1LLM QuantizationOn-Device Language Model Inference
Harvard John A. Paulson School Of Engineering And Applied Sciences Cambridge, Massachusetts, USA
Date pending·Qingxiu Liu, Yongchao He, Runhan Jiang +4Expert OffloadingGPU Acceleration
CUHK · Unaffiliated · SCITIX +1
Date pending·Zhenhe Wu, Yaping Jin, Qinghua Xing +6Mixture of ExpertsMemory-Efficient Optimization
Huawei Technologies · Beihang University · Tianjin University +2