Neural Processing Units

Momentum

7 papers in the last four weeks, against 1 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 31

All topics
CardsList
  1. From Experience to Expertise: Adoption-Aware Memory Learning for Data-Scarce NPU Kernel Synthesis

    Sep 28, 2026Longxiao Fan, Tao Zhang, Han Yan +5Neural Processing UnitsCross-Task Knowledge Transfer

  2. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6Kv-Cache ManagementNeural Processing Units

  3. Does per-frame early exit pay? A compute-matched study of dynamic depth for on-device speech enhancement

    Sep 24, 2026Clément Laroche, Riccardo MicciniSpeech EnhancementNeural Processing Units

  4. Beyond Model Size: Redesigning LiSenNet for embedded speech enhancement

    Sep 24, 2026Clément Laroche, Rasmus Kongsgaard OlssonSpeech EnhancementNeural Processing Units

  5. NPBoost: Neural Processes with Gradient-Boosted Fixed Effects

    Sep 23, 2026Andrea Nava, Ken Rölli, Armin Begic +1Meta-LearningNeural Processing Units

  6. RISC-V and machine learning: a survey

    Sep 17, 2026Shriman Keshri, Apparna Singh, Chinmaya Kumar Palo +2Risc-VNeural Processing Units

  7. DynaNDE: Dynamic Near-Data Expert Scheduling for Batched MoE Inference

    Aug 31, 2026Xiaoyang Lu, Belthangady Akash Vi Narayana Pai, Xian-He SunMixture-Of-Expert InferenceNeural Processing Units

  8. AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

    Jul 29, 2026Junhao Qiu, Zidong Wang, Yansong Sun +3Neural Processing UnitsHardware Efficiency

  9. QScheduler: Adaptive Gradient Sampling for Zeroth-Order On-Device Training on INT8 NPUs

    Jul 21, 2026Victor Felipe Domingues Do Amaral, Pierre Demaj, Erwan Libessart +3Zeroth-Order OptimizationNeural Processing Units

  10. Mitigating Compiler Fusion-Induced Power Bursts in Mobile NPU Inference as the Battery Depletes

    Jul 17, 2026Ryoga Yuzawa, Masayoshi TomizukaNeural Processing UnitsVoltage

  11. STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

    Jul 10, 2026Victor J. B. Jung, Gagandeep Singh, Joseph Melber +3Neural Processing UnitsTaxonomy-Driven Dataflow Model

  12. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4Neural Processing UnitsLLM Inference Optimization

  13. AI-RAN on NPUs: Baseband Processing Without Baseband Chips

    Jul 5, 2026Shilong Zhang, Luping Xiang, Jienan Chen +1Neural Processing UnitsOpen Radio Access Networks

  14. Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation

    Jul 2, 2026Junyi Wen, Ruiyan Zhuang, Yongjia Xu +7Graphics Processing Unit KernelsNeural Processing Units

  15. NPUsper: Eliminating Redundant Computation for Real-Time Whisper on Mobile NPUs

    Jul 1, 2026Sihyeon Lee, Hojeong Lee, Sungwon Woo +3Whisper-Large-V3Neural Processing Units

  16. An Empirical Study of OpenPangu Quantization on Ascend NPUs

    Jun 19, 2026Tong Shi, Jiacheng Wang, Hui Xie +4Post-Training QuantizationNeural Processing Units

  17. KATANA: A Fast, Low-Power Mapping of Kalman Filters onto Edge NPUs for Real-Time Tracking

    Jun 12, 2026Bodhisatwa Kundu, Anish Rooj, Sumit Saha +4Extended Kalman FilterNeural Processing Units

  18. Efficient On-Device Diffusion LLM Inference with Mobile NPU

    Jun 11, 2026Tuowei Wang, Yanfan Sun, Ju RenNeural Processing UnitsLLM Inference Optimization

  19. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Neural Processing UnitsMatrix Multiplication

  20. Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

    Jun 9, 2026Zhiyuan Cheng, Longying LaiAgentic Retrieval-Augmented Generation SystemsNeural Processing Units

  21. CFRNet: Cycle-Consistent Fixed-Point Training for Real-Time Blind Face Restoration on Consumer Embedded NPUs

    Jun 5, 2026Fuchen Li, Xinyang Wang, Yahui Zhang +4Blind Face RestorationImage Restoration

  22. Uncertainty-Aware End-to-End Co-Design of Neural Network Processors: From Training and Mapping to Fabrication

    Jun 3, 2026Yuyang Du, Yujun Huang, Gioele ZardiniCo-DesignNeural Processing Units

  23. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

    May 22, 2026Pu Li, Jiawen Qi, Qinyu ChenNeural Processing UnitsLLM Inference Optimization

  24. HyperBones: Realtime Bone-driven Neural Garment Simulation with Hypernetwork Conditioning

    May 19, 2026Astitva Srivastava, Hsiao-Yu Chen, Ryan Goldade +9Motion-Aware Clothing DynamicsGarments

  25. Real Image Denoising with Knowledge Distillation for High-Performance Mobile NPUs

    May 5, 2026Faraz Kayani, Sarmad Kayani, Asad Ahmed +2Neural Processing UnitsMobilenetv2

  26. DPU or GPU for Accelerating Neural Networks Inference -- Why not both? Split CNN Inference

    Apr 30, 2026Ali Emre Oztas, Mahir Demir, James Garside +1Neural Network InferenceEdge Devices

  27. Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs

    Apr 20, 2026Afsara Benazir, Felix Xiaozhu LinNeural Processing UnitsMixture-Of-Expert Inference

  28. Towards Real-Time ECG and EMG Modeling on μμNPUs

    Apr 20, 2026Josh Millar, Ashok Samraj Thangarajan, Soumyajit Chatterjee +1Physiological SignalsNeural Processing Units