AI Accelerator Inference

Latest papers 68

All topics
CardsList
  1. Axon: A Synthesizing Superoptimizer for Tensor Programs

    Jun 24, 2026Akash Kothari, Shaowei Zhu, Daniel Kroening +1AI Accelerator InferenceHigh-Performance Computing

  2. An Empirical Study of OpenPangu Quantization on Ascend NPUs

    Jun 19, 2026Tong Shi, Jiacheng Wang, Hui Xie +4LLM QuantizationAI Accelerator Inference

  3. MIVE: A Minimalist Integer Vector Engine for Softmax LayerNorm and RMSNorm Acceleration

    Jun 16, 2026Kosmas Alexandridis, Giorgos DimitrakopoulosAI Accelerator InferenceInference Acceleration

  4. AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

    Jun 16, 2026Kaijian Wang, Yuanyuan Xu, Fanjiang Ye +5AI Accelerator InferenceVideo Diffusion Models

  5. Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

    Jun 14, 2026Shun Usami, Venkatram Vishwanath, E. Wes BethelAI Accelerator InferenceLLM Inference

  6. A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference

    Jun 13, 2026Yingnan Zhao, Razvan Bunescu, Ahmed Louri +2AI Accelerator InferenceMixture-of-Experts Inference

  7. ANEForge: Python for direct computation on the Apple Neural Engine

    Jun 12, 2026Spencer H. BryngelsonEfficient Neural Network InferenceAI Accelerator Inference

  8. Efficient On-Device Diffusion LLM Inference with Mobile NPU

    Jun 11, 2026Tuowei Wang, Yanfan Sun, Ju RenAI Accelerator InferenceOn-Device Language Model Inference

  9. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Mixed-Precision QuantizationLLM Quantization

  10. Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

    Jun 9, 2026Zhiyuan Cheng, Longying LaiRetrieval-Augmented GenerationAI Accelerator Inference

  11. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

    Jun 6, 2026Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen +5AI Accelerator InferenceEfficient VLM Inference

  12. Terastal: Layer-Variant-based Scheduling for Real-Time Multi-DNN Workloads on Heterogeneous Accelerators

    Jun 5, 2026Sing-Yao Wu, Fengshuo Song, Eli BozorgzadehAI Accelerator InferenceReal-Time Scheduling

  13. Operator Fusion for LLM Inference on the Tensix Architecture

    Jun 3, 2026Qingbo Wu, Ke Li, Wenzhu Wang +3Efficient Transformer InferenceAI Accelerator Inference

  14. KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

    Jun 1, 2026Taras Sereda, Burak Bartan, Ankita Nayak +3AI Accelerator InferenceGPU Kernel Optimization

  15. MX-SAFE: Versatile Inference- and Training-Proof Microscaling Format with On-the-Fly Exponent and Mantissa Bit Allocation

    May 23, 2026Dahoon Park, Jahyun Koo, Sangwoo Hwang +1Mixed-Precision QuantizationAI Accelerator Inference

  16. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

    May 22, 2026Pu Li, Jiawen Qi, Qinyu ChenAI Accelerator InferenceOn-Device Language Model Inference

  17. Fast and Stable Triangular Inversion for Delta-Rule Linear Transformers

    May 20, 2026Aleksandros Sobczyk, Gioele Gottardo, Christos K. Matzoros +4Efficient Transformer InferenceAI Accelerator Inference

  18. FLARE: One-Shot PE-Level Fault Localization in Systolic Arrays via Algebraic Test Vectors

    May 9, 2026Logashree Venkatasubramanian, Zishen Wan, Viveck CadambeAI Accelerator InferenceFault Localization

  19. TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators

    May 6, 2026Chang Meng, Hanyu Wang, Yuyang Ye +3AI Accelerator InferenceEnergy-Efficient ML

  20. Performance Optimization and Comparative Analysis of Generative AI Models on Advanced Accelerators

    May 5, 2026Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral +3Mixed-Precision QuantizationAI Accelerator Inference

  21. DPU or GPU for Accelerating Neural Networks Inference -- Why not both? Split CNN Inference

    Apr 30, 2026Ali Emre Oztas, Mahir Demir, James Garside +1AI Accelerator InferenceGPU Acceleration

  22. Physical Foundation Models: Fixed hardware implementations of large-scale neural networks

    Apr 30, 2026Logan G Wright, Tianyu Wang, Tatsuhiro Onodera +1Efficient Neural Network InferenceAI Accelerator Inference

  23. Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

    Apr 27, 2026Kaijun Zhou, Qiwei Chen, Da Peng +3AI Accelerator InferenceEdge Inference

  24. Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

    Apr 24, 2026Harri Renney, Fouad Trad, Michael Mattarock +1AI Accelerator InferenceOn-Device Language Model Inference