AI Accelerator Inference

Latest papers 68

All topics
CardsList
  1. LampAttention: Look-Ahead Mixed-Precision FlashAttention for Dedicated Accelerators

    Sep 30, 2026Stanislav Budzinskiy, Marian Gloser, Tolunay Yilmaz +5AI Accelerator InferenceLLM Inference Acceleration

  2. Accelerator Choice Is Not Enough: AlphaFold2 Inference on Cloud TPUs

    Sep 28, 2026Lorenzo Pazienza, Ihab El BaniAI Accelerator InferenceEfficient Inference

  3. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6AI Accelerator InferenceOn-Device Language Model Inference

  4. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoAI Accelerator InferenceVLM Quantization

  5. OptiPrime: Optimizing Private Inference through Protocol-Hardware Co-design

    Sep 15, 2026Jiangrui Yu, Ye Yu, Si Chen +5Efficient Neural Network InferenceSecure Multi-Party Computation

  6. A 25-μμs/inf Event-driven Graph Neural Network Processor with Spatiotemporal Caching and Spline Convolution for Ultra-low-latency AI at the Edge

    Sep 14, 2026Adrian Kneip, Martin Lefebvre, Daniel Gehrig +4Event-Based VisionAI Accelerator Inference

  7. NeuroFlex: Lossless Element-Level ANN-SNN Co-Execution for Efficient Sparse Inference

    Sep 12, 2026Varun Manjunath, Pranav Ramesh, Gopalakrishnan SrinivasanEfficient Neural Network InferenceAI Accelerator Inference

  8. Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

    Aug 5, 2026Zheng Liu, Zeyu Guo, Zihan Liu +9AI Accelerator InferenceEfficient VLA Model Inference

  9. LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Jungjun Oh +2LLM QuantizationAI Accelerator Inference

  10. GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Byeongcheol Kim +2AI Accelerator InferenceRotation-Based Quantization

  11. AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

    Jul 29, 2026Junhao Qiu, Zidong Wang, Yansong Sun +3AI Accelerator InferenceLarge Language Model-Guided Optimization

  12. A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

    Jul 27, 2026Zhuoran Song, Haozhe Jiang, Chunyu Qi +4AI Accelerator InferenceEfficient VLA Model Inference

  13. From Bit-Position Sensitivity to Unequal Error Protection for DNN Inference Memory

    Jul 21, 2026Muhammad Husnain Mubarik, Karthik Mohan Kumar, Pedro Antonio Pena +2AI Accelerator Inference

  14. BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

    Jul 21, 2026Fabian Waschkowski, Prabod Rathnayaka, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference

  15. BRIM: Workload-Balanced Dual-Sided Bit-Serial Sparse Inference Accelerator

    Jul 20, 2026Varun Manjunath, Ruokai Yin, Donghyun Lee +2Efficient Neural Network InferenceAI Accelerator Inference

  16. ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts

    Jul 19, 2026Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa +1AI Accelerator InferenceMixture-of-Experts Inference

  17. Automatic Model-Hardware Co-Adaptation for Heterogeneous AI Accelerators

    Jul 14, 2026Tian Chen, Mingheng Mi, Pu Wang +2AI Accelerator InferenceLLM Inference

  18. HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference

    Jul 13, 2026Yongqin ZhangAI Accelerator InferenceMixture-of-Experts Inference

  19. FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

    Jul 13, 2026Wenzong Yang, Danyang Zhang, Kun Cao +17AI Accelerator InferenceLLM Inference

  20. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference

    Jul 6, 2026Guanyu Cai, Ruiming Tian, Lang Yang +4LLM Inference EfficiencyAI Accelerator Inference

  21. BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

    Jul 1, 2026Prabod Rathnayaka, Fabian Waschkowski, Lukas WesemannAI Accelerator InferenceOn-Device Language Model Inference

  22. SEADA: An efficient methodology for optimizing mixed-precision DNNs on multi-precision spatial architectures

    Jun 26, 2026Leandro Fiorin, Marco Ronzani, Cristina SilvanoMixed-Precision QuantizationEfficient Neural Network Inference