GPU Acceleration

GPU: Graphics Processing Unit

Latest papers 125

All topics
CardsList
  1. Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference

    Date pendingKexin Chu, Dawei Xiang, Zixu Shen +3Mixed-Precision QuantizationGPU Acceleration

  2. FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving

    Date pendingQingxiu Liu, Yongchao He, Runhan Jiang +4Expert OffloadingGPU Acceleration

  3. FP8 is All You Need (Part 1): Debunking Hardware FP64 as the HPC Holy Grail (Sep 3rd version)

    Date pendingSatoshi MatsuokaGPU Kernel OptimizationGPU Acceleration

  4. UltraQuant: 4-bit KV Caching for Context-Heavy Agents

    Date pendingInesh Chakrabarti, David Limpus, Aditi Ghai Rana +4LLM Inference EfficiencyGPU Kernel Optimization