GPU Kernel Optimization

GPU: Graphics Processing Unit

Momentum

14 papers in the last four weeks, up 75% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 126

All topics
CardsList
  1. CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

    May 19, 2026Han Guo, Jack Zhang, Arjun Menon +4GPU Kernel OptimizationGPU Acceleration

  2. Lightweight Gaussian Process Inference in C++ on Metal and CUDA

    May 18, 2026Yu-Hsueh FangGPU Kernel OptimizationGPU Acceleration

  3. cuRegOT: A GPU-Accelerated Solver for Entropic-Regularized Optimal Transport

    May 9, 2026Yixuan QiuGPU Kernel OptimizationQuasi-Newton Methods

  4. CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

    May 8, 2026Shiyang Li, Zijian Zhang, Guangyan Sun +5LLM EvaluationGPU Kernel Optimization

  5. Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

    May 8, 2026Zixuan Huang, Da Chen, Kecheng Huang +5GPU Kernel OptimizationGPU Acceleration

  6. CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels

    May 6, 2026Xing Ma, Yangjie Zhou, Wu Sun +6GPU Kernel OptimizationGPU Acceleration

  7. Tile-Level Activation Overlap for Efficient LLM Inference

    May 5, 2026Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt +3LLM Inference EfficiencyGPU Kernel Optimization

  8. VkSplat: High-Performance 3DGS Training in Vulkan Compute

    Apr 30, 2026Jingxiang Chen, Mohamed Ibrahim, Yang Liu3D Gaussian Splatting3DGS Acceleration

  9. Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

    Apr 25, 2026Divakar Kumar Yadav, Tian Zhao, Deepak KumarEfficient Transformer InferenceGPU Kernel Optimization

  10. UCCL-Zip: Lossless Compression Supercharged GPU Communication

    Apr 19, 2026Shuang Ma, Chon Lam Lao, Zhiying Xu +8GPU Kernel OptimizationGPU Acceleration

  11. AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

    Apr 17, 2026Weihua Du, Jingming Zhuo, Yixin Dong +9Test-Time AdaptationGPU Kernel Optimization

  12. A Fully GPU-Accelerated Framework for High-Performance Configuration Interaction Selection with Neural Network Quantum States

    Apr 17, 2026Daran Sun, Bowen Kan, Haoquan Long +13GPU Kernel OptimizationGPU Acceleration

  13. Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

    Apr 16, 2026Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky +5GPU Kernel OptimizationGPU Acceleration

  14. Prism: Symbolic Superoptimization of Tensor Programs

    Apr 16, 2026Mengdi Wu, Xiaoyu Jiang, Oded Padon +1GPU Kernel Optimization

  15. AdaSplash-2: Faster Differentiable Sparse Attention

    Apr 16, 2026Nuno Gonçalves, Hugo Pitorro, Vlad Niculae +4GPU Kernel OptimizationSelf-Attention

  16. ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

    Apr 16, 2026Haohui Mai, Xiaoyan Guo, Xiangyun Ding +7GPU Kernel OptimizationGPU Acceleration

  17. Nautilus: An Auto-Scheduling Tensor Compiler for Efficient Tiled GPU Kernels

    Apr 16, 2026Yifan Zhao, Yuchen Yang, Matei Budiu +1GPU Kernel OptimizationGPU Acceleration

  18. KernelFoundry: Hardware-aware evolutionary GPU kernel optimization

    Mar 12, 2026Nina Wiedemann, Quentin Leboutet, Michael Paulitsch +2GPU Kernel OptimizationGPU Acceleration

  19. KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

    Dec 29, 2025Gang Liao, Hongsen Qin, Ying Wang +36GPU Kernel OptimizationGPU Acceleration