GPU Kernel Optimization

GPU: Graphics Processing Unit

Momentum

14 papers in the last four weeks, up 75% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 126

All topics
CardsList
  1. QUILT: Rethinking Sparse-Attention Prefill through Shared Query Execution

    Oct 8, 2026Zhenduo Zhao, Qihui Zhou, Mingcong Song +7LLM Inference AccelerationSparse Attention

  2. FlashCart: Fast Cartesian Tensor Products for Equivariant Interatomic Potentials

    Oct 5, 2026Viktor Zaverkin, Payman Goodarzi, Sergey V. Sukhomlinov +4Machine Learning Interatomic PotentialsGPU Kernel Optimization

  3. TurboPairFormer: Fast and Stable Protein Folding Model Training with an Optimized Triangle Attention Kernel

    Oct 5, 2026Yide Ran, Chelsea Lowman, Jan Domański +6Protein Structure PredictionGPU Kernel Optimization

  4. MetaKernelBench: Measuring GPU Kernel Knowledge Transfer Beyond Code

    Oct 4, 2026Xueyi Chen, Shiyu Liu, Xin Jin +5GPU Kernel OptimizationAI Agent Benchmarks

  5. AI as a Compiler: Compiling Triton kernels without the Triton compiler

    Sep 29, 2026François Costa, Charly Castes, Thomas Bourgeat +1GPU Kernel OptimizationLarge Language Model-Guided Optimization

  6. Hardware-Aware Features for CUTLASS Kernel Selection

    Sep 28, 2026Shriram Chandran, Dominic Rinderer, Yakup Budanaz +3GPU Kernel OptimizationLearning to Rank

  7. Sol-H3: Recursive Self-Improvement for MiniMax-H3 Inference Acceleration on Sol-Engine across Cloud and Edge

    Sep 28, 2026Yitong Li, Jincheng Yu, Junsong Chen +6Video Diffusion ModelsGPU Kernel Optimization

  8. Towards Certificate-Driven Software Porting: A Self-Improving Agentic Harness for Scientific Program Optimization

    Sep 28, 2026Piyush Jha, Aishik Ghosh, Vijay GaneshCode TranslationGPU Kernel Optimization

  9. Validating Memory-Optimal Transformer Kernels on Real Hardware: From Formal Derivation to Measured Performance Across Two HPC Clusters

    Sep 27, 2026Lenore M. Mullin, Gaetan HainsGPU Kernel OptimizationHigh-Performance Computing

  10. Accelerating the Mitigation of LLM Inference Nondeterminism Across GPU Architectures

    Sep 22, 2026Liam Cooper, Shinnung Jeong, Hyeran Jeon +2GPU Kernel OptimizationLLM Inference Acceleration

  11. Accelerated Decoding of Centroid Positional Encoding for Instance Segmentation

    Sep 15, 2026Carmelo Scribano, Filippo Muzzini, Nedyalko Prisadnikov +6Efficient InferenceGPU Kernel Optimization

  12. GPU-CFR: 80x Faster Counterfactual Regret Minimization by Compiling the Game to Static Dataflow and CUDA Graph Replay

    Sep 12, 2026Boning Li, Longbo HuangGPU Kernel OptimizationGPU Acceleration

  13. PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

    Aug 18, 2026Genghan Zhang, Yixin Dong, Chengze Fan +4LLM EvaluationGPU Kernel Optimization

  14. CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

    Aug 12, 2026Zihao Ye, Yingyi Huang, Hongyi Jin +11GPU Kernel OptimizationGPU Kernel Generation

  15. Dion3: Full-Stack Orthogonal Updates

    Aug 12, 2026Noah Amsel, Jack Zhang, Kwangjun Ahn +5Newton-Schulz IterationGPU Kernel Optimization

  16. Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation

    Aug 11, 2026Amit Aflalo, Shahaf E. Finder, Roy Amoyal +2GPU Kernel OptimizationWavelet Methods

  17. Hand-Written PTX Tensor-Core GEMM Kernels: A Multi-Precision Study on NVIDIA L4

    Aug 10, 2026Matt J. Borowski, Blazej OsinskiGPU Kernel Optimization

  18. SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

    Aug 10, 2026Gyudong Kim, Wonjun Han, Young Geun KimGPU Kernel OptimizationTensor Parallelism

  19. Scalable High-Fidelity Macromolecular Docking for GPU-Accelerated Supercomputers

    Aug 7, 2026Xiangyu Meng, Peng Chen, Mingzhen Li +7GPU Kernel OptimizationGPU Acceleration

  20. SparseDitto: An Agentic Sparse Compilation Framework through Architecture-Aware Synthesis on GPUs

    Aug 5, 2026Shiyang Li, Guangyan Sun, Jinwei Tang +3GPU Kernel OptimizationHigh-Performance Computing

  21. CUDA MPC: A GPU-Native Solver for Model Predictive Control

    Aug 4, 2026Babak Akbari, Melissa GreeffGPU Kernel OptimizationGPU Acceleration