GPU Kernel Optimization

GPU: Graphics Processing Unit

Momentum

14 papers in the last four weeks, up 75% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 126

All topics
CardsList
  1. Local-GS: Accelerating 3D Gaussian Splatting via Tile-Local Warp Coherence

    Jun 15, 2026Yang Luo, Yan Gong, Yongsheng Gao +33D Gaussian Splatting3DGS Acceleration

  2. From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

    Jun 15, 2026Wentao Chen, Jiace Zhu, Xing Zhe Chai +4GPU Kernel OptimizationLLM Fine-Tuning

  3. Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

    Jun 13, 2026Tao Lu, Haoyu Wang, Zonghui Wang +3LLM PruningGPU Kernel Optimization

  4. MiniMax Sparse Attention

    Jun 11, 2026Xunhao Lai, Weiqi Xu, Yufeng Yang +14GPU Kernel OptimizationLong-Context Language Modeling

  5. ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

    Jun 11, 2026Sihwa Lee, Janghwan Lee, Donghoon Yoo +4LLM QuantizationLanguage Model Decoding

  6. Performance Analysis and Optimization of 3D Generative Diffusion Models across GPU Architectures

    Jun 11, 2026Jeeho Ryoo, Yongchan Jung, Muhammad Ali Khaliq +3Medical ImagingGPU Kernel Optimization

  7. Toward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search

    Jun 8, 2026Haolin Pan, Lianghong Huang, Xvlin Zhou +2GPU Kernel OptimizationLatent World Models

  8. Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads

    Jun 8, 2026Minyu Cui, Miquel PericasGPU Kernel OptimizationCommunication-Efficient Distributed Training

  9. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

    Jun 7, 2026Hong Guo, Nianhui Guo, Weixing Wang +3LLM QuantizationGPU Kernel Optimization

  10. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels

    Jun 5, 2026Lenore Mullin, Gaetan HainsGPU Kernel OptimizationEnergy-Efficient ML

  11. KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

    Jun 1, 2026Taras Sereda, Burak Bartan, Ankita Nayak +3AI Accelerator InferenceGPU Kernel Optimization

  12. Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

    May 30, 2026Yitong Jiang, Hongjun Wang, Collin McCarthy +15GPU Kernel OptimizationVision Foundation Models

  13. On Efficient Scaling of GNNs via IO-Aware Layers Implementations

    May 29, 2026Daria Fomina, Daniil Krasylnikov, Alexey Boykov +3Graph Attention NetworksGPU Kernel Optimization

  14. GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization

    May 29, 2026Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho +2Neural Surrogate ModelingGPU Kernel Optimization

  15. Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

    May 29, 2026Aditya K Kamath, Arvind Krishnamurthy, Marco Canini +1Efficient Neural Network InferenceGPU Kernel Optimization

  16. Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering

    May 28, 2026Emil Martens, Aaron Miller, Matias Varnum +1Bundle AdjustmentGPU Kernel Optimization

  17. HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

    May 28, 2026Yining Zhang, Mingyang Yi, Chen Wang +5GPU Kernel OptimizationMemory-Augmented Language Models

  18. KLineage: Recovering the Missing When of Kernel Optimization by Deoptimizing Experts

    May 27, 2026Shuoming Zhang, Qiuchu Yu, Ruiyuan Xu +11GPU Kernel OptimizationGPU Acceleration

  19. Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

    May 26, 2026Yee Hin Chong, Jiaming Wu, Youhui Zhang +1GPU Kernel OptimizationLLM Agent Evaluation

  20. Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization

    May 25, 2026Mengfan Liu, Da Zheng, Junwei Su +1GPU Kernel OptimizationLarge Language Model-Guided Optimization

  21. FastKernels: Benchmarking GPU Kernel Generation in Production

    May 22, 2026Gabriele Oliaro, Yichao Fu, May Jiang +5GPU Kernel OptimizationGPU Acceleration

  22. From Sequential Nodes to GPU Batches: Parallel Branch and Bound for Optimal kk-Sparse GLMs

    May 21, 2026Jiachang Liu, Andrea LodiBranch and BoundGPU Kernel Optimization

  23. Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization

    May 19, 2026Dmitry Redko, Albert Fazlyev, Konstantin Sozykin +3GPU Kernel OptimizationLarge Language Model-Guided Optimization