GPU Kernel Optimization

GPU: Graphics Processing Unit

Momentum

14 papers in the last four weeks, up 75% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 126

All topics
CardsList
  1. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaGPU Kernel OptimizationLLM Inference

  2. X-Stage: Modeling Post-Issue Backpressure in GPU Communication--Computation Fusion

    Jul 25, 2026Jianwen Xian, Zhiyuan Xu, Yuchen Li +9GPU Kernel Optimization

  3. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariRL for Code GenerationGPU Kernel Optimization

  4. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4GPU Kernel OptimizationBenchmark Design

  5. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsEfficient Transformer InferenceGrouped-Query Attention

  6. Sobek: Streaming Equivariant Tensor Product Convolutions

    Jul 20, 2026Vladimir Chorošajev, Cédric BényGPU Kernel OptimizationGPU Acceleration

  7. FlashPDE: A Drop-In Fused Triton Operator Library for Neural PDE Solvers

    Jul 20, 2026Peiyu Zang, Bosen Xie, Ruoxiang Xu +1Automatic DifferentiationNeural PDE Solvers

  8. A Hardware-oriented Approach for Efficient Bayesian Inference Computation and Deployment

    Jul 20, 2026Nikola Pižurica, Matteo Risso, Nikola Milović +4GPU Kernel OptimizationBayesian Inference

  9. CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

    Jul 20, 2026Tingjia Zhang, Bo Chen, Shengzhong Liu +23D Gaussian Splatting3DGS Acceleration

  10. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuEfficient Transformer InferenceGPU Kernel Optimization

  11. WarpMPC: Large-Batch MPC on GPU via ADMM with Unrolled LDL⊤LDL^\top Factorization

    Jul 13, 2026Henrik Hose, Se Hwan Jeon, Charles Khazoom +2GPU Kernel OptimizationGPU Acceleration

  12. LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

    Jul 13, 2026Ziqi Yin, Jianyang Gao, Peiqi Yin +2GPU Kernel OptimizationLLM Inference Acceleration

  13. FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness

    Jul 11, 2026Shunsuke Yokokawa, Hironori KasaharaGPU Kernel OptimizationAutonomous Driving Perception

  14. FlashTrie: A GPU-Accelerated Constrained Beam Search for Generative Retrieval

    Jul 10, 2026Dakshitha Anandakumar, Anurag Mukkara, Wenxiang Hu +5Constrained DecodingGPU Kernel Optimization

  15. CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems

    Jul 8, 2026Tingkai Liu, Muralidhar Andoorveedu, Sanjoy Das +2GPU Kernel OptimizationHigh-Performance Computing

  16. FAST: A Holistic Framework for Optimizing Memory-I/O, Computation, and Sampling in Temporal GNN Training

    Jul 6, 2026Yushu Cai, Qingrui Zhu, Lei Liu +3Temporal GNNsGraph Neural Networks

  17. WBMM: Windowed Batch Matrix Multiplication for Efficient Large Receptive Field Convolution

    Jul 2, 2026Wan Song, Wei Zhou, Rui Wang +4GPU Kernel OptimizationConvolutional Neural Networks

  18. GPU Parallelization Strategies for Forward and Backward Propagation in Shallow Neural Networks: A CUDA-Based Comparative Study

    Jun 29, 2026Rania Zitouni, Nadine Bousdjira, Sarah Hasnaoui +2GPU Kernel OptimizationGPU Acceleration

  19. EGG: An Expert-Guided Agent Framework for Kernel Generation

    Jun 25, 2026Yaochen Han, Ke Fan, Hongxu Jiang +5GPU Kernel OptimizationLarge Language Model-Guided Optimization

  20. StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

    Jun 18, 2026Guangda Liu, Yiquan Wang, Chengwei Li +6GPU Kernel OptimizationKnowledge Distillation