Graphics Processing Unit Kernels

Latest papers 51

All topics
CardsList
  1. RESOLVE: Language-Agnostic Validation of GPU Kernels Through Testing, Reduction, and Proof

    Oct 5, 2026Ashkan Vedadi Gargary, Guido Martínez, Sebastian Burckhardt +4Graphics Processing Unit Kernels

  2. MetaKernelBench: Measuring GPU Kernel Knowledge Transfer Beyond Code

    Oct 4, 2026Xueyi Chen, Shiyu Liu, Xin Jin +5Graphics Processing Unit Kernels

  3. Accelerated Decoding of Centroid Positional Encoding for Instance Segmentation

    Sep 15, 2026Carmelo Scribano, Filippo Muzzini, Nedyalko Prisadnikov +6Intermediate Decoder LayersPositional Encoding

  4. Dream-RSI: Recursive Self-Improvement through Evolving Worlds

    Sep 14, 2026Tong Zheng, Xidong Wu, Zheng Zhang +14Stochastic ExplorationSelf-Improving Agents

  5. MaxKernel: Agentic Kernel Generation for TPUs

    Sep 7, 2026Shangkun Wang, Nina Cai, Charles Hoong +7Graphics Processing Unit KernelsGenerators

  6. CacheBridge: Efficient Cross-Model KV Cache Transfer

    Sep 1, 2026Xingyu Qu, Siyuan Lu, Zhiyu Chen +2BridgeGraphics Processing Unit Kernels

  7. PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

    Aug 18, 2026Genghan Zhang, Yixin Dong, Chengze Fan +4Graphics Processing Unit KernelsGraphics Processing Unit Architectures

  8. CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

    Aug 12, 2026Zihao Ye, Yingyi Huang, Hongyi Jin +11Graphics Processing Unit KernelsNvidia

  9. SparseDitto: An Agentic Sparse Compilation Framework through Architecture-Aware Synthesis on GPUs

    Aug 5, 2026Shiyang Li, Guangyan Sun, Jinwei Tang +3Graphics Processing Unit KernelsCuda

  10. Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference

    Aug 2, 2026Ruokai Yin, Priyadarshini PandaLLM Inference OptimizationDynamic Sparse Attention

  11. X-Stage: Modeling Post-Issue Backpressure in GPU Communication--Computation Fusion

    Jul 25, 2026Jianwen Xian, Zhiyuan Xu, Yuchen Li +9Cpu-Gpu Hybrid DesignsGraphics Processing Unit Kernels

  12. Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization

    Jul 25, 2026Dongjie Chen, Ping Zhao, Bohua Zhan +11Graphics Processing Unit KernelsCuda

  13. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4Graphics Processing Unit KernelsCuda

  14. Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation

    Jul 2, 2026Junyi Wen, Ruiyan Zhuang, Yongjia Xu +7Graphics Processing Unit KernelsNeural Processing Units

  15. Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

    Jun 27, 2026Young-Jun Lee, Seungone Kim, Minki Kang +5Evolutionary SearchContinual Fine-Tuning

  16. Active Quantum Kernel Acquisition for Gaussian Process Regression

    Jun 27, 2026Jian Xu, Artur Miroszewski, John Paisley +2Quantum KernelsGaussian Process

  17. Hierarchical Muon: Tiled Newton-Schulz Updates for Efficient Muon Optimization

    Jun 25, 2026Ziyuan Tang, Tianshi Xu, Yousef Saad +1MuonNewton

  18. EGG: An Expert-Guided Agent Framework for Kernel Generation

    Jun 25, 2026Yaochen Han, Ke Fan, Hongxu Jiang +5Graphics Processing Unit KernelsAgentic Optimization

  19. Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

    Jun 24, 2026Jiading Gai, Shuai Zhang, Kaj Bostrom +6Graphics Processing Unit KernelsCuda

  20. StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

    Jun 18, 2026Guangda Liu, Yiquan Wang, Chengwei Li +6Dataset DistillationKullback-Leibler Divergence

  21. From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

    Jun 15, 2026Wentao Chen, Jiace Zhu, Xing Zhe Chai +4CudaGraphics Processing Unit Kernels

  22. KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

    Jun 1, 2026Taras Sereda, Burak Bartan, Ankita Nayak +3Graphics Processing Unit KernelsForge

  23. On Efficient Scaling of GNNs via IO-Aware Layers Implementations

    May 29, 2026Daria Fomina, Daniil Krasylnikov, Alexey Boykov +3Graph Neural NetworksGraphics Processing Unit Kernels

  24. GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization

    May 29, 2026Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho +2Graphics Processing Unit KernelsLLM Inference Optimization

  25. Veda: Scalable Video Diffusion via Distilled Sparse Attention

    May 28, 2026Shihao Han, Hao Yang, Xinting Hu +3Video Diffusion ModelsDynamic Sparse Attention

  26. KLineage: Recovering the Missing When of Kernel Optimization by Deoptimizing Experts

    May 27, 2026Shuoming Zhang, Qiuchu Yu, Ruiyuan Xu +11Graphics Processing Unit KernelsCode Optimization

  27. FastKernels: Benchmarking GPU Kernel Generation in Production

    May 22, 2026Gabriele Oliaro, Yichao Fu, May Jiang +5Graphics Processing Unit Kernels

  28. CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

    May 19, 2026Han Guo, Jack Zhang, Arjun Menon +4Graphics Processing Unit KernelsMatrix Multiplication

  29. Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization

    May 18, 2026Taeyoung Yun, Woocheol Shin, Inhyuck Song +2Bayesian OptimizationGaussian Process

  30. Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

    May 8, 2026Zixuan Huang, Da Chen, Kecheng Huang +5Graphics Processing Unit KernelsCode Optimization

  31. Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

    Apr 16, 2026Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky +5Graphics Processing Unit KernelsCuda

  32. ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

    Apr 16, 2026Haohui Mai, Xiaoyan Guo, Xiangyun Ding +7Graphics Processing Unit KernelsAgentic Optimization

  33. Nautilus: An Auto-Scheduling Tensor Compiler for Efficient Tiled GPU Kernels

    Apr 16, 2026Yifan Zhao, Yuchen Yang, Matei Budiu +1Graphics Processing Unit KernelsCode Optimization

  34. KernelFoundry: Hardware-aware evolutionary GPU kernel optimization

    Mar 12, 2026Nina Wiedemann, Quentin Leboutet, Michael Paulitsch +2Graphics Processing Unit KernelsHardware-Aware

  35. kAgent: An execution-guided crash resolution agent for the Linux kernel

    Apr 29, 2025Alex Mathai, Chenxi Huang, Suwei Ma +7CrashesSoftware

  36. InferNet: Exploiting Aggregate GPU Profiles as Side-Channel for DNN Architecture Inference

    Apr 6, 2023Raja Hasnain Anwar, Jonah O'Brien Weiss, Tiago Alves +1Neural Network InferenceDeep Learning Architectures