Cuda

Momentum

7 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 56

All topics
CardsList
  1. AI as a Compiler: Compiling Triton kernels without the Triton compiler

    Sep 29, 2026François Costa, Charly Castes, Thomas Bourgeat +1CudaCode Optimization

  2. Hardware-Aware Features for CUTLASS Kernel Selection

    Sep 28, 2026Shriram Chandran, Dominic Rinderer, Yakup Budanaz +3CudaHardware-Aware

  3. E3J: An Efficient and Open-Source Backend for Euclidean Equivariant Operations on GPU and TPU

    Sep 28, 2026Olivier Peltre, Armand Picard, Adrien Pichard +6Rotation EquivarianceCuda

  4. GTR: Gated Token Recurrence for Efficient Dense Prediction

    Sep 22, 2026Zhe Feng, Longfei Liu, Wei Liu +7Dense PredictionSelf-Supervised Vision Transformers

  5. The Output-Space Hypothesis: Enumerative Equivalence Checking for Tensor Programs

    Sep 17, 2026Paul Biberstein, Joseph Devietti, Mayur NaikCudaBug

  6. AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization

    Sep 14, 2026Ji Liu, Saptarshi Majumder, Yiqing Huang +14CudaPytorch

  7. Efficient Constant Optimization for Symbolic Regression with GPU-Accelerated Tree-Based Genetic Programming

    Sep 3, 2026Hao Mao, Xu Tony Liu, Shuai Lu +3Symbolic RegressionGenetic Algorithms

  8. RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

    Aug 12, 2026Jinjun Huang, Zhongzhen Wen, Tongtong Xu +3CudaLarge Language Model Benchmarks

  9. SparseDitto: An Agentic Sparse Compilation Framework through Architecture-Aware Synthesis on GPUs

    Aug 5, 2026Shiyang Li, Guangyan Sun, Jinwei Tang +3Graphics Processing Unit KernelsCuda

  10. Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs

    Jul 25, 2026Zhihao Xu, Hao Zhong, Zeting Zhou +9Cpu-Gpu Hybrid DesignsCuda

  11. Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization

    Jul 25, 2026Dongjie Chen, Ping Zhao, Bohua Zhan +11Graphics Processing Unit KernelsCuda

  12. Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

    Jul 23, 2026Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali JannesariCudaCode Optimization

  13. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4Graphics Processing Unit KernelsCuda

  14. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsMatrix MultiplicationTransformer Attention

  15. A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

    Jul 16, 2026A. C. Opus, J. Q. LuNvidiaCuda

  16. CodeJeNN: A simple C++ neural network generator for physics applications

    Jul 2, 2026Jay Arcities, Pavel Popov, Eric J Ching +2CudaIntegrated C++ Development

  17. GPU Parallelization Strategies for Forward and Backward Propagation in Shallow Neural Networks: A CUDA-Based Comparative Study

    Jun 29, 2026Rania Zitouni, Nadine Bousdjira, Sarah Hasnaoui +2CudaCpu-Gpu Hybrid Designs

  18. Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

    Jun 24, 2026Jiading Gai, Shuai Zhang, Kaj Bostrom +6Graphics Processing Unit KernelsCuda

  19. BluTrain: A C++/CUDA Framework for AI Systems

    Jun 23, 2026Adhitya Charan, Adwaid Suresh, Anuj Kumar +19CudaDeep Learning

  20. From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

    Jun 15, 2026Wentao Chen, Jiace Zhu, Xing Zhe Chai +4CudaGraphics Processing Unit Kernels

  21. ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

    Jun 11, 2026Sihwa Lee, Janghwan Lee, Donghoon Yoo +4Fp8Autoregressive Decoding

  22. A Scalable PyTorch Abstraction for Multi-GPU Gaussian Splatting

    Jun 9, 2026Matthew Cong, Francis Williams, Jonathan Swartz +3Cpu-Gpu Hybrid DesignsNeural Reconstruction

  23. Express Language Modeling

    Jun 9, 2026Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi +1Language ModelingCausal Attention

  24. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

    Jun 4, 2026Xuanzhe Li, Ziyan Weng, Zhiyu Zhu +1CudaPytorch

  25. Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

    May 30, 2026Yitong Jiang, Hongjun Wang, Collin McCarthy +15Vision EncodersLinear Attention

  26. Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering

    May 28, 2026Emil Martens, Aaron Miller, Matias Varnum +1CudaSymbol-

  27. CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control

    May 27, 2026Antoonio Buo, Vittorio Cammarota, Michele Avagnale +3Model Predictive ControlSoft Actor-Critic

  28. Accelerating Birkhoff Projection for Manifold-Constrained Hyper-Connections

    May 26, 2026Chenrui Wang, Yixuan QiuSolver IterationsProjection

  29. Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

    May 26, 2026Yee Hin Chong, Jiaming Wu, Youhui Zhang +1Large Language Model PlanningCuda

  30. RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models

    May 26, 2026Xing Cong, Hanlin Tang, Kan Liu +3Diffusion TransformersDiffusion Models

  31. Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization

    May 19, 2026Dmitry Redko, Albert Fazlyev, Konstantin Sozykin +3Code OptimizationCuda

  32. The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

    May 19, 2026David Pape, Jonathan Evertz, Lea SchönherrLarge Language Model BenchmarksLLM Inference Optimization

  33. Lightweight Gaussian Process Inference in C++ on Metal and CUDA

    May 18, 2026Yu-Hsueh FangGaussian ProcessCpu-Gpu Hybrid Designs

  34. PySIFT: GPU-Resident Deterministic SIFT for Deep Learning Vision Pipelines

    May 18, 2026Sivakumar K. S., Mohammad Daniyalur Rahman, Gopi Raju MattaHarder Better Faster Denser Feature MatchingKeypoint Detection

  35. CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

    May 8, 2026Shiyang Li, Zijian Zhang, Guangyan Sun +5CudaCode Optimization

  36. CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

    May 8, 2026Shiyang Li, Haoyang Chen, Mattia Fazzini +1Model DebuggingCuda

  37. CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels

    May 6, 2026Xing Ma, Yangjie Zhou, Wu Sun +6Cuda

  38. VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU

    May 2, 2026Bin Xu, Pengfei Hu, Wenxin Zheng +2Cpu-Gpu Hybrid DesignsCuda

  39. PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

    Apr 27, 2026Laurenz Reichardt, Nikolas Ebert, Oliver WasenmüllerPoint Clouds3D Perception

  40. Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

    Apr 25, 2026Divakar Kumar Yadav, Tian ZhaoLLM Inference OptimizationInference Latency

  41. Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

    Apr 25, 2026Divakar Kumar Yadav, Tian Zhao, Deepak KumarCudaGraphics Processing Unit Architectures

  42. Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

    Apr 21, 2026Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan +3Automatic Speech RecognitionStreaming

  43. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4Efficient Long-Context InferenceLarge Language Model Decoding

  44. Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

    Apr 16, 2026Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky +5Graphics Processing Unit KernelsCuda

  45. CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

    Jul 18, 2025Xiaoya Li, Albert Wang, Guoyin Wang +2Cuda