GPU Acceleration

GPU: Graphics Processing Unit

Latest papers 125

All topics
CardsList
  1. Mixed-Precision Communication-Avoiding SGD for Generalized Linear Models on GPUs

    Jun 16, 2026Aditya Devarakonda, Irene Simó Muñoz, Giulia GuidiGPU AccelerationCommunication-Efficient Distributed Training

  2. Local-GS: Accelerating 3D Gaussian Splatting via Tile-Local Warp Coherence

    Jun 15, 2026Yang Luo, Yan Gong, Yongsheng Gao +33D Gaussian Splatting3DGS Acceleration

  3. A Scalable PyTorch Abstraction for Multi-GPU Gaussian Splatting

    Jun 9, 2026Matthew Cong, Francis Williams, Jonathan Swartz +33D Gaussian SplattingGPU Acceleration

  4. TorchKM: A GPU-Oriented Library for Kernel Learning and Model Selection

    Jun 4, 2026Yikai Zhang, Gaoxiang Jia, Jie Ding +1Model SelectionKernel Regression

  5. Accelerated Fourier SAT (AFSAT): Fully Realising a GPU-based Symmetric Pseudo-Boolean SAT Solver

    Jun 4, 2026Cody J Christopher, Charles GrettonGPU AccelerationHigh-Performance Computing

  6. RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning

    Jun 4, 2026Ziyang Yu, Xiang Li, Qiong Chang +1GPU AccelerationPoint Cloud Learning

  7. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

    Jun 4, 2026Xuanzhe Li, Ziyan Weng, Zhiyu Zhu +1Efficient Transformer InferenceGPU Acceleration

  8. GS-NFS: Bandwidth-adaptive Streaming of Dynamic Gaussian Splats and Point Clouds

    Jun 4, 2026Rajrup Ghosh, Haodong Wang, Haoran Hong +63DGS Compression3D Gaussian Splatting

  9. MelT: A Portable, Single-GEMM Mel Audio Frontend via Non-Uniform DFT with Measured Latency and Energy Gains on GPUs

    May 31, 2026Augusto Camargo, Marcelo FingerGPU AccelerationSpeech Processing

  10. Threshold-Based Exclusive Batching for LLM Inference

    May 30, 2026Weifang Zhang, Yuzhou Nie, Bowen Pang +2GPU AccelerationLLM Inference

  11. On Efficient Scaling of GNNs via IO-Aware Layers Implementations

    May 29, 2026Daria Fomina, Daniil Krasylnikov, Alexey Boykov +3Graph Attention NetworksGPU Kernel Optimization

  12. GP-GOMEA with GPU-Based Fitness Evaluations: Design and Performance Analysis

    May 29, 2026Jasper Post, Johannes Koch, Anton Bouter +2GPU AccelerationEvolutionary Optimization

  13. Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering

    May 28, 2026Emil Martens, Aaron Miller, Matias Varnum +1Bundle AdjustmentGPU Kernel Optimization

  14. HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

    May 28, 2026Yining Zhang, Mingyang Yi, Chen Wang +5GPU Kernel OptimizationMemory-Augmented Language Models

  15. CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control

    May 27, 2026Antoonio Buo, Vittorio Cammarota, Michele Avagnale +3GPU AccelerationModel Predictive Control

  16. KLineage: Recovering the Missing When of Kernel Optimization by Deoptimizing Experts

    May 27, 2026Shuoming Zhang, Qiuchu Yu, Ruiyuan Xu +11GPU Kernel OptimizationGPU Acceleration

  17. FastKernels: Benchmarking GPU Kernel Generation in Production

    May 22, 2026Gabriele Oliaro, Yichao Fu, May Jiang +5GPU Kernel OptimizationGPU Acceleration

  18. ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU

    May 21, 2026Aman Sunesh, Ali Alshehhi, Hivansh DhakneLLM Inference EfficiencyLLM Serving

  19. From Sequential Nodes to GPU Batches: Parallel Branch and Bound for Optimal kk-Sparse GLMs

    May 21, 2026Jiachang Liu, Andrea LodiBranch and BoundGPU Kernel Optimization

  20. Instant GPU Efficiency Visibility at Fleet Scale

    May 20, 2026Connor Pedersen, Dong H. Ahn, Michel Migdal +2GPU AccelerationHigh-Performance Computing

  21. Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

    May 20, 2026Reese Levine, Rithik Sharma, Nikhil Jain +5GPU AccelerationLLM Inference

  22. Real-Time Parallel Counterfactual Regret Minimization

    May 19, 2026Boning Li, Longbo HuangGame-Playing AgentsGPU Acceleration

  23. CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

    May 19, 2026Han Guo, Jack Zhang, Arjun Menon +4GPU Kernel OptimizationGPU Acceleration

  24. Lightweight Gaussian Process Inference in C++ on Metal and CUDA

    May 18, 2026Yu-Hsueh FangGPU Kernel OptimizationGPU Acceleration