GPU Acceleration

GPU: Graphics Processing Unit

Latest papers 125

All topics
CardsList
  1. Efficient, VRAM-Constrained xLM Inference on Clients

    Apr 29, 2026Aditya Ukarande, Deep Shekhar, Marc Blackstein +1GPU AccelerationEfficient VLM Inference

  2. QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention

    Apr 28, 2026Sehyeon Oh, Yongin Kwon, Jemin LeeSoftmax AttentionGPU Acceleration

  3. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Efficient Transformer InferenceSoftmax Attention

  4. Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

    Apr 25, 2026Divakar Kumar Yadav, Tian Zhao, Deepak KumarEfficient Transformer InferenceGPU Kernel Optimization

  5. FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression

    Apr 22, 2026Ye Qiao, Yian Wang, Zhiheng Chen +2LLM CompressionGPU Acceleration

  6. AdaGScale: Viewpoint-Adaptive Gaussian Scaling in 3D Gaussian Splatting to Reduce Gaussian-Tile Pairs

    Apr 21, 2026Joongho Jo, Hyerin Lim, Hanjun Choi +13D Gaussian Splatting3DGS Acceleration

  7. FlashFPS: Efficient Farthest Point Sampling for Large-Scale Point Clouds via Pruning and Caching

    Apr 20, 2026Yuzhe Fu, Hancheng Ye, Cong Guo +7Efficient InferenceGPU Acceleration

  8. UCCL-Zip: Lossless Compression Supercharged GPU Communication

    Apr 19, 2026Shuang Ma, Chon Lam Lao, Zhiying Xu +8GPU Kernel OptimizationGPU Acceleration

  9. SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

    Apr 18, 2026Junnan Liu, Xinyan Liu, Peifeng Gao +4GPU AccelerationSelf-Attention

  10. A Fully GPU-Accelerated Framework for High-Performance Configuration Interaction Selection with Neural Network Quantum States

    Apr 17, 2026Daran Sun, Bowen Kan, Haoquan Long +13GPU Kernel OptimizationGPU Acceleration

  11. Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

    Apr 16, 2026Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky +5GPU Kernel OptimizationGPU Acceleration

  12. ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

    Apr 16, 2026Haohui Mai, Xiaoyan Guo, Xiangyun Ding +7GPU Kernel OptimizationGPU Acceleration

  13. Dispatch-Aware Ragged Attention for Pruned Vision Transformers

    Apr 16, 2026Seifeldin Abdellatif, Ahmad AlmasriEfficient Transformer InferenceVisual Attention

  14. Nautilus: An Auto-Scheduling Tensor Compiler for Efficient Tiled GPU Kernels

    Apr 16, 2026Yifan Zhao, Yuchen Yang, Matei Budiu +1GPU Kernel OptimizationGPU Acceleration

  15. DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance

    Apr 16, 2026Kathiravan PalaniappanAI Accelerator InferenceGPU Acceleration

  16. Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

    Apr 11, 2026Tiancheng Hu, Jin Qin, Zheng Wang +10GPU AccelerationLLM Inference Acceleration

  17. SMART: When is it Actually Worth Expanding a Speculative Tree?

    Apr 9, 2026Lifu Wang, Pan ZhouInference-Time OptimizationGPU Acceleration

  18. KernelFoundry: Hardware-aware evolutionary GPU kernel optimization

    Mar 12, 2026Nina Wiedemann, Quentin Leboutet, Michael Paulitsch +2GPU Kernel OptimizationGPU Acceleration

  19. RoboGPU: Accelerating GPU Collision Detection for Robotics

    Mar 2, 2026Lufei Liu, Liwei Xue, Yuan Hsi Chou +4GPU AccelerationRobotics

  20. DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers

    Feb 2, 2026Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis +2Deep Learning OptimizationGPU Acceleration

  21. KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

    Dec 29, 2025Gang Liao, Hongsen Qin, Ying Wang +36GPU Kernel OptimizationGPU Acceleration

  22. Block Sparse Flash Attention

    Dec 7, 2025Daniel Ohayon, Itay Lamprecht, Itay Hubara +3GPU AccelerationSelf-Attention

  23. NOSA: Native and Offloadable Sparse Attention

    Oct 15, 2025Yuxiang Huang, Pengjie Wang, Jicheng Han +9KV-Cache OffloadingGPU Acceleration

  24. FastTrack: GPU-Accelerated Tracking for Visual SLAM

    Sep 13, 2025Kimia Khabiri, Parsa Hosseininejad, Shishir Gopinath +2GPU AccelerationVisual SLAM

  25. FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel

    Aug 25, 2025Ran Yan, Youhe Jiang, Zhuoming Chen +3GPU Kernel OptimizationGPU Acceleration