Graphics Processing Unit Architectures

Latest papers 22

All topics
CardsList
  1. Dynamic Flow, Static Graph: KV Cache Reuse for Efficient LLM Serving on Mobile NPUs

    Sep 28, 2026Zhengxiang Huang, Shengheng Chen, Chaoyue Niu +6Kv-Cache ManagementNeural Processing Units

  2. Accelerating the Mitigation of LLM Inference Nondeterminism Across GPU Architectures

    Sep 22, 2026Liam Cooper, Shinnung Jeong, Hyeran Jeon +2LLM Inference OptimizationFloating-Point

  3. Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs

    Sep 11, 2026Joseph Kanichai, Tiziano De Matteis, Animesh TrivediKv-Cache ManagementKey-Value Cache

  4. PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

    Aug 18, 2026Genghan Zhang, Yixin Dong, Chengze Fan +4Graphics Processing Unit KernelsGraphics Processing Unit Architectures

  5. Learning to Rank Tensor Network Contraction Plans for GPU-Accelerated Quantum Circuit Simulation

    Aug 6, 2026Alfred M. Pastor, Maribel Castillo, Jose M. BadiaTensor NetworksQuantum Circuits

  6. Accelerating Dynamic Graph Clustering on GPU Architectures with cuGraph

    Aug 4, 2026Nelson Aloysio Reis de Almeida Passos, Emanuele Carlini, Salvatore TraniCommunity DetectionTemporal Graph Neural Networks

  7. From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

    Jul 29, 2026Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis +5LLM Inference OptimizationEnergy Consumption

  8. Rendering 3D Gaussians on a Graph Processor

    Jul 17, 2026Nicholas Fry, Ignacio Alzugaray, Mark Pupilli +23D GaussianGraphics Processing Unit Architectures

  9. Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

    Jul 14, 2026Xi Cheng, Ke Liu, Siyuan Feng +2Wireless Foundation ModelsFoundation Model

  10. Microcosmos: Reimagining Artificial Life for the GPU Era

    Jul 3, 2026Mark Tensen, Ciaran Regan, Bert Wang-Chak Chan +3Physics SimulationEvolutionary Optimization Methods

  11. WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

    Jul 2, 2026Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezGraphics Processing Unit ArchitecturesLLM Inference Optimization

  12. Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

    Jun 17, 2026Ruiqi Lai, Dakai An, Wei Gao +6Diffusion-Based Reinforcement Learning MethodsReinforcement Learning Post-Training

  13. ASTRA-sim 3.0: Next-Level Distributed Machine Learning Simulations via High-Fidelity GPU and Infrastructure Modeling

    Jun 9, 2026William Won, Jinsun Yoo, Tuan Ta +16Graphics Processing Unit ArchitecturesHardware Efficiency

  14. The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution

    May 26, 2026Deepak Panigrahy, Aakash TyagiNvidiaGraphics Processing Unit Architectures

  15. PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

    May 20, 2026Can Hankendi, Rana Shahout, Minlan Yu +1LLM Inference OptimizationGraphics Processing Unit Architectures

  16. Efficient Training on Multiple Consumer GPUs with RoundPipe

    Apr 29, 2026Yibin Luo, Shiwei Gao, Huichuan Zheng +2Cpu-Gpu Hybrid DesignsGraphics Processing Unit Architectures

  17. Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

    Apr 25, 2026Divakar Kumar Yadav, Tian Zhao, Deepak KumarCudaGraphics Processing Unit Architectures

  18. FastTrack: GPU-Accelerated Tracking for Visual SLAM

    Sep 13, 2025Kimia Khabiri, Parsa Hosseininejad, Shishir Gopinath +2Orb-Slam2Simultaneous Localization And Mapping