Graphics Processing Unit Resources

Latest papers 30

All topics
CardsList
  1. Towards Certificate-Driven Software Porting: A Self-Improving Agentic Harness for Scientific Program Optimization

    Sep 28, 2026Piyush Jha, Aishik Ghosh, Vijay GaneshEvolutionary SearchCode Optimization

  2. Validating Memory-Optimal Transformer Kernels on Real Hardware: From Formal Derivation to Measured Performance Across Two HPC Clusters

    Sep 27, 2026Lenore M. Mullin, Gaetan HainsGraphics Processing Unit ResourcesHigh-Performance Computing

  3. ASCEND: Personal AI Agents for Autonomous Scientific Computing Across HPC Clusters and GPU Workstations

    Sep 26, 2026J. Paul Liu, Uthpala Herath, Andrew PetersenHigh-Performance ComputingArtificial Intelligence Scientists

  4. A principled approach for energy-efficient training via phase-aware GPU frequency tuning

    Sep 21, 2026Miguel Braga, Júlio Pinto, Rahma Nouaji +5Energy-EfficientGraphics Processing Unit Resources

  5. Dissecting GPU Utilization for LLM Inference on Nvidia Hopper

    Sep 14, 2026Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic +1Graphics Processing Unit ResourcesLLM Inference Optimization

  6. LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference

    Sep 2, 2026Renyuan Liu, Yuyang Leng, Kaiyan Liu +7LLM Inference OptimizationStreaming

  7. MeshSplatBench: A Unified Benchmark for Triangle- and Mesh-Based Neural Rendering

    Sep 1, 2026Kaixuan Zhang, Minxian Li, Mingwu Ren +1Neural RenderingGraphics Processing Unit Resources

  8. Workload Identification with Physical Side Channels for AI Governance

    Aug 31, 2026Simone Gargiulo, Gabriel KulpGraphics Processing Unit ResourcesWorkload

  9. Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

    Aug 3, 2026Cunchen Hu, Liangliang Xu, Tian Liu +9Graphics Processing Unit ResourcesRate Scaling

  10. Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search

    Jul 29, 2026Saif U Din, Muhammad Ahsan Hussain, Radu Timofte +1Large Language Model Fine-TuningNeural Architecture Search

  11. How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

    Jul 22, 2026Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy PeddireddyDestination-Only ScoringFast Inference

  12. The FIL Hypothesis: Inductive Biases Help with Kernel Engineering

    Jun 29, 2026Nikolai Rozanov, Subhabrata Dutta, Preslav Nakov +1Inductive BiasFeedback Loop

  13. Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

    Jun 23, 2026Sijie Wang, Zhengyu Qing, Zhiqiang Tan +6Diffusion-Based Reinforcement Learning MethodsDiffusion Language Models

  14. HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval

    Jun 19, 2026Omin Kwon, Doyeon Kim, Jongseok Park +3LLM Inference OptimizationDiffusion Language Models

  15. SSH-Net: A Deep Neural Network for Predicting Failure Time Distribution Functions under Competing Risks with Application to GPU Data

    Jun 18, 2026Jie Min, Yueyao Wang, Mengkun ChenTime-To-Event DataRisk

  16. Detecting Hidden ML Training With Zero-Overhead Telemetry

    Jun 17, 2026Robi Rahman, Sabiha TajdariGraphics Processing Unit ResourcesNvidia

  17. ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

    May 30, 2026Seokjin Go, Marko Scrbak, Ephrem Wu +2Mixture-Of-Expert InferenceInference Workloads

  18. GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems

    May 19, 2026Sourish Wawdhane, Avinash Kumar, Poulami DasMixture-Of-Expert InferenceMixture-Of-Experts

  19. Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

    Feb 27, 2026Ferran Agullo, Joan Oliveras, Chen Wang +5Cpu-Gpu Hybrid DesignsGraphics Processing Unit Resources

  20. TensorCommitments: A Lightweight Verifiable Inference for Language Models

    Feb 13, 2026Oguzhan Baser, Elahe Sadeghi, Eric Wang +5LLM Inference OptimizationCryptographic Merkle Tree Commitments

  21. NGD-SLAM: Towards Real-Time Dynamic SLAM without GPU

    May 12, 2024Yuhao Zhang, Mihai Bujanca, Mikel LujánOrb-Slam2Simultaneous Localization And Mapping