Matrix Multiplication

Momentum

16 papers in the last four weeks, against 1 the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 80

All topics
CardsList
  1. Scalable GNN-based Knowledge Graph Representation Learning with Efficient Message Passing

    Sep 28, 2026Huu Tan Mai, Cuong Xuan Chu, Heiko Paulheim +1Graph Neural NetworksKnowledge Graph Embeddings

  2. Look Before You Select: Rethinking Vocabulary Sparsification in On-Policy Distillation

    Sep 28, 2026Yongliang Miao, Shuang Liu, Yanguang Liu +2Grammatical Error CorrectionMatrix Multiplication

  3. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4Large Language Model QuantizationLLM Inference Optimization

  4. Pretraining Transformers with Quantized Softmax in Attention

    Sep 27, 2026Shangzhen Zhu, Muyan Hu, Tomasz KozlowskiTransformer AttentionGumbel-Softmax Relaxation

  5. Accelerating the Mitigation of LLM Inference Nondeterminism Across GPU Architectures

    Sep 22, 2026Liam Cooper, Shinnung Jeong, Hyeran Jeon +2LLM Inference OptimizationFloating-Point

  6. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1Matrix MultiplicationAutoregressive Decoding

  7. Accurate Trace Estimation with Fewer Random Bits via Recursive TensorSketch

    Sep 16, 2026Mohammad Azhar Khan, Rameshwar Pratap, Amit SharmaMatrix MultiplicationRandom

  8. Breaking the 1.58-bit Barrier for Ternary LLMs

    Sep 14, 2026Evangelos Georganas, Alexander Heinecke, Pradeep DubeyLarge Language Model QuantizationModel Weights

  9. A Time-Based Readout for Vector-Matrix Multiplication in Fully Analog Memristive SNNs

    Sep 12, 2026Elia Mateu-Barriendos, Álvaro Gómez-Pau, Josep Rius +3Reram CrossbarSpiking Neural Networks

  10. EFQ-Softmax: Exp-Free Quantization for Softmax

    Sep 9, 2026Haohui Han, Yuming Wan, Hongni Wang +4Gumbel-Softmax RelaxationBlock Sparse Flash Attention

  11. KBBQ: A Predictive Noise Law and the Limits of Spectrum Flattening in FP4 Quantization

    Sep 8, 2026Lexington Whalen, Yuki Ito, Ryo SakamotoQuantizedQuantizer

  12. Dense Structural Compression of Transformers via Gauge-Correct Channel Removal

    Sep 7, 2026Jed A. Duersch, Naïm Es-Sebbani, Nathanaël Haas +1Data Compression MethodsTransformer Architectures

  13. Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

    Aug 13, 2026Zixuan Lan, Yanhong Li, Jiawei ZhouMatrix MultiplicationLLM Inference Optimization

  14. BaKron: Efficient Quantization with Kronecker-Factored Hessians

    Aug 6, 2026Johann Birnick, Rayan SaabHessianMatrix Multiplication

  15. RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection

    Aug 5, 2026Zian Wang, Hangchuan Liang, Yuehua Chen +4Rgb-Thermal Object DetectionInfrared

  16. MOSAIC: Masked Outsourcing of Secure AI Computations

    Jul 31, 2026James Hsin-yu Chiang, Sheila Zingg, Kari Kostiainen +1Matrix MultiplicationMosaic

  17. It's All Just Vectorization: einx, a Universal Notation for Tensor Operations

    Jul 30, 2026Florian Fervers, Sebastian Bullinger, Christoph Bodensteiner +1VectorizationTensor Networks

  18. GPTQ-2D: Cubic-Time Two-Sided Adaptive Rounding

    Jul 29, 2026Jiale Chen, Torsten Hoefler, Dan AlistarhMatrix MultiplicationGeometric Metrics

  19. MoA-Structured Decode Attention DNF Derivation, KV-Cache Accumulation, GQA/MQA, and OpenACC Kernel

    Jul 21, 2026Lenore Mulin, Gaetan HainsMatrix MultiplicationTransformer Attention

  20. Contraction-Gauge Preconditioning for Quantized Matrix Multiplication

    Jul 21, 2026Piyush Sao, Narasinga Miniskar, Pedro Valero-Lara +2Matrix MultiplicationSpectral Preconditioning

  21. Fast, Parallel, Query-Efficient Binary Classification

    Jul 5, 2026Ishani Karmarkar, Liam O'Carroll, Aaron SidfordSeparabilityHigh-Dimensional

  22. WBMM: Windowed Batch Matrix Multiplication for Efficient Large Receptive Field Convolution

    Jul 2, 2026Wan Song, Wei Zhou, Rui Wang +4Matrix MultiplicationImagenet

  23. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

    Jun 25, 2026Haoqian Meng, Yilun Luo, Yafei Zhao +4Large Language Model QuantizationLarge Language Model Compression

  24. MIVE: A Minimalist Integer Vector Engine for Softmax LayerNorm and RMSNorm Acceleration

    Jun 16, 2026Kosmas Alexandridis, Giorgos DimitrakopoulosMatrix MultiplicationBatch Normalization

  25. CacheMuon: Using Temporal Preconditioning To Approximate Polar Factor

    Jun 15, 2026Bishnu Dev, Sushil Bohara, Martin Takáč +1MuonSpectral Preconditioning

  26. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8Large Language Model QuantizationMatrix Multiplication

  27. Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

    Jun 13, 2026Tao Lu, Haoyu Wang, Zonghui Wang +3LLM Inference OptimizationMatrix Multiplication

  28. Muonp^p: Muon with Fractional Spectral Powers

    Jun 11, 2026Yihe Dong, Will SawinMuonSpectral

  29. TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

    Jun 9, 2026Wesley Pang, Gregory Hyegang Jun, Feiyang Liu +1Neural Processing UnitsMatrix Multiplication

  30. SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

    Jun 9, 2026Jaeseong Lee, Seung-won Hwang, Samyam RajbhandariSparsityLarge Language Model Compression

  31. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels

    Jun 5, 2026Lenore Mullin, Gaetan HainsMatrix MultiplicationTransformer Architectures

  32. When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

    Jun 4, 2026Luoming Zhang, Yuwei Ren, Kui Zhang +7Matrix MultiplicationKimi Delta Attention

  33. CRAM-ER: Error-Resilient Spintronic Computational Random Access Memory for Scalable In-Memory Computation

    Jun 1, 2026Sohan Salahuddin Mugdho, Md. Shahedul Hasan, Brahmdutta Dixit +3In-Memory ComputingReram Crossbar

  34. Riemannian Optimization for Hadamard Products of Low-Rank Matrices

    May 31, 2026Pratik Jawanpuria, Ankish Chandresh, Bamdev MishraRiemannian OptimizationLow-Rank Structure

  35. MelT: A Portable, Single-GEMM Mel Audio Frontend via Non-Uniform DFT with Measured Latency and Energy Gains on GPUs

    May 31, 2026Augusto Camargo, Marcelo FingerNeural AudioMatrix Multiplication

  36. Neuro-symbolic Syntactic Parsing: Shaping a Neural Network with the CYK Algorithm

    May 29, 2026Fabio Massimo Zanzotto, Federico Ranaldi, Giorgio SattaNeuro-Symbolic FrameworkContext-Free Grammars

  37. Accelerating Birkhoff Projection for Manifold-Constrained Hyper-Connections

    May 26, 2026Chenrui Wang, Yixuan QiuSolver IterationsProjection

  38. RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models

    May 26, 2026Xing Cong, Hanlin Tang, Kan Liu +3Diffusion TransformersDiffusion Models

  39. Verilog-Evolve: Feedback-Driven and Skill-Evolving Verilog Generation

    May 26, 2026Zehua Pei, Hui-Ling Zhen, Yu Zhang +3High-Level SynthesisHierarchical Register Transfer Level Generation

  40. GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization

    May 25, 2026Maoyang Xiang, Tao Luo, Bo WangMatrix MultiplicationHierarchical Register Transfer Level Generation

  41. Approaching I/O-optimality for Approximate Attention

    May 22, 2026Pál András Papp, Aleksandros Sobczyk, Anastasios ZouziasKimi Delta AttentionMatrix Multiplication

  42. Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning

    May 22, 2026Yoshihiko Fujisawa, Yuma Ichikawa, Yudai Fujimoto +2Low-Rank Adaptation AdaptersLarge Language Model Quantization

  43. Fast and Stable Triangular Inversion for Delta-Rule Linear Transformers

    May 20, 2026Aleksandros Sobczyk, Gioele Gottardo, Christos K. Matzoros +4Kimi Delta AttentionMatrix Multiplication

  44. CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

    May 19, 2026Han Guo, Jack Zhang, Arjun Menon +4Graphics Processing Unit KernelsMatrix Multiplication

  45. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

    May 16, 2026Houji Wen, Jiangyong Yu, Jun Li +1Post-Training QuantizationQuantized