Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. Rounding in Preconditioner Space: Redesigning 4-bit AdamW Optimizer-State Quantization

    Oct 8, 2026Hanyang Li, Shao Tang, Daniel Thomas Braithwaite +74-Bit QuantizationNeural Network Quantization

  2. Read What Matters: Query-Adaptive Quantization for KV Caches

    Oct 8, 2026Siddharth Bhandari, Lucas Gretta, Krishna Balasubramanian +1KV-Cache QuantizationKV-Cache Compression

  3. TR-PTQ: High-Accuracy Integer-Only Transformer Post Training Quantization via Taylor Region Reformulation

    Oct 7, 2026Eliyahu Levy, Adam Teman, Yoni PugachovPost-Training QuantizationNeural Network Quantization

  4. Few Bits, One Law: Toward W2A4KV2

    Oct 6, 2026Kai Yi, Tarek Elgamal, Sruthikesh Surineni +3LLM QuantizationLow-Bit Quantization

  5. ApexQuant: Data-Free Elastic Quantization by Residual Re-Isotropization

    Oct 6, 2026Aksel Fristrup, Sumit Pandey, Ankit KariryaaLLM QuantizationRotation-Based Quantization

  6. Activation Denoising: A Robustness View on Parallel vs Sequential LLM Quantization

    Oct 5, 2026Yan Scholten, Rachel Lawrence, James Hensman +3LLM QuantizationPost-Training Quantization

  7. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation

    Oct 5, 2026Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4Mixed-Precision QuantizationLLM Quantization

  8. SoloQ: Calibration-Free Quantization for Diffusion Language Models

    Oct 5, 2026Donghyun Lee, Arkapravo Ghosh, Varun Manjunath +5Diffusion Model QuantizationKV-Cache Quantization

  9. Shared Stopping Decisions Change Answers in HQQ Cache Quantization

    Oct 5, 2026Seunghui Jwa, Minsu Oh, Chanjun Park +1LLM InferenceKV-Cache Quantization

  10. Understanding the Weight Averaging Mechanism in LLM Training for Post-Training Quantization

    Oct 4, 2026Hanzhang Wang, Tianqi Shen, Zonglin Liu +3LLM QuantizationPost-Training Quantization

  11. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2LLM QuantizationLLM Inference Acceleration

  12. A Tilted Bowl Is Not a Slippery Slope: Compressing Looped Models

    Sep 30, 2026Steven Kolawole, Pearse Jim, Opegbemi M. Busoye +2Efficient Neural Network InferenceRecurrent Neural Networks

  13. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangLLM QuantizationWeight-Only Quantization

  14. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  15. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10LLM QuantizationLLM Inference Acceleration

  16. QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching

    Sep 29, 2026Zunhai Su, Yuxuan Sun, Jianchao Tan +5LLM Inference AccelerationAttention Quantization

  17. TORQUE: Optimizing What (not) to Quantize Before and After Rotation

    Sep 28, 2026Ran Ben Basat, Michael Mitzenmacher, Shay VargaftikRotation-Based QuantizationVector Quantization

  18. IMC-CLINIC: Coupled Loss-Informed Newton Iterations for Clipping in Analog In-Memory Computing

    Sep 28, 2026Yung-Chin Chen, Chia-Yu Chen, Naveen VermaLLM QuantizationCompute-in-Memory

  19. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Mixed-Precision QuantizationLLM Quantization

  20. GLF-Q: Global-Local Feature-based Quantization for Vision Transformers

    Sep 28, 2026Peilin Sun, Guang Liang, Jin Tong +1Post-Training QuantizationLow-Bit Quantization

  21. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4LLM QuantizationSpiking Neural Networks