Neural Network Quantization

Latest papers 270

All topics
CardsList
  1. Finer is Better (with the Right Scaling)

    May 8, 2026Clemens Schaefer, Gil TabakLLM Quantization4-Bit Quantization

  2. Direction-Preserving Number Representations

    May 8, 2026Bardia Zadeh, George A. Constantinides4-Bit QuantizationLow-Bit Quantization

  3. Saliency-Aware Regularized Quantization Calibration for Large Language Models

    May 7, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationLanguage Model Calibration

  4. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  5. Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices

    May 5, 2026Francesco Tosini, Simone Pedroni, Christian Veronesi +5Edge InferenceVisual SLAM

  6. Topology-Constrained Quantized nnUNet for Efficient and Anatomically Accurate 3D Tooth Segmentation

    May 5, 2026Paarth Prasad, Ruchika MalhotraQuantization-Aware TrainingTopology-Preserving Image Segmentation

  7. QuIDE: Mastering the Quantized Intelligence Trade-off via Active Optimization

    May 5, 2026Xiantao JiangMixed-Precision QuantizationLLM Quantization

  8. Statistically-Lossless Quantization of Large Language Models

    May 4, 2026Michael Helcig, Eldar Kurtic, Dan AlistarhLLM QuantizationLLM Inference Acceleration

  9. ViM-Q: Scalable Algorithm-Hardware Co-Design for Vision Mamba Model Inference on FPGA

    May 3, 2026Shengzhe Lyu, Yuhan She, Patrick S. Y. Hung +2Efficient Neural Network InferenceEdge Inference

  10. ShiftLIF: Efficient Multi-Level Spiking Neurons with Power-of-Two Quantization

    May 3, 2026Kaiwen Tang, Di Yu, Jiaqi Zheng +4Spiking Neural NetworksNeural Network Quantization

  11. Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization

    Apr 30, 2026YiFeng Wang, Zhun Sun, Keisuke SakaguchiLLM QuantizationActivation Quantization

  12. Quantamination: Dynamic Quantization Leaks Your Data Across the Batch

    Apr 29, 2026Hanna Foerster, Ilia Shumailov, Cheng Zhang +3Data LeakagePrivacy-Preserving ML

  13. CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

    Apr 29, 2026Zhe Ding, Su Pan, Duowei PanMixed-Precision QuantizationLLM Quantization

  14. Multibit neural inference in a N-ary crossbar architecture

    Apr 28, 2026Anatole Moureaux, Anthony Lopes Temporao, Flavio Abreu AraujoEfficient Neural Network InferenceCompute-in-Memory

  15. QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention

    Apr 28, 2026Sehyeon Oh, Yongin Kwon, Jemin LeeSoftmax AttentionGPU Acceleration

  16. Deployment-Aligned Low-Precision Neural Architecture Search for Spaceborne Edge AI

    Apr 27, 2026Parampuneet Kaur Thind, Vaibhav Katturu, Giacomo Zema +1Edge ComputingHardware-Aware NAS

  17. Enhanced Privacy and Communication Efficiency in Non-IID Federated Learning with Adaptive Quantization and Differential Privacy

    Apr 25, 2026Emre Ardıç, Yakup GençNon-IID Federated LearningDifferentially Private Federated Learning

  18. HGQ-LUT: Fast LUT-Aware Training and Efficient Architectures for DNN Inference

    Apr 24, 2026Chang Sun, Zhiqiang Que, Bakhtiar Zadeh +4Efficient Neural Network InferenceFPGA-Based Neural Network Acceleration

  19. FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression

    Apr 22, 2026Ye Qiao, Yian Wang, Zhiheng Chen +2LLM CompressionGPU Acceleration

  20. Quantization robustness from dense representations of sparse functions in high-capacity kernel associative memory

    Apr 22, 2026Akira TamamoriNeural Representation GeometryHopfield Networks

  21. On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks

    Apr 22, 2026Aarav Gupta, Gururaj Deshpande, Chandreyi ChakrabortyMixed-Precision QuantizationDiffusion Model Quantization

  22. From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization

    Apr 21, 2026Chenxi Zhou, Pengfei Cao, Jiang Li +4LLM QuantizationPost-Training Quantization

  23. GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling

    Apr 20, 2026Alireza Dadgarnia, Soroush Tabesh, Mahdi Nikdan +4LLM QuantizationPost-Training Quantization