Weight-Only Quantization

Latest papers 55

All topics
CardsList
  1. When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization

    Oct 8, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationPost-Training Quantization

  2. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangLLM QuantizationWeight-Only Quantization

  3. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  4. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  5. Fiona: Accelerating FHE Inference with Packing-Aware Ternary Weights

    Sep 28, 2026Yiteng Peng, Zhibo Liu, Dongwei Xiao +1Mixed-Precision QuantizationEfficient Neural Network Inference

  6. PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

    Sep 27, 2026Yutong Wang, Xingtong Ge, Enhuai Liu +4Video Diffusion ModelsDiffusion Transformer

  7. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  8. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1VLM QuantizationEfficient VLM Inference

  9. Global Ranks Survive, Selected Heads Shift: BOS-Sink Topology under 4-bit Weight-Only Quantization

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuAttention Head Analysis4-Bit Quantization

  10. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1LLM QuantizationWeight-Only Quantization

  11. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  12. Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

    Aug 24, 2026Zehao Liu, Chuangchuang Fang, Yang RenLLM QuantizationWeight-Only Quantization

  13. Quantization Degradation in Large Language Models: A Signal-Noise Perspective

    Aug 8, 2026Chenxi Zhou, Pengfei Cao, Jinyu Ye +5LLM QuantizationWeight-Only Quantization

  14. TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

    Aug 4, 2026Seokho Han, Dongwei Wang, Jinhee Kim +4Mixed-Precision QuantizationDiffusion Model Quantization

  15. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLLM QuantizationLLM Compression

  16. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models

  17. BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

    Jul 9, 2026Yuantian Shao, Peisong Wang, Zhilei Liu +6LLM CompressionWeight-Only Quantization

  18. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Mixed-Precision QuantizationLLM Quantization

  19. Boundary-Aware Quantization: Finite-Scale Decision Geometry of Neural Classifiers

    Jul 1, 2026O. M. KiselevWeight-Only QuantizationPost-Training Quantization

  20. Spectral Perturbation of the Empirical Fisher Information Matrix under Weight Quantization

    Jun 26, 2026Rahid Zahid Alekberli, Hikmat KarimovInformation GeometryWeight-Only Quantization

  21. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

    Jun 22, 2026Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1Mixed-Precision QuantizationLLM Quantization

  22. On the Expressive Power of Weight Quantization in Large Language Models

    Jun 20, 2026Shao-Qun ZhangLLM QuantizationWeight-Only Quantization

  23. MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

    Jun 14, 2026Yangjia Hu, Haodong Wang, Zicong Hong +8LLM Quantization4-Bit Quantization

  24. Signed Symmetric Quantization for Few-Bit Integers

    Jun 12, 2026Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago +5LLM QuantizationWeight-Only Quantization

  25. Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

    Jun 11, 2026Liza Babaoglu, Shuangyi Chen, Ashish KhistiLLM QuantizationWeight-Only Quantization

  26. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

    Jun 2, 2026Liulu He, XuanAng Liu, Juntao Liu +8LLM QuantizationLLM Compression

  27. LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

    May 28, 2026Jung Hyun Lee, June Yong Yang, Jungwook Choi +1LLM QuantizationWeight-Only Quantization

  28. BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

    May 28, 2026Mincheol Kang, Hyunjin Lim, Bomin Kang +1Multi-Agent Trajectory PredictionWeight-Only Quantization

  29. QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

    May 25, 2026Preetam Sharma, Kacper DobekLLM QuantizationRotation-Based Quantization

  30. Motion-Compensated Weight Compression

    May 23, 2026Ismail LamaakalPredictive CodingWeight-Only Quantization

  31. High-Rate Quantized Matrix Multiplication II

    May 13, 2026Or Ordentlich, Yury PolyanskiyLLM QuantizationRate-Distortion Theory

  32. AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

    May 9, 2026Beshr IslamBouli, David JinLLM Quantization4-Bit Quantization

  33. OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization

    May 6, 2026Zhikai Li, Zhen Dong, Xuewen Liu +2LLM QuantizationWeight-Only Quantization

  34. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Mixed-Precision QuantizationLLM Quantization

  35. Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method

    Jul 24, 2025Qingcheng Zhu, Yangyang Ren, Linlin Yang +6Mixed-Precision QuantizationLLM Quantization

  36. LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization

    Date pendingHaoyu Wang, Xingyu Yu, Haiyan Zhao +2LLM QuantizationQuantization-Aware Training