Weight-Only Quantization

Latest papers 55

All topics
CardsList
  1. When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization

    Oct 8, 2026Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu +6LLM QuantizationPost-Training Quantization

  2. JARQ: Joint Alternating Refinement for Quantization

    Sep 29, 2026Xinyu Wang, Sicheng Lyu, Xiao-Wen ChangLLM QuantizationWeight-Only Quantization

  3. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  4. Security-Enhanced Seed-Based Weight Quantization for Large Language Models

    Sep 29, 2026Qiuyu Ren, Sudipta Paria, Aritra Dasgupta +1LLM QuantizationLLM Compression

  5. Fiona: Accelerating FHE Inference with Packing-Aware Ternary Weights

    Sep 28, 2026Yiteng Peng, Zhibo Liu, Dongwei Xiao +1Mixed-Precision QuantizationEfficient Neural Network Inference

  6. PulseQuant: Propagation-Guided Subspace Correction for 4-Bit Video Diffusion Transformers

    Sep 27, 2026Yutong Wang, Xingtong Ge, Enhuai Liu +4Video Diffusion ModelsDiffusion Transformer

  7. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLLM Quantization

  8. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1VLM QuantizationEfficient VLM Inference

  9. Global Ranks Survive, Selected Heads Shift: BOS-Sink Topology under 4-bit Weight-Only Quantization

    Sep 20, 2026Kuanlin Chen, Chen-Wei Kuo, Cheng-En OuAttention Head Analysis4-Bit Quantization

  10. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1LLM QuantizationWeight-Only Quantization

  11. FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

    Aug 24, 2026Gongwei Lee, Ji Liu, Juncheng Jia +1Mixed-Precision QuantizationLLM Quantization

  12. Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

    Aug 24, 2026Zehao Liu, Chuangchuang Fang, Yang RenLLM QuantizationWeight-Only Quantization

  13. Quantization Degradation in Large Language Models: A Signal-Noise Perspective

    Aug 8, 2026Chenxi Zhou, Pengfei Cao, Jinyu Ye +5LLM QuantizationWeight-Only Quantization

  14. TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

    Aug 4, 2026Seokho Han, Dongwei Wang, Jinhee Kim +4Mixed-Precision QuantizationDiffusion Model Quantization

  15. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLLM QuantizationLLM Compression

  16. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models

  17. BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

    Jul 9, 2026Yuantian Shao, Peisong Wang, Zhilei Liu +6LLM CompressionWeight-Only Quantization