Large Language Model Quantization

Latest papers 154

All topics
CardsList
  1. Loopy: Low-Bit Quantization Framework for Looped Language Models

    Oct 4, 2026Zeyu LI, Yipu ZHANG, Jintao Chen +2Large Language Model Quantization

  2. MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

    Oct 1, 2026Boyang Li, Bingyu Shen, Weihao Hong +6Large Language Model QuantizationJailbreak Success Rates

  3. Analysis of Quantized and Efficiently Adapted Protein Language Models

    Sep 30, 2026Ilan Yaniv Zeisler, Sebastian Clancy, Pouriya Bayat +8Large Language Model QuantizationLanguage Modeling

  4. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2Large Language Model QuantizationQuantizer

  5. QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs

    Sep 30, 2026Weili Xu, Jisen Li, Yuqing Jian +8Large Language Model QuantizationQuantization-Aware Training

  6. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2Large Language Model QuantizationQuantized

  7. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Sep 29, 2026Yi Pan, Haocheng Xi, Kan Zhu +10Large Language Model QuantizationKimi Delta Attention

  8. SQUARE: Structured Quantum Representation Adapters as Compact Quadratic Feature Maps for Frozen Language Models

    Sep 29, 2026Emily Jimin Roh, Hyojun Ahn, Hoyeong Lee +4Large Language Model QuantizationFrozen Language Model

  9. Bits Under ZK-LLM: Evaluating Zero-Knowledge-Friendly Quantization for Verifiable Private LLM Inference

    Sep 29, 2026Taeung Yoon, Yupeng Zhang, Xiaojing LiaoLarge Language Model QuantizationLLM Inference Optimization

  10. ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

    Sep 28, 2026Mehdi Makni, Ryan Lucas, Rahul MazumderLarge Language Model QuantizationQantis

  11. P4Q: Co-designing Token Pruning and Quantization for Vision-Language Model Acceleration

    Sep 28, 2026Haizhao Jing, Zhenhao Shang, Haokui Zhang +2Visual Token PruningLarge Language Model Quantization

  12. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models

    Sep 28, 2026Bang Hu, Guowei Zhu, Changze Lv +4Large Language Model QuantizationLLM Inference Optimization

  13. Optimizing the Phi-2 Small Language Model for Real-time Chatbot Applications Using Parameter-Efficient Fine-Tuning (PEFT) with QLoRA Quantization

    Sep 27, 2026PhanTan Khanh Nguyen, Ashfaq Ali Shafin, Khandaker Mamun AhmedLarge Language Model QuantizationSmall Large Language Models

  14. TerMeZO: Ternary Sparse Zeroth-Order Optimization for Fine-tuning BitNet Models at the Edge

    Sep 27, 2026Houssem Sifaou, Prabodh Katti, Bipin Rajendran +1Zeroth-Order OptimizationZeroth-Order

  15. Quantization-Robust Unlearning through the Lens of Retain-Forget Loss Landscapes Interaction

    Sep 23, 2026Jialu Wang, Jianing Deng, Shuqing Luo +6Large Language Model UnlearningLarge Language Model Quantization

  16. Disaggregated Quantization: Specializing LLM Prefill and Decode

    Sep 22, 2026Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi +2Large Language Model QuantizationQuantizer

  17. Beyond Scalar Sensitivity: Activation-Aware Mixed-Precision LLM Quantization with Cross-Layer Refinement

    Sep 22, 2026Akihiro Yoshida, Yuma IchikawaMixed-Precision QuantizationLarge Language Model Quantization

  18. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4Large Language Model QuantizationPost-Training Quantization

  19. Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models

    Sep 21, 2026Xiaoqiang Wang, Mengyang Xiong, Jun Dai +1Large Language Model QuantizationDiffusion Language Models

  20. QuanText: Protecting Dataset-Level Secrets in Textual Data Sharing

    Sep 16, 2026Shuaiqi Wang, Zinan Lin, Giulia FantiTextual DatasetLarge Language Model Quantization

  21. Breaking the 1.58-bit Barrier for Ternary LLMs

    Sep 14, 2026Evangelos Georganas, Alexander Heinecke, Pradeep DubeyLarge Language Model QuantizationModel Weights

  22. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1Large Language Model QuantizationModel Weights

  23. Forgetting Only What Matters: Layer-Selective Unlearning toward Robust LLMs

    Sep 9, 2026Ravi Ranjan, Olivera Kotevska, Agoritsa PolyzouLarge Language Model UnlearningLarge Language Model Quantization

  24. HyQuant: Hybrid-Precision Quantization for LLM Attention

    Aug 28, 2026Jiatong Ding, Bingxin Xing, Yu Zhang +9Large Language Model QuantizationQantis

  25. When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

    Aug 26, 2026Yao Fu, Lijia Huang, Xiaomin Li +3PersonalityLarge Language Model Quantization

  26. Activation-Weighted Seeded Residual Coding for Low-Bit LLM Weight Repair

    Aug 24, 2026Zehao Liu, Chuangchuang Fang, Yang RenLarge Language Model QuantizationModel Weights

  27. Quantization Degradation in Large Language Models: A Signal-Noise Perspective

    Aug 8, 2026Chenxi Zhou, Pengfei Cao, Jinyu Ye +5Large Language Model QuantizationPost-Training Quantization

  28. Beyond Rotations: AuroOFT for Expressive Quantized Orthogonal Fine-Tuning

    Aug 5, 2026Yue Han, Dianlin WangLarge Language Model QuantizationParameter-Efficient Fine-Tuning Methods

  29. Separating quantum circuits from classical LLMs

    Aug 4, 2026Srinivasan Arunachalam, Arkopal Dutt, Hari Krovi +1Quantum CircuitsLarge Language Model Quantization

  30. Quantization Effects on Biomedical LLM Reliability

    Aug 4, 2026Anton Rasmussen, Hong QinLarge Language Model ReliabilityLarge Language Model Quantization

  31. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLarge Language Model QuantizationMatched Fp16 Intermediate

  32. FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

    Aug 3, 2026Xianglong Yan, Hong Liu, Chengzhu Bao +4Large Language Model QuantizationFp8

  33. Studying quantization trade-offs for efficient inference deployment in machine translation

    Jul 31, 2026Jim Zhao, Sohir Maskey, Koen Oostermeijer +2Large Language Model QuantizationLLM Inference Optimization

  34. GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Byeongcheol Kim +2Large Language Model QuantizationLLM Inference Optimization

  35. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

    Jul 23, 2026Emilio FerraraLarge Language Model BiasLarge Language Model Quantization

  36. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Large Language Model QuantizationMixed-Precision Quantization

  37. Reliability Scaling Laws for Quantized Large Language Models

    Jul 12, 2026Sirine Ayadi, Sándor Daróczi, Stephan Günnemann +1Large Language Model QuantizationLarge Language Model Reliability

  38. Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

    Jul 10, 2026Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry WuLarge Language Model QuantizationLarge Language Models Fail

  39. The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs

    Jul 9, 2026Baha Rababah, Cuneyt Gurcan Akcora, Carson K. LeungLarge Language Model QuantizationPost-Training Quantization

  40. KronQ: LLM Quantization via Kronecker-Factored Hessian

    Jul 8, 2026Donghyun Lee, Yuhang Li, Ruokai Yin +1Large Language Model QuantizationPost-Training Quantization

  41. GeoFP8: Geometry-Aware FP8 Gradient Compression for Distributed LLM Training

    Jul 8, 2026Jieying Wang, Zizhong Wang, Fangru Linghu +3Large Language Model QuantizationLarge Language Model Pretraining