LLM Quantization

LLM: Large Language Model

Momentum

33 papers in the last four weeks, up 43% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 251

All topics
CardsList
  1. In-Cell Learning: Language Models That Update Their Own Weights in Sequence Without Changing the File They Ship

    Aug 21, 2026Zifeng Liu, Yaxin Lu, Xuanhan Wu +6LLM QuantizationKnowledge Editing

  2. QUASAR: Lowering the Loss Floor of Quantization-Aware Training with Loss-Aware Reconstruction

    Aug 14, 2026Vincent Counathe, Ben Athiwaratkun, Christopher De Sa +1LLM QuantizationQuantization-Aware Training

  3. SoftWater: Class-Aware Rate Allocation for Softmax Quantization

    Aug 12, 2026Joao V. Cavalcanti, Ashia C. WilsonLLM QuantizationPost-Training Quantization

  4. Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

    Aug 12, 2026Haokun Lin, Kaijie Zhu, Haobo Xu +4LLM QuantizationLLM Pruning

  5. From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization

    Aug 10, 2026Achille Jacquemond, Yuma Ichikawa, Akira SakaiLLM QuantizationPost-Training Quantization

  6. LegoLM: Structured Weight Sharing for Large Language Models

    Aug 9, 2026Joseph BinghamLLM QuantizationLLM Compression

  7. Quantization Degradation in Large Language Models: A Signal-Noise Perspective

    Aug 8, 2026Chenxi Zhou, Pengfei Cao, Jinyu Ye +5LLM QuantizationWeight-Only Quantization

  8. CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models

    Aug 8, 2026Ye QiaoLLM QuantizationLow-Bit Quantization

  9. ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

    Aug 7, 2026Yongge Ma, Guoan Wang, Feiyu Wang +5LLM QuantizationPost-Training Quantization

  10. Beyond Rotations: AuroOFT for Expressive Quantized Orthogonal Fine-Tuning

    Aug 5, 2026Yue Han, Dianlin WangLLM QuantizationFine-Tuning

  11. Quantization Effects on Biomedical LLM Reliability

    Aug 4, 2026Anton Rasmussen, Hong QinLLM QuantizationText Classification

  12. ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

    Aug 3, 2026Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali YukselLLM QuantizationLLM Compression

  13. FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

    Aug 3, 2026Xianglong Yan, Hong Liu, Chengzhu Bao +4LLM Quantization4-Bit Quantization

  14. Studying quantization trade-offs for efficient inference deployment in machine translation

    Jul 31, 2026Jim Zhao, Sohir Maskey, Koen Oostermeijer +2LLM QuantizationLLM Inference Acceleration

  15. LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference

    Jul 30, 2026Sangjin Kim, Yuseon Choi, Jungjun Oh +2LLM QuantizationAI Accelerator Inference

  16. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models

    Jul 25, 2026Ashitabh Misra, Madhav Agrawal, Arham Jain +1Mixed-Precision QuantizationLLM Quantization

  17. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

    Jul 23, 2026Emilio FerraraOpen-Ended GenerationLLM Quantization

  18. GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

    Jul 22, 2026Miguel P. Bento, João F. SeabraLLM QuantizationRotation-Based Quantization

  19. MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

    Jul 20, 2026Simla Burcu Harma, Danila Mishin, Zhengyuan Su +7Mixed-Precision QuantizationLLM Quantization

  20. PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

    Jul 17, 2026Yuchen Yang, Yifan Zhao, Anisha Dasgupta +1LLM QuantizationMixture-of-Experts Language Models