Low-Bit Quantization

Momentum

21 papers in the last four weeks, up 62% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 155

All topics
CardsList
  1. ResidualQuant: KV Cache Quantization for Looped Transformers with 2-Bit Residuals

    Oct 7, 2026Heejun Kim, Junyoung Lee, SangLyul Cho +3KV-Cache QuantizationEfficient Transformer Inference

  2. Dual-QK: Sharp Queries and Flat Keys for Prunable 2-bit KV Caches

    Oct 7, 2026Sunjoo Whang, Jungjun Oh, Minsung Kim +5KV-Cache CompressionKV-Cache Quantization

  3. Few Bits, One Law: Toward W2A4KV2

    Oct 6, 2026Kai Yi, Tarek Elgamal, Sruthikesh Surineni +3LLM QuantizationLow-Bit Quantization

  4. Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models

    Oct 6, 2026Seobin Song, Geonho Lee, Janghwan Lee +1LLM QuantizationPost-Training Quantization

  5. ApexQuant: Data-Free Elastic Quantization by Residual Re-Isotropization

    Oct 6, 2026Aksel Fristrup, Sumit Pandey, Ankit KariryaaLLM QuantizationRotation-Based Quantization

  6. Loopy: Low-Bit Quantization Framework for Looped Language Models

    Oct 4, 2026Zeyu LI, Yipu ZHANG, Jintao Chen +2LLM QuantizationPost-Training Quantization

  7. Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2

    Oct 1, 2026Yohan Chatelain, Pablo de Oliveira CastroTransformer InferenceLow-Bit Quantization

  8. Q-MINO: A Minimal-Norm Method for Quantization-Aware Training

    Sep 30, 2026Don LiQuantization-Aware TrainingLow-Bit Quantization

  9. XOR-Trellis: Ultra-Low-Complexity Dequantization and Curvature-Aware Hadamard-Free LLM Quantization

    Sep 30, 2026Xiaofan Que, Nir Elkayam, Spandan Pyakurel +2LLM QuantizationLLM Inference Acceleration

  10. ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM Weights

    Sep 29, 2026Jonathan Mei, Sang Hyub Kim, Oliver Knitter +2LLM QuantizationWeight-Only Quantization

  11. QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching

    Sep 29, 2026Zunhai Su, Yuxuan Sun, Jianchao Tan +5LLM Inference AccelerationAttention Quantization

  12. ThinQuant: Scalable Rotation Learning for Weight and Activation Quantization of LLMs

    Sep 28, 2026Mehdi Makni, Ryan Lucas, Rahul MazumderLLM QuantizationRotation-Based Quantization

  13. TORQUE: Optimizing What (not) to Quantize Before and After Rotation

    Sep 28, 2026Ran Ben Basat, Michael Mitzenmacher, Shay VargaftikRotation-Based QuantizationVector Quantization

  14. GLF-Q: Global-Local Feature-based Quantization for Vision Transformers

    Sep 28, 2026Peilin Sun, Guang Liang, Jin Tong +1Post-Training QuantizationLow-Bit Quantization

  15. Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning

    Sep 22, 2026Yuanteng Chen, Zhilei Liu, Peisong Wang +7LLM QuantizationQuantization-Aware Training

  16. QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models

    Sep 22, 2026Jiaqi Zhao, Xiaobin Hu, Bo Yin +3KV-Cache CompressionKV-Cache Quantization

  17. RGSQ: Riemannian Geometry-Sensitive Quantization for Large Vision-Language Models

    Sep 21, 2026Zhiping Wu, Dongdong Ren, Yangchengyu Zhou +4VLM QuantizationLarge Vision-Language Models

  18. SPHQuant: Efficient extreme low bit weight quantization for Vision-Language Models

    Sep 21, 2026Kewei Zhang, Zheng Chen, Haotong Qin +1VLM QuantizationEfficient VLM Inference

  19. MiX: Micro-Inverted-Scaling for End-to-End Low-Bit Vision-Language Model Acceleration

    Sep 17, 2026Yuan Liao, Jae-sun SeoAI Accelerator InferenceVLM Quantization

  20. Predict Before You Deploy: Offline Prediction of Quantization-Induced Task Degradation for World Action Models

    Sep 16, 2026Jiuyi Xu, Jinjia Guo, Meida Chen +2World Action ModelsPost-Training Quantization

  21. VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    Sep 14, 2026Xingyang Li, Dongyun Zou, Shining Zhang +8Video Diffusion ModelsDiffusion Transformer

  22. Structured Transforms for Low-Overhead Quantization of Language Models

    Sep 11, 2026Daria Cherniuk, Alexander Rudikov, Boris Kashin +1LLM QuantizationWeight-Only Quantization

  23. EFQ-Softmax: Exp-Free Quantization for Softmax

    Sep 9, 2026Haohui Han, Yuming Wan, Hongni Wang +4Efficient Transformer InferenceTransformer Attention

  24. SCULPT: Training Edge Vision Models for Post-Training Quantization Readiness

    Sep 1, 2026Bharadwaj Kavuri, Sourav Babu-PK, Varadhraj Ellapan +2Edge ComputingActivation Quantization