Activation Quantization

Latest papers 76

All topics
CardsList
  1. Adaptive Joint Compression and Synchronisation in Federated Split Learning for IoT Rainfall Prediction

    Jun 23, 2026Wenjie Ding, Yi Sin Lin, Jiale Liu +8Edge ComputingSplit Federated Learning

  2. ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers

    Jun 20, 2026Changjun Li, Runqing Jiang, Lian Xu +3Vision TransformerActivation Quantization

  3. ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training

    Jun 14, 2026Janghwan Lee, Sihwa Lee, Jinseok Kim +4LLM QuantizationQuantization-Aware Training

  4. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

    Jun 11, 2026Zhixiong Zhao, Zukang Xu, Zhixuan Chen +3Mixed-Precision QuantizationLLM Quantization

  5. DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

    Jun 10, 2026Zimo Zhao, Maolin Wang, Bowen Yu +3Mixed-Precision QuantizationLLM Quantization

  6. Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization

    Jun 7, 2026Patrik Czakó, Gábor Kertész, Sándor SzénásiLLM Quantization4-Bit Quantization

  7. OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

    Jun 5, 2026Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang +2LLM Quantization4-Bit Quantization

  8. STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

    Jun 3, 2026Xin Yan, Aqiang Wang, Zhenglin Wan +2LLM QuantizationDiffusion Model Quantization

  9. Characterizing the Impact of NVFP4 Quantization for Low-Power Edge AI Deployment

    Jun 3, 2026Ovishake Sen, Venkata Nithin Kamineni, Daniel Lobo +3Efficient Neural Network InferenceEdge Inference

  10. Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

    Jun 1, 2026Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou +1LLM QuantizationActivation Outliers

  11. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

    May 30, 2026Li Lin, Xiaojun WanLLM Quantization4-Bit Quantization

  12. Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling

    May 27, 2026Xinyu Wang, Mingze Li, Sicheng Lyu +6VLM QuantizationEfficient VLA Model Inference

  13. Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

    May 26, 2026Junhao Wu, Dezhong Yao, Hai JinVideo Diffusion ModelsDiffusion Transformer

  14. Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

    May 26, 2026Zhanfeng Feng, Shuai Guo, Xin Di +3Video Diffusion Models4-Bit Quantization

  15. The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

    May 26, 2026Kahyeon Nam, Hyesong ChoiVLM QuantizationActivation Quantization

  16. The Quantization Benefits of Residual-Free Transformers

    May 25, 2026Yiping Ji, Mahalakshmi Sabanayagam, Peyman Moghadam +2TransformerActivation Outliers

  17. InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

    May 25, 2026Ke Li, Dong An, Xiaoling Zang +6LLM QuantizationActivation Quantization

  18. Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training

    May 24, 2026Ayush K. Varshney, Konstantinos Vandikas, Šarūnas Girdzijauskas +2Mixed-Precision QuantizationQuantization-Aware Training

  19. DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

    May 16, 2026Sayeh Sharify, Mahsa Salmani, Hesham MostafaDiffusion TransformerDiffusion Model Quantization

  20. Measuring Maximum Activations in Open Large Language Models

    May 15, 2026Luxuan Chen, Han Tian, Xinran Chen +9LLM QuantizationActivation Outliers

  21. Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

    May 12, 2026Vage Egiazarian, Erik Schultheis, Andrei Panferov +3LLM Quantization4-Bit Quantization

  22. A Composite Activation Function for Learning Stable Binary Representations

    May 12, 2026Seokhun Park, Choeun Kim, Kwanho Lee +3Concept Bottleneck ModelsBinary Neural Networks

  23. ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs

    May 11, 2026Chayne Thrash, Ali Abbasi, Soheil KolouriRotation-Based QuantizationLLM Inference Acceleration

  24. Theory-optimal Quantization Based on Flatness

    May 11, 2026Xiusheng Huang, Zhe Li, Xuanwu Yin +5LLM QuantizationActivation Quantization

  25. LoopQ: Quantization for Recursive Transformers

    May 8, 2026Rui Fang, Hsi-Wen Chen, Ming-Syan ChenRecurrent TransformersLanguage Modeling