cs.LGNov 13, 2025

EDGC: Entropy-driven Dynamic Gradient Compression for Efficient LLM Training

Authors: Qingao Yi, Jiaang Duan, Jun Zhang, Haiyan Zhao, Shiyou Qian, Dingyu Yang, Jian Cao, Jinghua Tang

Organizations: University of Shanghai for Science and Technology, Shanghai, China · Shanghai Jiao Tong University, Shanghai, China · Zhejiang University, Hangzhou, China

Abstract

Training large language models (LLMs) at scale incurs substantial communication overhead, while static gradient compression cannot adapt to gradient evolution and may degrade model quality. We propose EDGC, an entropy-driven dynamic gradient compression framework that adapts compression ranks to gradient entropy during training. EDGC combines efficient entropy estimation through gradient sampling, a theoretical model relating entropy to compression rank under a bounded-error constraint, and window-based rank adjustment across pipeline stages. Experiments on 32-V100 and 64-H100 GPU clusters training GPT2 models with 2.5B and 12.1B parameters show that EDGC reduces communication latency by up to 46.45% and end-to-end training time by 16.13%, while maintaining model quality.

Figures & tables

Appendix figures & tables8 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

    Apr 30, 2026Wenxiang Lin, Xinglin Pan, Ruibo Fan +2Large Language Model CompressionLarge Language Model Training

  2. Layer-wise Curriculum Learning for Efficient LLM Compression

    Sep 16, 2026Donggeon Lee, Dooyeon Na, Seungmin Oh +1Large Language Model CompressionAdaptive Curriculum

  3. Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

    May 2, 2026Wen-Da Wei, Han-Bin Fang, Yang-Di Liu +3Large Language Model CompressionTask-Aware Compression