LLM Training

LLM: Large Language Model

Momentum

31 papers in the last four weeks, up 72% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 226

All topics
CardsList
  1. Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer

    May 5, 2026Jinghui Yuan, Jiaxuan Zou, Shuo Wang +2Neural Network OptimizationMatrix Optimization

  2. Model Spec Midtraining: Improving How Alignment Training Generalizes

    May 3, 2026Chloe Li, Nevan Wichers, Sara Price +2LLM AlignmentLLM Safety Alignment

  3. Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

    May 2, 2026Wen-Da Wei, Han-Bin Fang, Yang-Di Liu +3LLM CompressionGradient Compression

  4. AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

    May 1, 2026Wenxiang Lin, Juntao Huang, Luhan Zhang +5LLM QuantizationCommunication-Efficient Distributed Training

  5. Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

    Apr 30, 2026Jasmine Brazilek, Harper DunnMoral Reasoning in Language ModelsLanguage Model Post-Training

  6. ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

    Apr 30, 2026Wenxiang Lin, Xinglin Pan, Ruibo Fan +2Communication-Efficient Distributed TrainingLLM Training

  7. XekRung Technical Report

    Apr 30, 2026Jiutian Zeng, Junjie Li, Chengwei Dai +13LLM Fine-TuningCybersecurity

  8. AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

    Apr 29, 2026Ahan Gupta, Zhihao Wang, Neel Dani +3Efficient Language Model TrainingLLM Training

  9. What Kind of Language is Easy to Language-Model Under Curriculum Learning?

    Apr 29, 2026Nadine El-Naggar, Tatsuki Kuribayashi, Ted BriscoeInductive BiasLinguistic Bias in Language Models

  10. From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

    Apr 29, 2026Md. Rejaul Korim Sadi, Toufiqur Rahman Tasin, Golam Mostofa NaeemHallucination in Language ModelsLLM Reliability

  11. LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model

    Apr 28, 2026Youngjoon Jang, Chanhee Park, Hyeonseok Moon +5Legal NLPLLM Fine-Tuning

  12. Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

    Apr 27, 2026Chenkai Pan, Xinglong Xu, Yuhang Xu +6LLM EvaluationKnowledge Augmentation for Language Models

  13. Intrinsic Mutual Information as a Modulator for Preference Optimization

    Apr 27, 2026Peng Liao, Peijia Zheng, Lingbo Li +2LLM AlignmentOffline Preference Optimization

  14. Scaling Point-in-Time Language Models

    Apr 24, 2026Bryan Kelly, Semyon Malamud, Johannes Schwab +1Decoder-Only Language ModelsTemporal Data Leakage

  15. Commonsense Knowledge with Negation: A Resource to Enhance Negation Understanding

    Apr 21, 2026Zijie Wang, MohammadHossein Rezaei, Farzana Rashid +1Knowledge Augmentation for Language ModelsLLM Training

  16. Characterizing Model-Native Skills

    Apr 19, 2026Feiyang Kang, Mahavir Dabas, Myeongseob Ko +1LLM AlignmentLLM Training

  17. PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

    Apr 19, 2026Yuting Huang, Yinghao Hu, Qian Xiao +7LLM GroundingLanguage Model Post-Training

  18. Where does output diversity collapse in post-training?

    Apr 17, 2026Constantinos Karouzos, Xingwei Tan, Nikolaos AletrasLanguage Model Post-TrainingLLM Training

  19. GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization

    Apr 17, 2026Jixuan Leng, Si Si, Hsiang-Fu Yu +2LLM AlignmentDirect Preference Optimization

  20. CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning

    Apr 16, 2026Zhuo Wang, Zhuo Zhang, Yafu Li +3Evolutionary OptimizationLLM Training

  21. Adam's Law: Textual Frequency Law on Large Language Models

    Apr 2, 2026Hongyuan Adam Lu, Z. L., Victor Wei +5LLM PromptingLLM Fine-Tuning

  22. Sampling at intermediate temperatures is optimal for training large language models in protein structure prediction

    Mar 31, 2026L. Ghiringhelli, A. Zambon, G. TianaProtein Structure PredictionAI-Assisted Scientific Research

  23. DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models

    Mar 27, 2026Hao Liang, Zhengyang Zhao, Mingrui Chen +22Training Data SelectionData Mixture Optimization