Layer Normalization

Latest papers 20

All topics
CardsList
  1. LayerRoPE: Dynamic Depth-wise Magnitude & Angular Superposition

    Oct 6, 2026Shikhar Srivastava, Christopher KananTransformerPositional Encoding

  2. Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing

    Aug 13, 2026Sheng Ren, Yadong Wang, Naiqiang Tan +7TransformerLayer Normalization

  3. Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

    Aug 10, 2026Jie Zhu, Mingyu Ding, Boqiang Duan +2Diffusion TransformerNeural Network Initialization

  4. Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure

    Aug 10, 2026Xingjian Wang, Qingyu Han, Xiaodong Luo +1TransformerSelf-Attention

  5. One Model to Magnify Them All: Efficient Scale-Invariant Histopathology via Conditional Normalization and Continuous Magnification Training

    Aug 10, 2026Agnieszka Florkowska, Henning Müller, Marek WodzinskiComputational PathologyHistopathology Image Segmentation

  6. Phasor Attention: Mean Root Square Normalization for Phase Manifold Preservation

    Jul 20, 2026Sungwoo Goo, Hwi-yeol Yun, Sangkeun JungGradient ClippingLayer Normalization

  7. LayerNorm as Implicit Gain Control in Looped Transformers

    Jul 12, 2026Matthias M. M. BuehlmaierRecurrent TransformersLayer Normalization

  8. MIVE: A Minimalist Integer Vector Engine for Softmax LayerNorm and RMSNorm Acceleration

    Jun 16, 2026Kosmas Alexandridis, Giorgos DimitrakopoulosAI Accelerator InferenceInference Acceleration

  9. PostDeg: Placement Beats Parameterization in LayerNorm GNNs

    Jun 12, 2026Yash Tomar, Aryav DasGraph Neural NetworksLayer Normalization

  10. Looped Transformers with Layer Normalization Provably Learn the Power Method

    May 30, 2026Lyumin Wu, Chenyang Zhang, Yuan CaoRecurrent TransformersLayer Normalization

  11. Enjoy Your Layer Normalization with the Computational Efficiency of RMSNorm

    May 14, 2026Yuxin Guo, Yihao Yue, Yunhao Ni +4Efficient Neural Network InferenceLayer Normalization

  12. Evolving Layer-Specific Scalar Functions for Hardware-Aware Transformer Adaptation

    May 13, 2026Kieran Carrigg, Sigur de Vries, Amirhossein Sadough +1Efficient Neural Network InferenceEfficient ViTs

  13. Attention Drift: What Autoregressive Speculative Decoding Models Learn

    May 11, 2026Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek +3Long-Context Language Model InferenceSpeculative Decoding

  14. The Transformer as a Polar State Estimator

    May 10, 2026Peter RacioppoTransformerLayer Normalization

  15. Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices

    Apr 26, 2026Dawon Choi, Hana Kim, Ji-Hoon KimEfficient Neural Network InferenceLayer Normalization