Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Reachability and asymptotics of Gaussian Transformer dynamics

    May 29, 2026Albert Alcalde, Zhengping Ji, Enrique ZuazuaTransformer

  2. Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't

    May 28, 2026Anej Svete, William Merrill, Ryan Cotterell +1Transformer ExpressivityTransformer

  3. Anti Mode-Collapse in Mean-Field Transformer via Auxiliary Variables

    May 28, 2026Masaaki Imaizumi, Masanori Koyama, Noboru Isobe +1TransformerSelf-Attention

  4. Transformers Provably Learn to Internalize Chain-of-Thought

    May 27, 2026Yixiao Huang, Hanlin Zhu, Zixuan Wang +4TransformerCoT Reasoning

  5. Measure-to-measure Regression with Transformers

    May 27, 2026Matthew Vandergrift, Martha White, Yury Polyanskiy +2TransformerOperator Learning

  6. ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation

    May 27, 2026Yu Zhang, Yidi Shao, Wenqi Ouyang +5TransformerPhysics-Based Simulation

  7. Customer Churn Prediction on Structured Data Using FT-Transformer and Stacking Ensembles

    May 26, 2026Joyjit Roy, Samaresh Kumar Singh, Laxmi ShawTransformerEnsemble Learning

  8. Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning

    May 26, 2026Sridhar MahadevanTransformerAutoregressive Language Modeling

  9. More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations

    May 26, 2026Mingze Wang, Jinbo Wang, Yikuan Xia +2Transformer FFNsTransformer Expressivity

  10. PRISM: Position-encoded Regressive Inverse Spectral Model for Multilayer Thin-Film Design

    May 26, 2026Runtian Wang, Renhao Xue, Baige Chen +1TransformerMaterials Science

  11. The Quantization Benefits of Residual-Free Transformers

    May 25, 2026Yiping Ji, Mahalakshmi Sabanayagam, Peyman Moghadam +2TransformerActivation Outliers

  12. Momentum Streams for Optimizer-Inspired Transformers

    May 23, 2026Jingchu Gai, Nai-Chieh Huang, Jiayun WuDeep Learning OptimizationTransformer

  13. Preisach Attention: A Hysteretic Model of Sequential Memory

    May 22, 2026Piotr FrydrychTransformerEfficient Attention

  14. How Many Different Outputs Can a Transformer Generate?

    May 21, 2026Maxime Meyer, Mario Michelessa, Caroline Chaux +1Transformer ExpressivityTransformer

  15. Large-Step Training Dynamics of a Two-Factor Linear Transformer Model

    May 20, 2026Krishnakumar BalasubramanianTransformerPhase Transitions

  16. UniT: Unified Geometry Learning with Group Autoregressive Transformer

    May 20, 2026Haotian Wang, Yusong Huang, Zhaonian Kuang +4TransformerDepth Estimation

  17. HORST: Composing Optimizer Geometries for Sparse Transformer Training

    May 20, 2026Tom Jacobs, Rohan Jain, Rebekka BurkholzDeep Learning OptimizationTransformer

  18. Position: The Turing-Completeness of Autoregressive Transformers Relies Heavily on Context Management

    May 19, 2026Guanyu Cui, Zhewei Wei, Kun HeTransformer ExpressivityTransformer

  19. Chessformer: A Unified Architecture for Chess Modeling

    May 18, 2026Daniel Monroe, George Eilender, Philip Chalmers +2Transformer InterpretabilityGame-Playing Agents

  20. The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought

    May 18, 2026Moritz Brösamle, Stephan EcksteinTransformer ExpressivityTransformer

  21. InfoFlow: A Framework for Multi-Layer Transformer Analysis

    May 18, 2026Penghao Yu, Haotian Jiang, Zeyu Bao +1Transformer ExpressivityTransformer

  22. Training Infinitely Deep and Wide Transformers

    May 17, 2026Raphaël Barboni, Maarten V. de Hoop, Takashi Furuya +1TransformerWasserstein Gradient Flows

  23. OPTNet: Ordering Point Transformer Network for Post-disaster 3D Semantic Segmentation

    May 16, 2026Nhut Le, Ehsan Karimi, Maryam RahnemoonfarDisaster Damage AssessmentTransformer