Recurrent Transformers

Momentum

30 papers in the last four weeks, against 2 the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 115

All topics
CardsList
  1. Simply Stabilizing the Loop via Fully Looped Transformer

    May 11, 2026Rao Fu, Zixuan Yang, Jiankun Zhang +4Test-Time ScalingRecurrent Transformers

  2. LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

    May 10, 2026Taekhyun Park, Yongjae Lee, Dohee Kim +1Recurrent TransformersLLM Post-Training

  3. Sparse Layers are Critical to Scaling Looped Language Models

    May 9, 2026Ryan Lee, Jacob Biloki, Edward J. Hu +1Mixture-of-Experts Language ModelsRecurrent Transformers

  4. Lattice Deduction Transformers

    May 9, 2026Liam Davis, Leopold Haller, Alberto Alfarano +1Recurrent TransformersNeuro-Symbolic Reasoning

  5. Kaczmarz Linear Attention

    May 9, 2026Jiaxuan Zou, Ruifeng Ren, Yong LiuLong-Context Language ModelingRecurrent Transformers

  6. Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

    May 8, 2026Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo +3KV-Cache ManagementMemory-Efficient Inference

  7. LoopQ: Quantization for Recursive Transformers

    May 8, 2026Rui Fang, Hsi-Wen Chen, Ming-Syan ChenRecurrent TransformersLanguage Modeling

  8. Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning

    May 6, 2026William T. Redman, Erik C. Johnson, Brian RobinsonCompositional ReasoningContinual Learning

  9. Where Should LoRA Go? Component-Type Placement in Hybrid Language Models

    Apr 24, 2026Hector Borobia, Elies Seguí-Mas, Guillermina Tormo-CarbóLow-Rank AdaptationRecurrent Transformers

  10. Hyperloop Transformers

    Apr 23, 2026Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon KimLLM CompressionHyper-Connections

  11. The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

    Apr 23, 2026Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi +3Efficient Transformer InferenceSelf-Attention

  12. How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models

    Apr 22, 2026Kristian Schwethelm, Daniel Rueckert, Georgios KaissisLanguage Model Scaling LawsRecurrent Neural Networks

  13. One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models

    Apr 20, 2026Chris Cameron, Wangzheng Wang, Nikita Ivanov +3Recurrent TransformersDiffusion Models

  14. The Topological Trouble With Transformers

    Apr 18, 2026Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne LiuTransformer FFNsRecurrent Neural Networks

  15. On the Residual Scaling of Looped Transformers: Stability and Transferability

    Date pendingShaowen Wang, Bingrui Li, Ge Zhang +3Residual LearningHyperparameter Transfer

  16. SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

    Date pendingShaowen Wang, Ge Zhang, Kairong Luo +6Language Model Scaling LawsTransformer Attention