Recurrent Transformers

Momentum

30 papers in the last four weeks, against 2 the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 115

All topics
CardsList
  1. ResidualQuant: KV Cache Quantization for Looped Transformers with 2-Bit Residuals

    Oct 7, 2026Heejun Kim, Junyoung Lee, SangLyul Cho +3KV-Cache QuantizationEfficient Transformer Inference

  2. Recurrent Looped Transformer

    Oct 6, 2026Yifan Zhang, Jichen Feng, Shihan QinLength GeneralizationRecurrent Transformers

  3. TAFFY: A Task-Adaptive Tabular Foundation Model with In-Context Diversity

    Oct 6, 2026Zijian Li, Xiangchen Song, Gongxu Luo +7Synthetic Data PretrainingTabular Foundation Models

  4. Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

    Oct 5, 2026Benhao Huang, Chufan Shi, Junlin Chen +4Efficient Language Model TrainingRecurrent Transformers

  5. Balancing Memory Pathways: Analyzing and Improving Memory Utilization in Hybrid LMs

    Oct 5, 2026Hyunji Lee, Joykirat Singh, Zaid Khan +5Long-Context Language ModelingRecurrent Transformers

  6. LiFT: Loop Flow Transformers

    Oct 4, 2026Mohammad Mahdi Derakhshani, Pedro M. P. Curvo, Gertjan J. Burghouts +2Diffusion TransformerRecurrent Transformers

  7. Universal Test-Time Training

    Oct 4, 2026Zefan Cai, Qinzhe Hu, Ziqiao Ma +2Memory-Augmented Language ModelsRecurrent Transformers

  8. LAST: Looped Audio Spectrogram Transformer

    Oct 1, 2026Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina +1Audio UnderstandingRecurrent Transformers

  9. A foundation for systematic analysis of transformers and RNNs for tractography

    Oct 1, 2026Emmanuelle Renauld, Philippe Poulin, Hugo Larochelle +2Recurrent Neural NetworksRecurrent Transformers

  10. Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts

    Oct 1, 2026Di He, Pengxiang Li, Da Chang +3Mixture-of-Experts Language ModelsRecurrent Transformers

  11. Scaling Laws for Looped Mixture of Experts

    Sep 30, 2026Yanbei Chen, Anirudh Goyal, Raghuraman KrishnamoorthiMixture-of-Experts Language ModelsLanguage Model Scaling Laws

  12. Looped Diffusion Transformer

    Sep 30, 2026Yong Xien Chng, Tianyi Chen, Wenwen Tong +7Diffusion TransformerRecurrent Transformers

  13. What Limits Recursive Reasoning Models: Optimization, Architecture and Test-Time Scaling

    Sep 30, 2026Yuliana Shakhvalieva, Dmitrii Kharchev, Viacheslav Bezrukov +4Neural Algorithmic ReasoningRecurrent Transformers

  14. Shared Weights, Selected Computations: How Looped Transformers Route What Each Loop Does

    Sep 30, 2026Jiaju Wu, Yi Hu, Muhan ZhangTransformer InterpretabilityTransformer Attention

  15. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Vision-Language ModelsLarge Vision-Language Models

  16. Pretraining Latent Information Feedback Transformers with Teacher Supervision

    Sep 29, 2026Dor Tirosh, Ido Amos, Mor GevaLanguage Model PretrainingTransformer

  17. LoopICL: Looping a single transformer block to solve tabular tasks

    Sep 28, 2026Amir Rezaei Balef, Katharina EggenspergerTabular Foundation ModelsCost-Aware Inference

  18. How to Loop MoE: Flatten the Experts, Untie the Attention

    Sep 28, 2026Shouren Wang, Chuang Ma, Mohsen Hariri +6Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  19. Improving Test-Time Scaling with Adaptive Looped Transformers

    Sep 28, 2026Yichen You, Tianyu Fu, Aosong Feng +4Test-Time ScalingRecurrent Transformers

  20. Shallow Queries, Mature Values: Depth-Asynchronous Self-Speculation for Looped Transformers

    Sep 28, 2026Guanghao Li, Zihan Su, Hao Yu +6Speculative DecodingRecurrent Transformers

  21. DreamingGoose: Staged Distillation from Autoregressive Transformers to Bidirectional Recurrent Diffusion Language Models

    Sep 28, 2026Julian Boesch, Andrew Wee, Alexander StranzlIn-Context RetrievalRecurrent Transformers

  22. LoopTrack: A Simple Baseline for Parameter-Efficient Transformer Tracking

    Sep 27, 2026Liang Peng, Chenxiao Li, Libo Zhang +2Visual Object TrackingRecurrent Transformers

  23. FlashLoop: Fast and Memory-Efficient Looped Transformers via Lazy Updates

    Sep 24, 2026Wanqi Yang, Shiwei LiuEfficient Transformer InferenceRecurrent Transformers

  24. Attention Routing Stabilizes Early: Working-Set Inference for Recurrent Language Models

    Sep 23, 2026Ke Wan, Chen ChenLong-Context Language Model InferenceRecurrent Transformers

  25. GTR: Gated Token Recurrence for Efficient Dense Prediction

    Sep 22, 2026Zhe Feng, Longfei Liu, Wei Liu +7Efficient Neural Network InferenceGated Attention

  26. Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models

    Sep 17, 2026Ha Van Dau, Thanh Tung Khuat, Nguyen Thanh DungLLM EvaluationRecurrent Transformers

  27. Storing Is Not Remembering: LSTM-UT and Bounded Gated Memory for Looped Transformers

    Sep 17, 2026Aras Kavuncu, Muhammad Burhan HafezMemory-Augmented Neural NetworksRecurrent Transformers