Length Generalization

Latest papers 32

All topics
CardsList
  1. TraceRelay: Attention-Aligned Recurrence over Rolling Traces

    Oct 8, 2026Sungwoo Goo, Hwi-yeol Yun, Sangkeun JungSequence ModelingPersistent Memory for Language Models

  2. Exact-Solution Volume and Length Generalization in Transformers

    Oct 6, 2026Yijia Jessica Zhu, David ChiangTransformer ExpressivityTransformer

  3. Recurrent Looped Transformer

    Oct 6, 2026Yifan Zhang, Jichen Feng, Shihan QinLength GeneralizationRecurrent Transformers

  4. Extreme Length Generalization in a Compact Recurrent Architecture for One-Shot Exploration

    Oct 1, 2026Izen Thornton, Aaron Shey, William SuMemory-Augmented Neural NetworksRecurrent Neural Networks

  5. Universality and Generalization of Causal Transformers Across Context Lengths

    Sep 28, 2026Takashi Furuya, Maarten V. de Hoop, Gabriel PeyréNeural Network GeneralizationTransformer Expressivity

  6. Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale

    Sep 14, 2026Vaibhav Singh, Pierre-André Noël, Torsten Scholak +2Blockwise Diffusion Language ModelsDiffusion Language Model Inference

  7. Length Generalization for Transformers via Compression

    Sep 8, 2026Georg Zetzsche, Hongjian Jiang, Andy Yang +4Transformer ExpressivityTransformer

  8. Can Video World Models Track Unobserved World States?

    Aug 31, 2026Joonghyuk Shin, Yicong Hong, Jaesik Park +1Action-Conditioned World ModelsLength Generalization

  9. Algebraic Decomposition Theory for Transformer Length Generalization

    Aug 13, 2026Andy Yang, Blerta Veseli, Corentin Barloy +5TransformerLength Generalization

  10. Out-of-Length Scene Text Recognition: A Two-Axis Diagnosis and a Training-Free Fix

    Jul 25, 2026Zobeir Raisi, John ZelekScene Text RecognitionLength Generalization

  11. Relative Positions Generalize, Absolute Positions Memorize: An Implicit-Bias Account of Length Generalization in Attention

    Jul 21, 2026Subham Singh, Ashutosh Mishra, Subha RautSoftmax AttentionRotary Positional Embeddings

  12. On Locality and Length Generalization in Visual Reasoning

    Jul 10, 2026Pulkit Madan, Sanjay Haresh, Reza Ebrahimi +3Visual ReasoningLength Generalization

  13. Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

    Jul 1, 2026Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal +1In-Context RetrievalLength Generalization

  14. Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping

    Jun 29, 2026Hsun-Yu Kuo, El Mahdi Chayti, Patrik Reizinger +2Early StoppingOOD Generalization

  15. POLARIS: Guiding Small Models to Write Long Stories

    Jun 2, 2026Rishanth Rajendhran, Jenna Russell, Mohit Iyyer +1Length GeneralizationLLM Post-Training

  16. ReFLEX: Length-Generalizable CSI Denoising for MIMO-OFDM via Relative-Frequency Bias

    May 29, 2026Zhibin Zhang, Robert Potekhin, Ziwei Wan +2TransformerLength Generalization

  17. Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

    May 29, 2026Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias +3Rotary Positional EmbeddingsAttention Head Analysis

  18. Length Generalization with Log-Depth Recurrent Units

    May 25, 2026Charles Pert, Dalal Alrajeh, Alessandra RussoRecurrent Neural NetworksLength Generalization

  19. On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length

    May 4, 2026Sunghwan Kim, Junhee Cho, Beong-woo Kwak +6Long-Horizon PlanningLength Generalization

  20. Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

    Apr 28, 2026Oliver Kraus, Yash Sarrof, Yuekun Yao +2Transformer ExpressivityCoT Reasoning

  21. Generalization in LLM Problem Solving: The Case of the Shortest Path

    Apr 16, 2026Yao Tong, Jiayuan Ye, Anastasia Borovykh +1Inference-Time ScalingLength Generalization