Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Training-Induced Escape from Token Clustering in a Mean-Field Formulation of Transformers

    May 8, 2026Noboru Isobe, Daisuke Inoue, Masaaki ImaizumiTransformerClustering

  2. Encoder-Decoder Transformers: Logical Characterizations and Periodicity

    May 8, 2026Veeti Ahvonen, Damian Heiman, Antti Kuusisto +2Transformer ExpressivityTransformer

  3. Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

    May 8, 2026Jin Xu, Camille Couturier, Victor Rühle +2TransformerEnergy-Based Models

  4. Dynamic Mode Decomposition along Depth in Vision Transformers

    May 8, 2026Nishant Suresh Aswani, Saif Eddin JabariTransformerVision Transformer

  5. Approximation Error Upper and Lower Bounds for Hölder Class with Transformers

    May 8, 2026Xin He, Yuling Jiao, Xiliang Lu +1TransformerNeural Network Approximation Theory

  6. Spectrum-Adaptive Generalization Bounds for Trained Deep Transformers

    May 8, 2026Mana Sakai, Masaaki ImaizumiTransformerGeneralization Bounds

  7. When Symbol Names Should Not Matter: A Logistic Theory of Fresh-Symbol Classification

    May 8, 2026Wenjie Guan, Jelena BradicTransformerClassification

  8. A Linear-Transformer Hybrid for SNP-Based Genotype-to-Phenotype Prediction in Grapevine

    May 7, 2026Yibin Wang, Murukarthick Jayakodi, Silvas Kirubakaran +2Transformer

  9. Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

    May 7, 2026Yongyi Wang, Hanyu Liu, Lingfeng Li +6Efficient Transformer InferenceReinforcement Learning

  10. Large Vision-Language Models Get Lost in Attention

    May 7, 2026Gongli Xi, Ye Tian, Mengyu Yang +5Transformer FFNsVision-Language Models

  11. Average Attention Transformers and Arithmetic Circuits

    May 6, 2026Lena Ehrmuth, Laura StriekerTransformer ExpressivityTransformer

  12. FLUID: Continuous-Time Hyperconnected Sparse Transformer for Sink-Free Learning

    May 6, 2026Waleed Razzaq, Yun-Bo ZhaoTransformerTransformer Attention

  13. Domain-Adaptive Arrhythmia Classification Using a Hybrid Transformer on Wearable Heart Signals

    May 5, 2026Maedeh H. Toosi, Siamak MohammadiTransformerDomain Adaptation

  14. Feature-Augmented Transformers for Robust AI-Text Detection Across Domains and Generators

    May 5, 2026Mohamed Mady, Johannes Reschke, Björn SchullerAI-Generated Text DetectionTransformer

  15. Transformers with Selective Access to Early Representations

    May 5, 2026Skye Gunasekaran, Téa Wright, Rui-Jie Zhu +1TransformerResidual Learning

  16. A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures

    May 4, 2026Mullosharaf K. ArabovMultilingual Language ModelsTransformer

  17. Projection-Free Transformers via Gaussian Kernel Attention

    May 4, 2026Debarshi Kundu, Archisman Ghosh, Swaroop Ghosh +1TransformerSelf-Attention

  18. Linear-Time Global Visual Modeling without Explicit Attention

    May 3, 2026Ruize He, Dongchen Han, Gao HuangTransformerTransformer Attention

  19. E2^2DT: Efficient and Effective Decision Transformer with Experience-Aware Sampling for Robotic Manipulation

    Apr 30, 2026Kaiyan Zhao, Borong Zhang, Yiming Wang +4Long-Horizon Robotic ManipulationTransformer

  20. Hierarchical Fault Detection and Diagnosis for Transformer Architectures

    Apr 30, 2026Sigma Jahan, Saurabh Singh Rajput, Tushar Sharma +1Software EngineeringAutomated Software Testing

  21. Sampling two-dimensional spin systems with transformers

    Apr 30, 2026Piotr Białas, Piotr Korcyl, Tomasz Stebel +2TransformerIsing Model

  22. Learning Rate Transfer in Normalized Transformers

    Apr 29, 2026Boris Shigida, Boris Hanin, Andrey GromovTransformerHyperparameter Transfer

  23. Stochastic Scaling Limits and Synchronization by Noise in Deep Transformer Models

    Apr 29, 2026Andrea Agazzi, Giuseppe Bruno, Eloy Mosig García +2Dynamical SystemsTransformer

  24. Exploring the Potential of Probabilistic Transformer for Time Series Modeling: A Report on the ST-PT Framework

    Apr 29, 2026Zhangzhi Xiong, Haoyi Wu, You Wu +3TransformerConditional Random Fields

  25. Efficient and Interpretable Transformer for Counterfactual Fairness

    Apr 29, 2026Panyi Dong, Zhiyu QuanTransformer InterpretabilityTransformer