Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Equivariant Music Transformer

    Aug 4, 2026Zixun Guo, Simon DixonRepresentation LearningTransformer

  2. Probing Character-level Transformers for the Spanish L-shaped Morphome

    Aug 4, 2026Akhilesh Kakolu Ramarao, Kevin Tang, Wiebke Petersen +1Transformer InterpretabilityTransformer

  3. Provably Learning Multi-Head Attention with Queries

    Aug 4, 2026Sunyeop Kim, Insung Kim, Jian GuoSoftmax AttentionTransformer

  4. Scaling an Autoregressive Transformer for Single-Cell Generation

    Aug 3, 2026Aleksandr Sharipov, Yusif Mukhtarov, Igor MolybogTransformerAutoregressive Generation

  5. Feed-Forward Steering in Transformer Residual Dynamics

    Aug 3, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer InterpretabilityTransformer FFNs

  6. Geometry-Guided Layerwise FFN Width Allocation in Transformers

    Aug 3, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer FFNsTransformer

  7. Learning to Trace Seiberg Dualities

    Jul 30, 2026Jonathan J. Heckman, Shani Meynet, Alessandro Mininno +1TransformerScientific ML

  8. MUL-T: Decoding Spatial Cellular Architecture in Multiplexed Tissue Images

    Jul 30, 2026Farzaneh Seyedshahi, Kai Rakovic, Adalberto Claudio Quiros +2TransformerGenerative Modeling

  9. Generalization Bounds on Optimal Control for Transformer Training and Wasserstein Distributional Robustness

    Jul 30, 2026Kağan Akman, Naci Saldi, Serdar YükselTransformerWasserstein Distributionally Robust Optimization

  10. A Compositional Theory of Causally Masked Transformers

    Jul 29, 2026Franz Nowak, Ryan Cotterell, Reda BoumasmoudTransformer ExpressivityTransformer

  11. Placement Is Free, Composition Is Not: The Latin Square as a Provably-Balanced Construction for Heterogeneous Sequence-Mixer Stacks

    Jul 29, 2026Taebong Kim, Youngsik Hong, Minsik Kim +3Transformer

  12. Localized Adaptation Reveals Distinct Learning Signatures in Transformers

    Jul 28, 2026Rebecca Ramnauth, Brian ScassellatiFine-TuningTransformer

  13. Physics Transformer: Tailoring Transformer for General PDE Prediction

    Jul 27, 2026Guoze Sun, Rui Zhang, Jiankai Tang +4TransformerPDE Surrogate Modeling

  14. SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation

    Jul 27, 2026Yu Cui, Yi Xu, Jiahao Wang +6Representation CollapseTransformer

  15. Multimodal Auto-regressive Transformer Surrogate for Modeling Variable Operations and Quantifying Uncertainty in Geological Carbon Storage

    Jul 26, 2026Yifu Han, Louis J. DurlofskyNeural Surrogate ModelingUncertainty Quantification

  16. BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

    Jul 25, 2026Hariom Ingle, Ronit Ghode, Ishwari Gondkar +2Named Entity RecognitionLLM Evaluation

  17. CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics

    Jul 25, 2026Xinhong Xu, Yimeng Zhang, Yuanlong ZhangTransformerNeural Decoding

  18. Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning

    Jul 25, 2026Narthana Sivalingam, Santhirarajah Sivasthigan, Buddhi Wijenayake +3Spatiotemporal ReasoningHuman Activity Recognition

  19. Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control

    Jul 24, 2026Federico Del Pup, Elisa Tentori, Manfredo AtzoriEMG-Based Gesture RecognitionHybrid CNN-Transformer Architectures

  20. Multi-modal transformer for signal classification in nanopore blockade experiments

    Jul 22, 2026Sandro Kuppel, Julian Hoßbach, Samuel Tovey +1TransformerTime Series Classification

  21. Multi-Head Attention Residuals

    Jul 22, 2026Cheng Luo, Zefan Cai, Junjie HuTransformerAttention Residual Connections

  22. Elicitation without Backpropagation: Steering Model Behavior by Optimizing the Latent Posterior

    Jul 21, 2026Garrett Baker, Vinayak Pathak, Daniel Murfet +1Prompt LearningTransformer