Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Dual Attention Residuals

    Jul 21, 2026Xingda Yu, Yining Li, Xinzhang Liu +5TransformerCross-Attention

  2. On the Diverse Dynamical Behaviors Arising in Deep Linear Transformers

    Jul 20, 2026Sixu Li, Thomas Jacob Maranzatto, Jan Peszek +5Dynamical SystemsTransformer Inference

  3. Manifold-Constrained Hyper-Connections for Parameter-Efficient Finetuning

    Jul 20, 2026Valentijn Oldenburg, Floris de Kam, Bente Zuijdam +5TransformerHyper-Connections

  4. A Controlled Study of Attention-Only Transformers

    Jul 20, 2026Henry Ndubuaku, Karen Mosoyan, Jakub Mroz +5Transformer FFNsTransformer

  5. Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection

    Jul 20, 2026Amir Hosein Fadaei, Mahyar Maleki, Mohammad-Reza A. DehaqaniTransformerEfficient ViTs

  6. Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model

    Jul 19, 2026Xiao Wang, Hao Si, Qiang Chen +8Neural Surrogate ModelingTransformer

  7. Physics-Guided Masked Multi-Task Network for Edge-Friendly Battery Health Diagnostics from Sto-chastically Fragmented Charging Profiles

    Jul 19, 2026Shuhao Chen, Tianyu Shi, Chengyi TuRUL EstimationTransformer

  8. What does a Bayes-filtered transformer believe? A predictive Monte Carlo approach

    Jul 19, 2026Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan WeiTransformer InterpretabilityLatent Variable Models

  9. Boundary-Seeking GAN-Augmented TabTransformer for Adversarially Robust Intrusion Detection

    Jul 17, 2026Raihan Sultan Pasha Basuki, Aliyah KurniasihSynthetic Data AugmentationTransformer

  10. xHC: Expanded Hyper-Connections

    Jul 16, 2026Xiangdong Zhang, Xiaohan Qin, Sunan Zou +10Language Model PretrainingTransformer

  11. When Close Enough Is Not Enough: Autoregressive Drift in Quantum Circuit Synthesis

    Jul 14, 2026Mehdi Saeedi, Eddie Richter, Paul HartkeTransformer

  12. From Expressivity to Sample Complexity: Narrow Teachers for Transformers via C-RASP

    Jul 13, 2026Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau +1TransformerSample Complexity

  13. Comparative Analysis of GAT and BERT for Human-Like Playtesting

    Jul 13, 2026Kleio Fragkedaki, Theodoros Panagiotakopoulos, Matteo Biasielli +1Graph Attention NetworksGraph Neural Networks

  14. RepTran: Search-Based Repair of Transformer Models

    Jul 13, 2026Yuta Ishimoto, Paolo Arcaini, Fuyuki Ishikawa +3Transformer

  15. Infrared Organization and Critical Cognitive Field Formation in Transformer Dynamics

    Jul 12, 2026Byung Gyu ChaeTransformerNeural Network Training Dynamics

  16. When Data Imbalance Helps: Robust Generalization Through Shortcut Saturation

    Jul 11, 2026Cheng-Ting Chou, Duc Binh HoangClass-Imbalanced LearningTransformer

  17. MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers

    Jul 10, 2026Roberto Garcia, Jerry Liu, Ronny Junkins +3TransformerMemorization in Language Models

  18. Do Transformer Temporal Heads and Post-Pooling Motion Gates Help CorrNet-based CSLR? An Empirical Study

    Jul 10, 2026Lisi Wang, Zhidong Xiao, Jianjun PengTransformerSign Language Recognition

  19. COBART: Controlled, Optimized, Bidirectional and Auto-Regressive Transformer for Ad Headline Generation

    Jul 9, 2026Yashal Shakti Kanungo, Gyanendra Das, Pooja A +1TransformerOnline Advertising

  20. Bi-PT: Bidirectional Cross-Attention Point Transformers for Four-Chamber Heart Reconstruction from Sparse Cardiac MRI Data

    Jul 8, 2026Chenchuhui Hu, Shaoming Pan, Leon Axel +1Transformer3D Medical Imaging

  21. Dual Attention Heads for Personalized Federated Learning in ECG Classification

    Jul 7, 2026Kien Le, Joseph Lindley, Quoc Bao Phan +1TransformerElectrocardiogram Classification