Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Response-free item difficulty modelling for multiple-choice items with fine-tuned transformers: Component-wise representation and multi-task learning

    May 16, 2026Jan Netík, Patrícia MartinkováTransformerEducational Assessment

  2. Propagation of Chaos in Contextual Flow Maps

    May 16, 2026Shi Chen, Zhengjiang Lin, Kaizhao Liu +1TransformerGradient Descent Dynamics

  3. Learning How to Cube

    May 15, 2026Ferhat Erata, Sam Kouteili, Thanos Typaldos +4TransformerConstraint Satisfaction

  4. Multi-Headed Transformer Architectures as Time-dependent Wasserstein Gradient Flows

    May 15, 2026Alex Massucco, Leonardo Del Grande, Marcello Carioni +2TransformerWasserstein Gradient Flows

  5. A Retrieval-Enhanced Transformer for Multi-Step Port-of-Call Sequence Prediction in Global Liner Shipping

    May 15, 2026Yanzhao Su, Fang He, Yineng WangTransformerVessel Trajectory Prediction

  6. AOT-POT: Adaptive Operator Transformation for Large-Scale PDE Pre-training

    May 15, 2026Qitan Lv, Hong Wang, Zhongkai Hao +5TransformerPDE Operator Learning

  7. Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets

    May 15, 2026Kai Hidajat, Solden Stoll, Joseph AnNeural Network GeneralizationTransformer

  8. GiLT: Augmenting Transformer Language Models with Dependency Graphs

    May 15, 2026Tianyu Huang, Yida Zhao, Chuyan Zhou +1TransformerLanguage Modeling

  9. WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer

    May 14, 2026Caoliwen Wang, Minghao Guo, Siyuan Chen +13Neural Surrogate ModelingTransformer

  10. Ideology Prediction of German Political Texts

    May 14, 2026Sinclair Schneider, Florian Steuber, Joao A. G. Schneider +1TransformerPolitical Discourse Analysis

  11. Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology

    May 14, 2026Jesseba Fernando, Grigori GuitchountsDynamical SystemsTransformer

  12. Exploiting Pre-trained Encoder-Decoder Transformers for Sequence-to-Sequence Constituent Parsing

    May 13, 2026Daniel Fernández-González, Cristina Outeiriño CidTransformer

  13. Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise

    May 12, 2026Bo Long, Deepak Agarwal, Jelena Markovic-Voronov +2Bayesian FilteringTransformer

  14. Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision

    May 12, 2026Hongyu Gu, Jingwen FuTransformerProcess Supervision

  15. Quantifying Concentration Phenomena of Mean-Field Transformers in the Low-Temperature Regime

    May 11, 2026Albert Alcalde, Leon Bungert, Konstantin Riedl +1Transformer InferenceTransformer

  16. Masked Generative Transformer Is What You Need for Image Editing

    May 11, 2026Wei Chow, Linfeng Li, Xian Sun +14TransformerText-Guided Image Editing

  17. Uniform Scaling Limits in AdamW-Trained Transformers

    May 11, 2026William Gibson, Christoph ReisingerTransformerSelf-Attention

  18. DRIFT: Drift-Resilient Invariant-Feature Transformer for DGA Detection

    May 11, 2026Chaeyoung Lee, Chaeri Jung, Seonghoon JeongTransformerConcept Drift

  19. Rethinking Random Transformers as Adaptive Sequence Smoothers for Sleep Staging

    May 11, 2026Guisong Liu, Xin Gao, Martin Dresler +2Sleep Stage ClassificationTransformer

  20. Continuous Latent Contexts Enable Efficient Online Learning in Transformers

    May 11, 2026Emile Anand, Abdullah Ateyeh, Xinyuan Cao +1TransformerSequential Decision Making

  21. Probing Routing-Conditional Calibration in Attention-Residual Transformers

    May 11, 2026Wenhao Liang, Lin Yue, Wei Emma Zhang +4Post-Hoc CalibrationTransformer

  22. Spectral Transformer Neural Processes

    May 10, 2026Xianhe Chen, Hao Chen, Yingzhen LiTransformerNeural Processes

  23. The Transformer as a Polar State Estimator

    May 10, 2026Peter RacioppoTransformerLayer Normalization

  24. VORT: Adaptive Power-Law Memory for NLP Transformers

    May 9, 2026Nabil MlaikiMemory-Augmented Language ModelsTransformer

  25. Learning Theory of Transformers: Local-to-Global Approximation via Softmax Partition of Unity

    May 9, 2026Zhongjie Shi, Wenjing LiaoNeural Network GeneralizationTransformer