Transformer

Momentum

26 papers in the last four weeks, up 44% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 351

All topics
CardsList
  1. Enhancing Transformer Representations of Symbolic ODE Expressions

    Sep 21, 2026Xiyue Fan, Adam Prugel-Bennett, Stuart E. MiddletonTransformerPositional Encoding

  2. Design of the IBM Granite 5.0 TurboCTC ASR Model

    Sep 17, 2026Brian Kingsbury, George Saon, Masayuki Suzuki +5TransformerAutomatic Speech Recognition

  3. TIO-Former: Ultra-Lightweight 6-Directional ToF-Inertial Odometry for Nano-UAVs via a Streaming Causal Transformer

    Sep 15, 2026Yang Liu, Yifan He, Wenhao Zhao +9Inertial OdometryTransformer

  4. Investigating Temporal Motion Features for Pose-to-Text Indian Sign Language Translation

    Sep 14, 2026Manav Dhamecha, Praveen Kumar Chandaliya, Pruthwik MishraSign Language TranslationTransformer

  5. Type Diversity Enables Transformers to Generalise Compositionally

    Sep 14, 2026Anssi Moisio, Mathias Creutz, Mikko KurimoTransformerSemantic Parsing

  6. A New Transformer-Based Approach for Audio-Based Kinship Verification and a New Uncontrolled Mandarin Kinship Speech Dataset

    Sep 12, 2026Qiyang Sun, Langqing Zhang, Yupei Li +1Transformer

  7. "Transforming" LHCb: self-supervised maps of heavy-flavour decays

    Sep 8, 2026Marko Stamenkovic, Greg LandsbergTransformerSelf-Supervised Learning

  8. Disentangled Global-Local Feature Learning with E-Branchformer for Audio Deepfake Detection

    Sep 8, 2026Phuong Tuan Dat, Ho Bao Thu, Nguyen Tran Trung +2Audio Deepfake DetectionTransformer

  9. Length Generalization for Transformers via Compression

    Sep 8, 2026Georg Zetzsche, Hongjian Jiang, Andy Yang +4Transformer ExpressivityTransformer

  10. Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers

    Sep 8, 2026Amit Ben-Artzy, Roy SchwartzTransformerRepresentation Geometry in Language Models

  11. oHC: Orthogonal Hyper-Connections on SO(4) via Quaternions

    Sep 2, 2026Haoqiang Guo, Xuyi Chen, Bo Ke +5Hyper-ConnectionsTransformer

  12. If It Moves, Radar Knows: A Physics-Aware Radar Transformer for Class-Agnostic Moving-Object Detection

    Sep 2, 2026Yinghao Sun, Shuguang Li, Jinliang Shao +1Object DetectionAutonomous Driving

  13. OR-Transformer: Scaling Real-Time Decision-Making to 1,000 Items

    Sep 1, 2026Shuze Daniel Liu, David Simchi-Levi, Claire Chen +2Inventory ControlTransformer

  14. One-Layer Transformer Provably Learns Multiclass One-Nearest Neighbor in Context

    Sep 1, 2026Skanda Athreya, Yutong WangTransformerIn-Context Learning

  15. Can LLMs Use Relational Transformer Embeddings?

    Aug 31, 2026Francisco Galuppo Azevedo, Clarissa Lima LouresTransformerLLM Fine-Tuning

  16. Transformer-Based Flow Shop Scheduling Using MILP-Generated Training Data

    Aug 30, 2026Roderich WallrathTransformerCombinatorial Optimization

  17. TANGO: Treating Tokens as Operators

    Aug 22, 2026Joshua NunleyTransformer FFNsTransformer

  18. Algebraic Decomposition Theory for Transformer Length Generalization

    Aug 13, 2026Andy Yang, Blerta Veseli, Corentin Barloy +5TransformerLength Generalization

  19. Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing

    Aug 13, 2026Sheng Ren, Yadong Wang, Naiqiang Tan +7TransformerLayer Normalization

  20. Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

    Aug 10, 2026Amanda Bertsch, Luca Soldaini, Matthew R. Gormley +4TransformerLong-Context Language Modeling

  21. Training-Free Universal Approximation by Prompting Random Transformers

    Aug 10, 2026Alexander Hsu, Rongjie LaiTransformer ExpressivityPrompt Learning

  22. MixFormer: Linear Transformer with Mixture of Memory Experts

    Aug 10, 2026Yu Guo, Lei DuanMemory-Augmented Neural NetworksTransformer

  23. Why Post-Norm Transformers Collapse: Attention Amplification and Gradient Repair Failure

    Aug 10, 2026Xingjian Wang, Qingyu Han, Xiaodong Luo +1TransformerSelf-Attention

  24. Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

    Aug 7, 2026Ali Janati, Kaoutar El Maghraoui, Anass BelfatmiTransformerMuon Optimizer