Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. GenGait: A Transformer-Based Model for Human Gait Anomaly Detection and Normative Twin Generation

    Apr 2, 2026Elisa Motta, Marta Lorenzini, Clara Mouawad +3Gait RecognitionGait Analysis

  2. Sampling at intermediate temperatures is optimal for training large language models in protein structure prediction

    Mar 31, 2026L. Ghiringhelli, A. Zambon, G. TianaProtein Structure PredictionTransformer Architectures

  3. ExFusion: Efficient Transformer Training via Multi-Experts Fusion

    Mar 30, 2026Jiacheng Ruan, Daize Dong, Xiaoye Qu +5Transformer ArchitecturesProgressive Attention Fusion

  4. When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

    Mar 27, 2026Juan Gabriel Kostelec, Qinghai GuoEffective DistillationSymbolic Distillation

  5. OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding

    Mar 25, 2026Xiaoyu Tang, Jun Dong, Jintao Cheng +1Remote SensingSequential Visual Localization

  6. A Two-stage Transformer Framework for Temporal Localization of Distracted Driver Behaviors

    Mar 22, 2026Gia-Bao Doan, Nam-Khoa Huynh, Minh-Nhat-Huy Ho +3Temporal Action LocalizationHuman Driving

  7. On the Ability of Transformers to Verify Plans

    Mar 20, 2026Yash Sarrof, Yupei Du, Katharina Stein +3Classical PlanningTransformer Architectures

  8. Dual Path Attribution: Efficient Attribution for SwiGLU-Transformers through Layer-Wise Target Propagation

    Mar 20, 2026Lasse Marten Jantsch, Dong-Jae Koh, Seonghyeon Lee +1Transformer AttentionTransformer Architectures

  9. Effective Distillation to Hybrid xLSTM Architectures

    Mar 16, 2026Lukas Hauzenberger, Niklas Schmidinger, Thomas Schmied +7Probe-Logit DistillationEffective Distillation

  10. MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Task-Conditioned Mixture-of-Experts Transformers

    Mar 16, 2026Kangjun Guo, Haichao Liu, Yanji Sun +3Bimanual ManipulationRobotic Manipulation

  11. Human-like Object Grouping in Self-supervised Vision Transformers

    Mar 14, 2026Hossein Adeli, Seoyoung Ahn, Andrew Luo +3Self-Supervised Vision TransformersSelf-Supervised Learning

  12. AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation

    Mar 13, 2026Xuanhua Yin, Chuanzhi Xu, Haoxian Zhou +2Diffusion TransformersImage Generation

  13. HiAP: A Multi-Granular Stochastic Auto-Pruning Framework for Vision Transformers

    Mar 12, 2026Andy Li, Aiden Durrant, Milan Markovic +1Self-Supervised Vision TransformersVision Transformer

  14. Feature-level Interaction Explanations in Multimodal Transformers

    Mar 4, 2026Yeji Kim, Housam Khalifa Bashier Babiker, Mi-Young Kim +1Cross-ModalDetection Transformer

  15. A novel network for classification of cuneiform tablet metadata

    Mar 4, 2026Frederik HagelskjærPoint CloudsHistorical Manuscripts

  16. Retrievit: In-context Retrieval Capabilities of Transformers, State Space Models, and Hybrid Architectures

    Mar 3, 2026Georgios Pantazopoulos, Malvina Nikandrou, Ioannis Konstas +1Transformer ArchitecturesPositional Encoding

  17. MetaOthello: A Controlled Study of Multiple World Models in Transformers

    Feb 26, 2026Aviral Chawla, Galen Hall, Juniper LovatoTransformer ArchitecturesWorld Models

  18. Transformers converge to invariant algorithmic cores

    Feb 26, 2026Joshua S. SchiffmanTransformer ArchitecturesAlgorithmic Cores

  19. Incremental Learning of Sparse Attention Patterns in Transformers

    Feb 22, 2026Oğuz Kaan Yüksel, Rodrigo Alvarez Lucendo, Nicolas FlammarionTransformer AttentionTransformer Architectures

  20. Context-aware Skin Cancer Epithelial Cell Classification with Scalable Graph Transformers

    Feb 17, 2026Lucas Sancéré, Noémie Moreau, Katarzyna BozekMelanomaWhole-Slide Images

  21. Universal priors: solving empirical Bayes via Bayesian inference and pretraining

    Feb 16, 2026Nick Cannella, Anzo Teh, Yanjun Han +1Empirical BayesBayesian Inference

  22. Language-Guided Transformer Tokenizer for Human Motion Generation

    Feb 9, 2026Sheng Yan, Yong Wang, Xin Du +2Human Motion GenerationTokenizer

  23. Revisiting the Shape Convention of Transformer Language Models

    Feb 6, 2026Feng-Ting Liao, Guan-Ting Yi, Tzu-Quan Lin +2Transformer ArchitecturesDeep Learning Architectures

  24. Poly-attention: a general scheme for higher-order self-attention

    Feb 2, 2026Sayak Chakrabarti, Toniann Pitassi, Josh AlmanLinear AttentionTransformer Architectures

  25. Plain Transformers are Surprisingly Powerful Link Predictors

    Feb 2, 2026Quang Truong, Yu Song, Donald Loveland +4Zero-Shot Link PredictionGraph Neural Networks

  26. Semi-supervised CAPP Transformer Learning via Pseudo-labeling

    Feb 1, 2026Dennis Gross, Helge Spieker, Arnaud Gotlieb +3Semi-Supervised LearningTransformer Architectures

  27. A Constrained Optimization Perspective of Unrolled Transformers

    Jan 24, 2026Javier Porras-Valenzuela, Samar Hadou, Alejandro RibeiroTransformer ArchitecturesConstrained Optimization

  28. Human Values in a Single Sentence: Moral Presence, Hierarchies, and Transformer Ensembles on the Schwartz Continuum

    Jan 20, 2026Víctor Yeste, Paolo RossoHuman ValuesMoral Reasoning

  29. TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

    Jan 5, 2026Binglei Li, Mengping Yang, Zhiyu Tan +2Diffusion TransformersTransformer Architectures

  30. Hidden State Poisoning Attacks against Mamba-based Language Models

    Jan 5, 2026Alexandre Le Mercier, Chris Develder, Thomas DemeesterHybrid Mamba-Transformer ModelAttacker Large Language Model

  31. SwinIFS: Landmark Guided Swin Transformer For Identity Preserving Face Super Resolution

    Jan 4, 2026Habiba Kausar, Saeed Anwar, Omar Jamal Hammad +1Generative Super-ResolutionBlind Face Restoration

  32. Flexible Gravitational-Wave Parameter Estimation with Transformers

    Dec 2, 2025Annalena Kofler, Maximilian Dax, Stephen R. Green +6Gravitational WavesCanada-France-Hawaii Telescope Data

  33. Harmonic-Percussive Disentangled Neural Audio Codec for Bandwidth Extension

    Nov 26, 2025Benoît Giniès, Xiaoyu Bie, Olivier Fercoq +1Neural Audio CodecsAudio Tokenizers

  34. Understanding the Staged Dynamics of Transformers in Learning Latent Structure

    Nov 24, 2025Rohan Saha, Farzane Aminmansour, Alona FysheTransformer ArchitecturesLanguage Modeling

  35. Equivalence of Context and Parameter Updates in Modern Transformer Blocks

    Nov 22, 2025Adrian Goldwaser, Michael Munn, Javier Gonzalvo +1Transformer ArchitecturesModel Weights

  36. You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

    Nov 9, 2025Amit LeVi, Raz Lapid, Rom Himelstein +3Post-Training QuantizationTransformer Architectures

  37. Controllably Efficient Language Models

    Nov 7, 2025Jatin Prakash, Aahlad Puli, Rajesh RanganathTransformer ArchitecturesLinear Attention

  38. A Unified Geometric Space for Topological Alignment Between Transformer-Based Models and Human Brain Networks

    Oct 28, 2025Silin Chen, Yuzhong Chen, Caiwei Wang +9Human Brain NetworksTransformer Attention

  39. Beyond Semantics: How Temporal Biases Shape Retrieval in Transformer and State-Space Models

    Oct 26, 2025Anooshka Bajaj, Deven Mahesh Mistry, Sahaj Singh Maini +2In-Context LearningLarge Language Model Memory

  40. Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task

    Oct 21, 2025Brady Bhalla, Honglu Fan, Nancy Chen +1Transformer ArchitecturesBehavioral Embeddings

  41. Scaling Vision Transformers for Functional MRI with Flat Maps

    Oct 15, 2025Connor Lane, Mihir Tripathy, Leema Krishna Murali +15Functional Magnetic Resonance ImagingVision Transformer

  42. Performance-Efficiency Tradeoffs in Transformers: An Approximation Theory Perspective

    Oct 4, 2025Ruoxi Yu, Haotian Jiang, Jingpu Cheng +3Transformer AttentionTransformer Architectures

  43. How Can Mamba Learn In Context with Outliers and Generalize Provably?

    Oct 1, 2025Hongkang Li, Songtao Lu, Xiaodong Cui +2Mamba-Based ModelsIn-Context Learning

  44. Test time training enhances in-context learning of nonlinear functions

    Sep 30, 2025Kento Kuwataka, Taiji SuzukiIn-Context LearningTest-Time Training

  45. Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge

    Sep 29, 2025Pengxiao Lin, Zheng-An Chen, Zhi-Qin John XuTransformer ArchitecturesMulti-Hop Reasoning

  46. HyMaTE: A Hybrid Mamba and Transformer Model for EHR Representation Learning

    Sep 28, 2025Md Mozaharul Mottalib, Thao-Ly T. Phan, Rahmatollah BeheshtiMedical World ModelHybrid Transformer

  47. Rotary Position Encodings for Graphs

    Sep 26, 2025Isaac Reid, Arijit Sehanobish, Cederik Höfs +7Positional EncodingTransformer Architectures

  48. Geometrically Constrained and Token-Based Probabilistic Spatial Transformers

    Sep 14, 2025Johann Schmidt, Tom Siegl, Martin Becker +1Spatio-Temporal TransformersTransformer Architectures