Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. How Do Transformers Learn to Represent Symmetries?

    Oct 7, 2026Eduardo Santos-Escriche, Valerie Engelmayer, Ya-Wei Eileen Lin +1Transformer Architectures

  2. Leaner Transformers Can Easily Learn to Cluster

    Oct 7, 2026Charlotte Park, Kenneth L. Clarkson, Lior Horesh +2Transformer ArchitecturesEquivariant Learning

  3. Universal interpolation for deep residual self-attention networks

    Oct 1, 2026Sibylle Marcotte, Joan BrunaTransformer ArchitecturesApproximation

  4. LAST: Looped Audio Spectrogram Transformer

    Oct 1, 2026Haider Al-Tahan, Sean O'Brien, Anastasia Razdaibiedina +1Neural AudioTransformer Architectures

  5. A foundation for systematic analysis of transformers and RNNs for tractography

    Oct 1, 2026Emmanuelle Renauld, Philippe Poulin, Hugo Larochelle +2Magnetic Resonance ImagingTransformer Architectures

  6. Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2

    Oct 1, 2026Yohan Chatelain, Pablo de Oliveira CastroFull-Precision PerformanceLanguage Model Perplexity

  7. Decision Titan: Test-Time Training for Long-Term Memory in Offline Reinforcement Learning

    Oct 1, 2026Jude Waide, Robert LieckTest-Time TrainingLong-Term Memory

  8. Learning Rate Transfer for Hybrid Transformer-SSM Architectures

    Oct 1, 2026Jimin Seo, Gyubok Lee, Yeonsik Jo +11Hybrid TransformerTransformer Architectures

  9. Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts

    Oct 1, 2026Di He, Pengxiang Li, Da Chang +3Mixture-Of-Experts Large Language ModelsMixture-Of-Experts

  10. Screw Attention: Rigid-Body Algebra Inside a Transformer

    Oct 1, 2026Aly MagassoubaRigid-Body DynamicsTransformer Architectures

  11. Machine Translation for Sign Languages

    Oct 1, 2026Ozge Mercanoglu Sincan, Anton Pelykh, Edward Fish +7Gloss-Free Sign Language TranslationSign Language Translation

  12. Lang3DSeg: Annotation-Free Open-Vocabulary 3D Segmentation with Point Transformers

    Oct 1, 2026Cigdem Kokenoz, Amir Salarpour, Alkim Domeke +5Open-Vocabulary 3D SegmentationInteractive 3D Segmentation

  13. Contextual trajectory and incremental contextual displacement: Towards using LLMs to understand dynamic, utterance-specific meaning construction

    Sep 30, 2026Grayson Wycliffe Storer, Julia Witte ZimmermanContextual EmbeddingsSingle Trajectory

  14. Attention Kernels for Learning Maps Between Heavy-Tailed Measures

    Sep 30, 2026Kailen Hargenrader, Edoardo Calvello, Bohan ChenTransformer AttentionLong-Tailed Distribution

  15. Scaling Laws for Looped Mixture of Experts

    Sep 30, 2026Yanbei Chen, Anirudh Goyal, Raghuraman KrishnamoorthiMixture-Of-ExpertsScaling Laws

  16. Shared Weights, Selected Computations: How Looped Transformers Route What Each Loop Does

    Sep 30, 2026Jiaju Wu, Yi Hu, Muhan ZhangTransformer ArchitecturesLoop

  17. FAST: Flow Any Scene Transformer

    Sep 30, 2026Yongjian Zhang, Longguang Wang, Zhuo Song +3Harder Better Faster Denser Feature MatchingRecent Vision Foundation Models

  18. Stable Transformers for Graph Generation

    Sep 30, 2026Luca Miglior, Alessio Gravina, Davide BacciuMultiplex Graph TransformersGenerative Models

  19. Effective Does Not Mean Useful: Conditional Functional Substitutability for Redundancy and Scaling in Transformers

    Sep 30, 2026Jiaheng Chen, Jiaxing Li, Yucheng Xiao +4RedundancyScaling

  20. Fiber-Resolved Microstructure Quantification from Multi-Shell Diffusion MRI using Detection Transformers

    Sep 30, 2026Sebastian Endt, Marcus Wirth, Johannes Reinhold Schlund +1Magnetic Resonance ImagingPorous Media

  21. dattri-LLM: A Unified and Efficient Library for Training Data Attribution at LLM Scale

    Sep 30, 2026Shixuan Liu, Tongli Zhou, Junwei Deng +2Large Language Model TrainingLarge Language Models(Llms

  22. Multi-Rate Bandwidth Extension by Token Completion in Neural Audio Codecs

    Sep 29, 2026Benoît Ginies, Olivier Fercoq, Gaël RichardNeural Audio CodecsAudio Tokenizers

  23. LoopVL: Recurrent Visual Intelligence

    Sep 29, 2026Zhe Qian, Ziyang Gong, Zhongxing Xu +9Recent Vision-Language ModelsTransformer Architectures

  24. Function-Space Transformer with Adaptive Anchors

    Sep 29, 2026Guorui Sang, Pedram RooshenasSpatio-Temporal TransformersFourier Neural Operators

  25. Pretraining Latent Information Feedback Transformers with Teacher Supervision

    Sep 29, 2026Dor Tirosh, Ido Amos, Mor GevaTransformer ArchitecturesPretraining

  26. DIET: Deletion-response Expert Trimming for Video Diffusion Transformers

    Sep 29, 2026Jiachang Zhang, Teng Hu, Bohao Feng +4Transformer ArchitecturesDeletion

  27. The Geometry of Inference in Transformer Residual Streams

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer Residual StreamsTransformer Architectures

  28. Pixel-Level Transformers in Remote Sensing: A Canopy Height Case Study

    Sep 29, 2026Sven Ligensa, Jan Pauls, Karsten Schrödter +2CanopyRemote Sensing

  29. Predictive Geometry of Hidden Trajectories in Transformers

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Tatiana Petrova +1Transformer EncoderTransformer Architectures

  30. Procedural Core: A Compact Recurrent Initialization for Vision Transformers

    Sep 29, 2026Zachary Shinnick, Christian Internò, Hemanth Saratchandran +2Transformer ArchitecturesImagenet

  31. TomoTransformer: Towards a Foundation Model for CT Reconstruction

    Sep 29, 2026AmirEhsan Khorashadizadeh, Benjamín BéjarCone-Beam Computed TomographySparse-View

  32. EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception

    Sep 29, 2026Yaoxin Niu, Zhangquan Chen, Yang Zhang +5Self-Supervised Vision TransformersFine-Grained Perception

  33. RVQ Position Aware Speculative Decoding for On Device Text to Speech

    Sep 29, 2026Berkin Durmus, Eduardo Pacheco, Zach Nagengast +1Autoregressive Text-To-SpeechAutoregressive Decoding

  34. Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

    Sep 29, 2026Zehao Jin, Ruixuan Deng, Junran WangTransformer ArchitecturesGenerative Pretrained Transformers

  35. The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization

    Sep 29, 2026Benoit Dherin, Michael Munn, Xavier Gonzalvo +14Safety ClaimsInstruction Tuning

  36. LoopICL: Looping a single transformer block to solve tabular tasks

    Sep 28, 2026Amir Rezaei Balef, Katharina EggenspergerTabular Foundation ModelsTransformer Architectures

  37. Causal and Interpretable Structures in LLM Compositional Tasks

    Sep 28, 2026Gurbir Arora, Toni J. B. Liu, Jiajun Bao +2Next-Token PredictionTransformer Architectures

  38. How to Loop MoE: Flatten the Experts, Untie the Attention

    Sep 28, 2026Shouren Wang, Chuang Ma, Mohsen Hariri +6Mixture-Of-ExpertsExperts

  39. Improving Test-Time Scaling with Adaptive Looped Transformers

    Sep 28, 2026Yichen You, Tianyu Fu, Aosong Feng +4Transformer ArchitecturesTest-Time Scaling

  40. Copy the Same, Distill the Difference: Initializing Linear Vision Transformers

    Sep 28, 2026Huaiyuan Qin, Muli Yang, Gabriel James Goenawan +9Self-Supervised Vision TransformersTransformer Architectures

  41. Which the Eye Fears: Writing with Read-Blindness Explains Massive Activations in Transformers

    Sep 28, 2026Swagatam Mukhopadhyay, Vishal Vivek Saley, Vraj Parikh +1Transformer ArchitecturesResidual Stream

  42. Attention Graphons: A Graph Limit Perspective on Graph Transformers

    Sep 28, 2026Caio F. Deberaldini Netto, Moshe Eliasof, Luana RuizInterleaved Graph AttentionTransformer Attention

  43. Revisiting Risky Tackle Detection with Vision Transformers

    Sep 28, 2026Syed Ahsan Masud Zaidi, Lior Shamir, Scott DietrichSelf-Supervised Vision TransformersVision Transformer

  44. Scaffold Then Internalize: Representation Injection for Diffusion Transformers

    Sep 28, 2026Han Fu, Jiacheng Chen, Baoquan Zhao +4Diffusion TransformersTransformer Architectures

  45. Small transformers track Bayesian evidence for latent common causes via a context-invariant mechanism

    Sep 28, 2026Amir Mohammadpour, Michael FrankeTransformer ArchitecturesSmall Models

  46. Universality and Generalization of Causal Transformers Across Context Lengths

    Sep 28, 2026Takashi Furuya, Maarten V. de Hoop, Gabriel PeyréTransformer ArchitecturesRegularity

  47. From Attention Sensitivity to Layer Role: Revisiting Mixed-Precision Quantization of Transformers

    Sep 28, 2026Nafiseh HosseinpourFardi, Negar Alihadi, Mahmoudreza Babaei +2Post-Training QuantizationMixed-Precision Quantization

  48. Shallow Queries, Mature Values: Depth-Asynchronous Self-Speculation for Looped Transformers

    Sep 28, 2026Guanghao Li, Zihan Su, Hao Yu +6Speculative DecodingSelf-Speculative

  49. ZonoGPT: Towards An Abstract Domain for Verifying Large GPT Models

    Sep 28, 2026Hai Duong, Thanh Le, ThanhVu NguyenGenerative Pretrained TransformersTransformer Architectures

  50. Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Jifeng Hu +5Model-Based Reinforcement LearningQ-Learning

  51. MegaGraph: Towards Efficient Training of Large-Scale Graph Transformers with Automated Hybrid Parallelism

    Sep 28, 2026Tong Qiao, Ao Zhou, Yingjie Qi +2Multiplex Graph TransformersCpu-Gpu Hybrid Designs

  52. Query Expansion and Key Specialization in Transformer Attention Geometry

    Sep 28, 2026Vidit Gupta, Siddhesh Nadkarni, Mihik Chaudhari +2Transformer AttentionTransformer Architectures

  53. Validating Memory-Optimal Transformer Kernels on Real Hardware: From Formal Derivation to Measured Performance Across Two HPC Clusters

    Sep 27, 2026Lenore M. Mullin, Gaetan HainsGraphics Processing Unit ResourcesHigh-Performance Computing

  54. Residual-Stream Burden Shapes Representation Learning in Diffusion Transformers

    Sep 27, 2026Tongtong Liang, Siqi Kou, Ziqiao Xi +6Diffusion TransformersTransformer Residual Streams

  55. EAT: Expert Account Tracker for Efficient MoE Inference

    Sep 27, 2026Yuexian Li, Yifei Yang, Zouying Cao +1Mixture-Of-ExpertsExperts

  56. Pretraining Transformers with Quantized Softmax in Attention

    Sep 27, 2026Shangzhen Zhu, Muyan Hu, Tomasz KozlowskiTransformer AttentionGumbel-Softmax Relaxation

  57. Approximating Softmax in Pretrained LLMs: Model Sensitivity and Kernel Acceleration

    Sep 27, 2026Shangzhen Zhu, Muyan Hu, Tomasz KozlowskiGumbel-Softmax RelaxationTransformer Architectures