Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. Learning Theory of Transformers: Local-to-Global Approximation via Softmax Partition of Unity

    May 9, 2026Zhongjie Shi, Wenjing LiaoTransformer ArchitecturesSpatio-Temporal Transformers

  2. Transformers Can Implement Preconditioned Richardson Iteration for In-Context Gaussian Kernel Regression

    May 8, 2026Mingsong Yan, Dongyang Li, Charles Kulick +1Kernel Ridge RegressionTransformer Attention

  3. Context-Gated Associative Retrieval: From Theory to Transformers

    May 8, 2026Moulik Choraria, Argyrios Gerogiannis, Vidhata Jayaraman +2Dense Associative MemoryIn-Context Learning

  4. When Attention Beats Fourier: Multi-Scale Transformers for PDE Solving on Irregular Domains

    May 8, 2026Brandon Yee, Pairie Koh, Jack Rodriguez +1Partial Differential EquationsFourier

  5. NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

    May 8, 2026Wen Huang, Haoran Sun, Yongjian Guo +8Efficient World-Action ModelWorld Models

  6. FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast

    May 8, 2026Wenhao Wu, Zishan Shao, Kangning Cui +5Singular Value DecompositionLarge Language Model Compression

  7. Training-Induced Escape from Token Clustering in a Mean-Field Formulation of Transformers

    May 8, 2026Noboru Isobe, Daisuke Inoue, Masaaki ImaizumiTransformer AttentionTransformer Architectures

  8. Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

    May 8, 2026Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo +3Large Language Model MemoryRecurrent Model

  9. Encoder-Decoder Transformers: Logical Characterizations and Periodicity

    May 8, 2026Veeti Ahvonen, Damian Heiman, Antti Kuusisto +2Transformer EncoderTransformer Architectures

  10. Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

    May 8, 2026Jin Xu, Camille Couturier, Victor Rühle +2Transformer ArchitecturesMulti-Head Attention

  11. Dynamic Mode Decomposition along Depth in Vision Transformers

    May 8, 2026Nishant Suresh Aswani, Saif Eddin JabariSelf-Supervised Vision TransformersVision Transformer

  12. Approximation Error Upper and Lower Bounds for Hölder Class with Transformers

    May 8, 2026Xin He, Yuling Jiao, Xiliang Lu +1Transformer ArchitecturesApproximation

  13. Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning

    May 8, 2026Zixuan Xie, Xinyu Liu, Claire Chen +3In-Context LearningLinear Attention

  14. Spectrum-Adaptive Generalization Bounds for Trained Deep Transformers

    May 8, 2026Mana Sakai, Masaaki ImaizumiTransformer ArchitecturesGeneralization Bounds

  15. TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts

    May 8, 2026Jeimin Jeon, Hyunju Lee, Bumsub HamSelf-Supervised Vision TransformersHip-Lora

  16. Attention Transfer Is Not Universally Effective for Vision Transformers

    May 8, 2026Huaiyuan Qin, Muli Yang, Gabriel James Goenawan +4Self-Supervised Vision TransformersVision Transformer

  17. SAFformer:Improving Spiking Transformer via Active Predictive Filtering

    May 8, 2026Zequan Xie, Weiming Zeng, Yunhua Chen +3Spiking Neural NetworksTransformer Architectures

  18. When Symbol Names Should Not Matter: A Logistic Theory of Fresh-Symbol Classification

    May 8, 2026Wenjie Guan, Jelena BradicSymbol-Transformer Architectures

  19. LoopQ: Quantization for Recursive Transformers

    May 8, 2026Rui Fang, Hsi-Wen Chen, Ming-Syan ChenPost-Training QuantizationTransformer Architectures

  20. ProtSent: Protein Sentence Transformers

    May 7, 2026Dan Ofer, Oriel Perets, Michal Linial +1Language ModelingTransformer Architectures

  21. Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent

    May 7, 2026Chenyang Zhang, Yuan CaoIn-Context LearningTransformer Architectures

  22. Is One Layer Enough? Understanding Inference Dynamics in Tabular Foundation Models

    May 7, 2026Amir Rezaei Balef, Mykhailo Koshil, Katharina EggenspergerTabular Foundation ModelsTransformer Architectures

  23. Patch-Effect Graph Kernels for LLM Interpretability

    May 7, 2026Ruben Fernandez-Boullon, David N. OlivieriMechanistic InterpretabilityTransformer Architectures

  24. Federation of Experts: Communication Efficient Distributed Inference for Large Language Models

    May 7, 2026Muhammad Shahir Abdurrahman, Chun Deng, Azalia Mirhoseini +1Transformer ArchitecturesToken Embeddings

  25. Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking

    May 7, 2026Shiao Wang, Xiao Wang, Duoqing Yang +5Multi-Object TrackingSelf-Supervised Vision Transformers

  26. Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

    May 7, 2026Yongyi Wang, Hanyu Liu, Lingfeng Li +6Transformer ArchitecturesSequence Modeling

  27. Transformer-Based Wildlife Species Classification from Daily Movement Trajectories

    May 7, 2026Obed Irakoze, Prasenjit MitraSpecies IdentificationSpecies

  28. Training Transformers for KV Cache Compressibility

    May 7, 2026Yoav Gelberg, Yam Eitan, Michael Bronstein +2Key-Value Cache CompressionEfficient Long-Context Inference

  29. Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement

    May 7, 2026Haodong Liang, Lifeng LaiOffline Reinforcement LearningIn-Context Learning

  30. HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

    May 7, 2026Chengda Lu, Xiaoyu Fan, Wei XuLLM Inference OptimizationCognitive Load

  31. Distributional Spectral Diagnostics for Localizing Grokking Transitions

    May 7, 2026Ziyue Wang, Yufeng Ying, Takafumi KanamoriGrokkingTransformer Residual Streams

  32. Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning

    May 6, 2026William T. Redman, Erik C. Johnson, Brian RobinsonTransformer ArchitecturesReplay-Based Continual Learning

  33. On Semantic Loss Fine-Tuning Approach for Preventing Model Collapse in Causal Reasoning

    May 6, 2026Pratik Deshmukh, Atirek GuptaCausal ReasoningCollapse

  34. Taming Outlier Tokens in Diffusion Transformers

    May 6, 2026Xiaoyu Wu, Yifei Wang, Tsu-Jui Fu +3Diffusion TransformersVisual Tokenizers

  35. Understanding In-Context Learning for Nonlinear Regression with Transformers: Attention as Featurizer

    May 6, 2026Alexander Hsu, Zhaiming Shen, Wenjing Liao +1In-Context LearningTransformer Architectures

  36. Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts

    May 6, 2026Klaus-Rudolf Kladny, Maximilian Mordig, Bernhard Schölkopf +1Mixture-Of-ExpertsLarge Language Model Routing

  37. On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference

    May 6, 2026Zhengyi Li, Yakai Wang, Kang Yang +6Transformer ArchitecturesLLM Defense Mechanisms

  38. Anticipating Innovation Using Large Language Models

    May 6, 2026Enrico Maria Fenoaltea, Filippo Santoro, Giordano De Marzo +2TechnologyLarge Language Model Forecasting

  39. Gyan: An Explainable Neuro-Symbolic Language Model

    May 6, 2026Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu +1Large Language Model PretrainingTransformer Architectures

  40. Average Attention Transformers and Arithmetic Circuits

    May 6, 2026Lena Ehrmuth, Laura StriekerTransformer AttentionTransformer Encoder

  41. Learning the Channel Gain from Anywhere to Anywhere via Cross-environment Transformer Estimators

    May 6, 2026Prasenjit Dhara, Daniel RomeroChannel ModelingSpatio-Temporal Transformers

  42. FLUID: Continuous-Time Hyperconnected Sparse Transformer for Sink-Free Learning

    May 6, 2026Waleed Razzaq, Yun-Bo ZhaoTransformer ArchitecturesReplay-Based Continual Learning

  43. The Scaling Properties of Implicit Deductive Reasoning in Transformers

    May 5, 2026Enrico Vompa, Tanel TammetTransformer ArchitecturesDeduction

  44. UniCorrn: Unified Correspondence Transformer Across 2D and 3D

    May 5, 2026Prajnan Goswami, Tianye Ding, Feng Liu +1Point Clouds3D Generation

  45. Feature-Augmented Transformers for Robust AI-Text Detection Across Domains and Generators

    May 5, 2026Mohamed Mady, Johannes Reschke, Björn SchullerMachine-Generated Text DetectionBert-Based Models

  46. Transformers with Selective Access to Early Representations

    May 5, 2026Skye Gunasekaran, Téa Wright, Rui-Jie Zhu +1Transformer ArchitecturesEarly Layers

  47. Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers

    May 5, 2026Hao Yan, Haolin Yang, Yiqiao ZhongTransformer Architectures

  48. Disentangling Shared and Task-Specific Representations from Multi-Modal Clinical Data

    May 5, 2026He Lyu, Huolin Zeng, Junren Wang +7Multimodal Clinical DataTransformer Architectures

  49. Benchmarking Logistic Regression, SVM, Naive Bayes, and IndoBERT Fine-Tuning for Sentiment Analysis on Indonesian Product Reviews

    May 5, 2026Nabila Zakiyah Zahra, Salwa Farhanatussaidah, Nasywa Nur Afifah +3Term Frequency-Inverse Document FrequencyIndonesian E-Commerce Reviews