Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

    May 13, 2026Gergely Szilvasy, Manuel Faysse, Maria Lomeli +5Key-Value Cache CompressionKey-Value Cache

  2. Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

    May 13, 2026Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan TchamkertenTransformer ArchitecturesSubword Tokenization

  3. Z-Order Transformer for Feed-Forward Gaussian Splatting

    May 13, 2026Can Wang, Lei Liu, Wei Jiang +1Feed-Forward 3D Gaussian SplattingFeed-Forward 3D Gaussian

  4. A Neural Hierarchical-Matrix Preconditioner for Real-Time GPU Solves

    May 13, 2026Carl Osborne, Minghao Guo, Crystal Owens +1Spectral PreconditioningHigh-Performance Computing

  5. ECG-NAT: A Self-supervised Neighborhood Attention Transformer for Multi-lead Electrocardiogram Classification

    May 13, 2026Mahsa Gazeran, Sayvan Soleymanbaigi, Fatemeh Daneshfar +2Electrocardiogram ClassificationSelf-Supervised Learning

  6. Transformers Linearly Represent Highly Structured World Models

    May 13, 2026Roman Kniazev, Nathanaël FijalkowTransformer ArchitecturesCombinations

  7. Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise

    May 12, 2026Bo Long, Deepak Agarwal, Jelena Markovic-Voronov +2Transformer ArchitecturesBayesian Filtering

  8. Solve the Loop: Attractor Models for Language and Reasoning

    May 12, 2026Jacob Fein-Ashley, Paria RashidinejadLarge Language Model PretrainingTransformer Architectures

  9. Geometric Factual Recall in Transformers

    May 12, 2026Shauli Ravfogel, Gilad Yehudai, Joan Bruna +1Transformer ArchitecturesFactual Recall

  10. Recurrent Transformer-Based Near- and Far-Field THz Wideband Channel Estimation for UM-MIMO

    May 12, 2026Dmitry Artemasov, Alexander Shmatok, Kirill Andreev +3Channel EstimationBeamforming

  11. From Index to Equity: Pre-Training Transformers for Stock Return Prediction

    May 12, 2026Marie Soehl Coolsaet, Roberto Gallardo, Zhen GaoForecasting BackboneTransformer Architectures

  12. What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization

    May 12, 2026Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata +2Vision TransformerObject Localization

  13. Rethinking Positional Encoding for Neural Vehicle Routing

    May 12, 2026Chuanbo Hua, Federico Berto, Andre Hottung +8Vehicle Routing ProblemPositional Encoding

  14. On Privacy-Preserving Image Transmission in Low-Altitude Networks: A Swin Transformer-Based Framework with Federated Learning

    May 12, 2026Kexin Zhang, Lixin Li, Yuna Yan +5Unmanned Aerial VehiclesSemantic Communications

  15. Training-Inference Consistent Segmented Execution for Long-Context LLMs

    May 12, 2026Xianpeng Shang, Jiang Li, Zehua Duo +2Efficient Long-Context InferenceLLM Inference Optimization

  16. Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

    May 12, 2026Wenhao Chen, Sirui Sun, Shengyuan Bai +1Large Language Model AlignmentLarge Language Model Safety

  17. Variational Linear Attention: Stable Associative Memory for Long-Context Transformers

    May 11, 2026Vishal Pandey, Gopal SinghKimi Delta AttentionLinear Attention

  18. DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices

    May 11, 2026Chenyang Song, Weilin Zhao, Xu Han +3Mixture-Of-Experts ArchitecturesMixture-Of-Experts

  19. Quantifying Concentration Phenomena of Mean-Field Transformers in the Low-Temperature Regime

    May 11, 2026Albert Alcalde, Leon Bungert, Konstantin Riedl +1Transformer EncoderTransformer Architectures

  20. Uniform Scaling Limits in AdamW-Trained Transformers

    May 11, 2026William Gibson, Christoph ReisingerTransformer ArchitecturesHidden States

  21. DetRefiner: Model-Agnostic Detection Refinement with Feature Fusion Transformer

    May 11, 2026Soichiro Okazaki, Tatsuya Sasaki, Hiroki OhashiOpen-Vocabulary Object DetectionUnsupervised Detection

  22. DynGhost: Temporally-Modelled Transformer for Dynamic Ghost Imagings

    May 11, 2026Vittorio Palladino, Ahmet Enis CetinSingle-Photon Avalanche DiodeDetection Transformer

  23. MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers

    May 11, 2026Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu +2Self-Supervised Vision TransformersVision Transformer

  24. Simply Stabilizing the Loop via Fully Looped Transformer

    May 11, 2026Rao Fu, Zixuan Yang, Jiankun Zhang +4Transformer ArchitecturesLoop

  25. Robust Basis Spline Decoupling for the Compression of Transformer Models

    May 11, 2026Joppe De Jonghe, Van Tien Pham, Mariya IshtevaTensor DecompositionTransformer Architectures

  26. Attention Drift: What Autoregressive Speculative Decoding Models Learn

    May 11, 2026Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek +3Speculative DecodingDrafter

  27. Rethinking Random Transformers as Adaptive Sequence Smoothers for Sleep Staging

    May 11, 2026Guisong Liu, Xin Gao, Martin Dresler +2SleepSpatio-Temporal Transformers

  28. Dissecting Jet-Tagger Through Mechanistic Interpretability

    May 11, 2026Saurabh Rai, Sanmay GangulyMechanistic InterpretabilityInterpretability

  29. Continuous Latent Contexts Enable Efficient Online Learning in Transformers

    May 11, 2026Emile Anand, Abdullah Ateyeh, Xinyuan Cao +1In-Context LearningTransformer Architectures

  30. Probing Routing-Conditional Calibration in Attention-Residual Transformers

    May 11, 2026Wenhao Liang, Lin Yue, Wei Emma Zhang +4Post-HocTransformer Architectures

  31. The Association of Transformer-based Sentiment Analysis with Symptom Distress and Deterioration in Routine Psychotherapy Care

    May 11, 2026Douglas K. Faust, Peter Awad, Alexandre Vaz +1DepressionCognitive Behavioral Therapy

  32. Pretraining large language models with MXFP4 on Native FP4 Hardware

    May 11, 2026Musa Cim, Poovaiah Palangappa, Miro Hodak +3Large Language Model QuantizationFp8

  33. TokaMind for Power Grid: Cross-Domain Transfer from Fusion Plasma

    May 10, 2026JC Wu, Norton Lee, Kai Siang ChenPower SystemsTransformer Architectures

  34. Benchmarking Transformer and xLSTM for Time-Series Forecasting of Heat Consumption

    May 10, 2026Marja Wahl, Daniel R. Bayer, Sven Rausch +1Forecasting BackboneTime Series Forecasting

  35. Spatial-Frequency Gated Swin Transformer for Remote Sensing Single-Image Super-Resolution

    May 10, 2026Md Aminur Hossain, Parekh Valkesh, Ayush V. Patel +3Hyperspectral Image Super-ResolutionReal-World Image Super-Resolution

  36. Mixture of Layers with Hybrid Attention

    May 10, 2026Ivan Ternovtsii, Yurii BilakTransformer AttentionMixture-Of-Experts

  37. Spectral Transformer Neural Processes

    May 10, 2026Xianhe Chen, Hao Chen, Yingzhen LiTimestep EmbeddingsFrequency-Aware Regularization

  38. CTQWformer: A CTQW-based Transformer for Graph Classification

    May 10, 2026Zhan Li, Wuqing Yu, Yusen Wu +1Multiplex Graph TransformersGraph Neural Networks

  39. ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network

    May 10, 2026Qian Chen, Junqiao Zhao, Hongtu Zhou +4Soft Actor-CriticAction Chunks

  40. The Transformer as a Polar State Estimator

    May 10, 2026Peter RacioppoEnergy-Based TransformerTransformer Architectures

  41. Uncertainty-Aware Token Importance Estimation in Spiking Transformers

    May 10, 2026Wenxuan Liu, Zecheng Hao, Tong Bu +2Spatial TokensTransformer Architectures

  42. SHIELD: Scalable Optimal Control with Certification using Duality and Convexity

    May 9, 2026Hansung Kim, Siddharth H. Nair, Francesco BorrelliModel Predictive ControlOptimal Control

  43. Sparse Layers are Critical to Scaling Looped Language Models

    May 9, 2026Ryan Lee, Jacob Biloki, Edward J. Hu +1Transformer ArchitecturesLayer-Wise

  44. Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus

    May 9, 2026Mullosharaf K. ArabovPersianText Corpora

  45. VORT: Adaptive Power-Law Memory for NLP Transformers

    May 9, 2026Nabil MlaikiTransformer ArchitecturesPeak Memory