Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. Cascade Token Selection for Transformer Attention Acceleration

    May 4, 2026Stephen J. ThomasTransformer AttentionLinear Attention

  2. Gated Subspace Inference for Transformer Acceleration

    May 4, 2026Stephen J. ThomasTransformer ArchitecturesSubspace

  3. Trust, but Verify: Peeling Low-Bit Transformer Networks for Training Monitoring

    May 4, 2026Arian Eamaz, Farhang Yeganegi, Mojtaba SoltanalianLayer-WiseTransformer Architectures

  4. Edge-Efficient Image Restoration: Transformer Distillation into State-Space Models

    May 4, 2026Srinivas Soumitri Miriyala, Sowmya Vajrala, Sravanth Kodavanti +2Image RestorationHybrid Transformer

  5. Linearizing Vision Transformer with Test-Time Training

    May 4, 2026Yining Li, Dongchen Han, Zeyu Liu +3Self-Supervised Vision TransformersVision Transformer

  6. Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

    May 4, 2026Jatin Bhusal, Salma TamangGloss-Free Sign Language TranslationSign Language Translation

  7. Elastic Spiking Transformers for Efficient Gesture Understanding

    May 4, 2026Alberto Ancilotto, Gianluca Amprimo, Stefano Di Carlo +1Spiking Neural NetworksNeuromorphic Computing

  8. A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures

    May 4, 2026Mullosharaf K. ArabovMultilingual Language ModelsTranscription

  9. Projection-Free Transformers via Gaussian Kernel Attention

    May 4, 2026Debarshi Kundu, Archisman Ghosh, Swaroop Ghosh +1Transformer AttentionTransformer Architectures

  10. QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL

    May 3, 2026Xing Lei, Jincheng Wang, Xuetao Zhang +1Goal-Conditioned Reinforcement LearningSequence Modeling

  11. SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages

    May 3, 2026Sen Fang, Hongbin Zhong, Yanxin Zhang +1Sign Language TranslationSign

  12. Mesh Based Simulations with Spatial and Temporal awareness

    May 2, 2026Paul Garnier, Vincent Lannelongue, Elie HachemComputational Fluid DynamicMesh Generation

  13. CGFformer: Cluster-Guidance Frequency Transformer for Pansharpening

    May 2, 2026Zijian Zhou, Jianing Zhang, Kai Sun +3Two-Level Spatial-Frequency Fusion StrategyHyperspectral Image

  14. CNN-based Multi-In-Multi-Out Model for Efficient Spatiotemporal Prediction

    May 2, 2026Hyeonseok JinSpatiotemporal PredictionConvolutional Neural Networks

  15. Zero-Shot Signal Temporal Logic Planning with Disjunctive Branch Selection in Dynamic Semantic Maps

    May 2, 2026Bowen Ye, Ancheng Hou, Junyue Huang +2Signal Temporal LogicObstacle Avoidance

  16. Focus and Dilution: The Multi-stage Learning Process of Attention

    May 2, 2026Zheng-An Chen, Pengxiao Lin, Zhi-Qin John Xu +1Transformer AttentionTransformer Architectures

  17. MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

    May 2, 2026Ke Qiu, Yawen Qin, Tianzhi Jia +3Co-Speech Gesture GenerationTransformer Architectures

  18. PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

    May 1, 2026Ravi Ranjan, Utkarsh Grover, Xiaomin Lin +1FeedbackPersonalization

  19. Component-Aware Self-Speculative Decoding in Hybrid Language Models

    May 1, 2026Hector Borobia, Elies Seguí-Mas, Guillermina Tormo-CarbóSpeculative DecodingTransformer Architectures

  20. Reconstructing conformal field theoretical compositions with Transformers

    May 1, 2026Haotian Cao, Garrett Merz, Kyle Cranmer +1Conformal SelectionTransformer Architectures

  21. LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference

    May 1, 2026Shashank Kapadia, Deep Naryan Mishra, Sujal Reddy Alugubelli +4Transformer ArchitecturesResidual Distillation

  22. E2^2DT: Efficient and Effective Decision Transformer with Experience-Aware Sampling for Robotic Manipulation

    Apr 30, 2026Kaiyan Zhao, Borong Zhang, Yiming Wang +4Scalable Robot LearningRobotic Manipulation

  23. Explainable Load Forecasting with Covariate-Informed Time Series Foundation Models

    Apr 30, 2026Matthias Hertel, Alexandra Nikoltchovska, Sebastian Pütz +3Accurate Short-Term Electricity Load ForecastingTime Series Foundation Models

  24. Hierarchical Fault Detection and Diagnosis for Transformer Architectures

    Apr 30, 2026Sigma Jahan, Saurabh Singh Rajput, Tushar Sharma +1Fault DiagnosisTransformer Architectures

  25. Sampling two-dimensional spin systems with transformers

    Apr 30, 2026Piotr Białas, Piotr Korcyl, Tomasz Stebel +2Spatial Photonic Ising MachinesAccelerated Sampling

  26. ZAYAN: Disentangled Contrastive Transformer for Tabular Remote Sensing Data

    Apr 30, 2026Al Zadid Sultan Bin Habib, Tanpia Tasnim, Md. Ekramul Islam +1Tabular LearningRemote Sensing

  27. Beyond the Training Distribution: Mapping Generalization Boundaries in Neural Program Synthesis

    Apr 30, 2026Henrik Voigt, Michael Habeck, Joachim GiesenImproved GeneralizationSynthetic Task

  28. Sentiment Analysis of AI Adoption in Indonesian Higher Education Using Machine Learning and Transformer-Based Models

    Apr 30, 2026Happy Syahrul Ramadhan, Ahmad Sahidin Akbar, Karin Yehezkiel Sinaga +3SentimentStudent

  29. Learning Rate Transfer in Normalized Transformers

    Apr 29, 2026Boris Shigida, Boris Hanin, Andrey GromovBatchTransformer Architectures

  30. Stochastic Scaling Limits and Synchronization by Noise in Deep Transformer Models

    Apr 29, 2026Andrea Agazzi, Giuseppe Bruno, Eloy Mosig García +2Transformer ArchitecturesStochastic Differential Equations

  31. Exploring the Potential of Probabilistic Transformer for Time Series Modeling: A Report on the ST-PT Framework

    Apr 29, 2026Zhangzhi Xiong, Haoyi Wu, You Wu +3Time SeriesSpatio-Temporal Transformers

  32. Zero-Shot to Full-Resource: Cross-lingual Transfer Strategies for Aspect-Based Sentiment Analysis

    Apr 29, 2026Jakob Fehle, Nils Constantin Hellwig, Udo Kruschwitz +1Cross-Lingual TransferSentiment

  33. Star-Fusion: A Multi-modal Transformer Architecture for Discrete Celestial Orientation via Spherical Topology

    Apr 29, 2026May Hammad, Menatallh HammadMultiple Satellite SystemsSpatio-Temporal Transformers

  34. Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning

    Apr 29, 2026Weihang Li, Jianchun Liu, Hongli XuParameter-Efficient Fine-Tuning MethodsMixture-Of-Experts

  35. Robustness of Transformer-Based Fluence Map Prediction Under Clinically Realistic Perturbations

    Apr 28, 2026Ujunwa Mgboh, Rafi Ibn Sultan, Joshua Kim +2RadiotherapyTransformer Architectures

  36. PPG-Based Affect Recognition with Long-Range Deep Models: A Measurement-Driven Comparison of CNN, Transformer, and Mamba Architectures

    Apr 28, 2026Karim Alghoul, Hussein Al Osman, Abdulmotaleb El SaddikAffective ComputingConvolutional Neural Networks

  37. Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models

    Apr 28, 2026Ajmain Inqiad Alam, Palash Roy, Chanchal K. Roy +2Large Language Model CompressionData Compression Methods

  38. Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

    Apr 28, 2026Oliver Kraus, Yash Sarrof, Yuekun Yao +2Transformer ArchitecturesChain-of-Thought Reasoning

  39. Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer

    Apr 28, 2026Penghao Kuang, Haoyi Wu, Kewei TuTransformer ArchitecturesHyperparameter

  40. Transformer Approximations from ReLUs

    Apr 27, 2026Jerry Yao-Chieh Hu, Mingcheng Lu, Yi-Chen Lee +1Gumbel-Softmax RelaxationRectified Linear Unit

  41. SolarTformer: A Transformer Based Deep Learning Approach for Short Term Solar Power Forecasting

    Apr 27, 2026Ankan Basu, Jyotiraditya Roy, Aditya Datta +2Energy ForecastingPhotovoltaic

  42. PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

    Apr 27, 2026Laurenz Reichardt, Nikolas Ebert, Oliver WasenmüllerPoint Clouds3D Perception

  43. ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers

    Apr 26, 2026Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao +1Kimi Delta AttentionGumbel-Softmax Relaxation

  44. Rank, Head-Channel Non-Identifiability, and Symmetry Breaking: A Precise Analysis of Representational Collapse in Transformers

    Apr 26, 2026Giansalvo CirrincioneMulti-Head AttentionTransformer Architectures

  45. Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices

    Apr 26, 2026Dawon Choi, Hana Kim, Ji-Hoon KimBatch NormalizationGumbel-Softmax Relaxation