Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. Symmetry-Aware Transformer Training for Automated Planning

    Aug 11, 2025Markus Fritzsche, Elliot Gestrin, Jendrik SeippClassical PlanningTransformer Architectures

  2. Large Language Models Transform Organic Synthesis From Reaction Prediction to Automation

    Aug 7, 2025Kartar Kumar, Rajesh Kumar, Nikesh LagunLarge Language Model WorkflowsReaction

  3. Modelling Adjectival Modification Effects on Semantic Plausibility

    Jul 29, 2025Anna Golub, Beate Zywietz, Annerose EichelPhysical PlausibilityTransformer Architectures

  4. A Systematic Analysis of Hybrid Linear Attention

    Jul 8, 2025Dustin Wang, Rui-Jie Zhu, Steven Abreu +9Kimi Delta AttentionTransformer Architectures

  5. GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers

    Jun 13, 2025Guang Liang, Xinyao Liu, Jianxin WuQuantization-Aware TrainingSelf-Supervised Vision Transformers

  6. FPTQuant: Function-Preserving Transforms for LLM Quantization

    Jun 5, 2025Boris van Breugel, Yelysei Bondarenko, Paul Whatmough +1Large Language Model QuantizationTransformer Architectures

  7. LlamaSeg: Image Segmentation via Autoregressive Mask Generation

    May 26, 2025Jiru Deng, Tengjin Weng, Tianyu Yang +3Visual Autoregressive ModelsAutoregressive Generation

  8. Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition

    May 25, 2025Xiaoyang Liu, Bolin Qiu, Zheng Chen +5Image RestorationWavelets

  9. Quick ViTs: Speeding up Vision Transformers through Equivariance

    May 21, 2025David Nordström, Johan Edstedt, Fredrik Kahl +1Self-Supervised Vision TransformersVision Transformer

  10. Predicting Estimated Times of Restoration for Electrical Outages Using Longitudinal Tabular Transformers

    May 1, 2025Bogireddy Sai Prasanna Teja, Valliappan Muthukaruppan, Carls BenjaminRestorationTransformer Architectures

  11. The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs

    Apr 24, 2025Piotr Nawrot, Robert Li, Renjie Huang +3Dynamic Sparse AttentionTransformer Attention

  12. Numerical stability analysis of large language models

    Mar 13, 2025Stanislav Budzinskiy, Wenyi Fang, Longbin Zeng +1Transformer ArchitecturesFull-Precision Performance

  13. Fewer yet critical: Reducing Redundant Token Dependencies for Transformer-based Time Series Forecasting

    Mar 10, 2025Jianqi Zhang, Yuchan Liu, Zeen Song +2Forecasting BackboneTransformer Architectures

  14. LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of Transformers

    Feb 20, 2025Anton Razzhigaev, Matvey Mikhalchuk, Temurbek Rahmatullaev +4Efficient Long-Context InferenceToken-Level Uncertainty

  15. Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

    Feb 17, 2025Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao +3Semantic CommunicationsToken Compression

  16. You Do Not Fully Utilize Transformer's Representation Capacity

    Feb 13, 2025Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky +2Transformer ArchitecturesLanguage Modeling

  17. 3D-MoE: Towards Spatial Intelligence with Mixture-of-Experts for 3D Reasoning and Action Generation

    Jan 28, 2025Yueen Ma, Zenglin Xu, Irwin KingDiffusion-Based Vision-Language-ActionsAction Generation

  18. CATSplat: Context-Aware Transformer with Spatial Guidance for Generalizable 3D Gaussian Splatting from A Single-View Image

    Dec 17, 2024Wonseok Roh, Hwanhee Jung, Jong Wook Kim +63D Reconstruction3D Gaussian

  19. Tokens, the oft-overlooked appetizer: Large language models, the distributional hypothesis, and meaning

    Dec 14, 2024Julia Witte Zimmerman, Denis Hudon, Kathryn Cramer +9Single-Token Output DistributionsDistributional Information

  20. A Mechanistic Study of Transformers Training Dynamics

    Oct 31, 2024Ambroise Odonnat, Wassim Bouaziz, Vivien CabannesTransformer ArchitecturesPretraining

  21. Tuning Language Models by Mixture-of-Depths Ensemble

    Oct 16, 2024Haoyan Luo, Lucia SpeciaLarge Language Model Fine-TuningLayer-Wise

  22. On Generalisation Error Bounds for Transformers

    Oct 15, 2024Lan V. TruongGeneralization BoundsTransformer Architectures

  23. Multi-view Hand Reconstruction with a Point-Embedded Transformer

    Aug 20, 2024Lixin Yang, Licheng Zhong, Pengxiang Zhu +43D HandMotion Capture

  24. A Survey of Transformer-based Language Models with Focus on Efficiency

    May 15, 2024Wazib Ansar, Saptarsi Goswami, Amlan ChakrabartiTransformer ArchitecturesEfficiency

  25. AdvMT: Adversarial Motion Transformer for Long-term Human Motion Prediction

    Jan 10, 2024Sarmad Idrees, Seokman Sohn, Jongeun ChoiHuman Motion PredictionLong-Horizon Forecasting

  26. Introduction to Transformers: an NLP Perspective

    Nov 29, 2023Tong Xiao, Jingbo ZhuTransformer ArchitecturesNatural Language Processing

  27. VOLTA: Improving Generative Diversity by Variational Mutual Information Maximizing Autoencoder

    Jul 3, 2023Yueen Ma, Dafeng Chi, Jingjing Li +3Conditional Variational AutoencoderTransformer Architectures

  28. Generalizing Adam to Manifolds for Efficiently Training Transformers

    May 26, 2023Benedikt BrantnerAdamManifolds

  29. Benford's Law as a Distributional Prior for Post-Training Quantization of Large Language Models

    Date pendingArthur Negrão, Pedro Silva, Vander L. S. Freitas +2Transformer ArchitecturesPost-Training

  30. On the Residual Scaling of Looped Transformers: Stability and Transferability

    Date pendingShaowen Wang, Bingrui Li, Ge Zhang +3Residual NetworksTransformer Architectures

  31. Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling

    Date pendingArman Adibi, Alireza Jafari, Mohammad Ghavamzadeh +1Accelerated SamplingTransformer Architectures

  32. UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

    Date pendingZeyang Liu, Le Wang, Sanping Zhou +4LayoutsHigh-Fidelity Conditional Generation

  33. BiHDTrans: binary hyperdimensional transformer for efficient multivariate time series classification

    Date pendingJingtao Zhang, Yi Liu, Qi Shen +1Hybrid TransformerTime-Series Classification

  34. Tracing Computation Density in LLMs

    Date pendingCorentin Kervadec, Iuliia Lysova, Iuri Macocco +2Transformer ArchitecturesTraces

  35. SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

    Date pendingShaowen Wang, Ge Zhang, Kairong Luo +6Transformer ArchitecturesScaling Laws

  36. Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model

    Date pendingShinnosuke Takasuka, Hideo MukaiTransformer ArchitecturesMetadata

  37. Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging

    Date pendingPhat Nguyen, Xue Geng, Kaixin Xu +3Vision TransformerToken Compression