Transformer Architectures

Latest papers 1,120

All topics
CardsList
  1. Applications of the Transformer Architecture in AI-Assisted English Reading Comprehension

    Apr 26, 2026Ping LiTransformer Architectures

  2. Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

    Apr 25, 2026Divakar Kumar Yadav, Tian ZhaoLLM Inference OptimizationInference Latency

  3. TEMPO: Transformers for Temporal Disease Progression from Cross-Sectional Data

    Apr 25, 2026Hongtao Hao, Joseph L. AusterweilBiomarkerTransformer Architectures

  4. SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

    Apr 24, 2026Yuqi Pan, Jinghao Zhuang, Yupeng Feng +16Dynamic Sparse AttentionEfficient Long-Context Inference

  5. Learning Reactive Human Motion Generation from Paired Interaction Data Using Transformer-Based Models

    Apr 24, 2026Masato Soga, Ryuki TakebayashiHuman Motion GenerationHuman Motion

  6. Dissociating Decodability and Causal Use in Bracket-Sequence Transformers

    Apr 24, 2026Aryan Sharma, Cutter Dawes, Shivam RavalTransformer EncoderTransformer Architectures

  7. LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs

    Apr 23, 2026Mohamed Ali Souibgui, Jan Fostier, Rodrigo Abadía-Heredia +3Transformer ArchitecturesEnsemble

  8. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

    Apr 23, 2026Minghao Yin, Wenbo Hu, Jiale Xu +24D GenerationFour-Dimensional

  9. Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?

    Apr 23, 2026Shivam Rawat, Lucie Flek, Florian Mai +1LLM Reasoning StrategiesSearch-Augmented Reasoning

  10. EdgeFormer: local patch-based edge detection transformer on point clouds

    Apr 23, 2026Yifei Xie, Zhikun Tu, Tong Yang +2Edge-AwarePoint Clouds

  11. Sub-Token Routing for KV Cache Compression

    Apr 23, 2026Wei Jiang, Wei WangKey-Value Cache CompressionToken Compression

  12. an interpretable vision transformer framework for automated brain tumor classification

    Apr 23, 2026Chinedu Emmanuel Mbonu, Tochukwu Sunday Belonwu, Okwuchukwu Ejike Chukwuogo +1Brain Tumor ClassificationSelf-Supervised Vision Transformers

  13. Hyperloop Transformers

    Apr 23, 2026Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon KimTransformer ArchitecturesEnergy-Based Transformer

  14. The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

    Apr 23, 2026Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi +3Transformer ArchitecturesKv-Cache Management

  15. climt-paraformer: Stable Emulation of Convective Parameterization using a Temporal Memory-aware Transformer

    Apr 22, 2026Shuochen Wang, Nishant Yadav, Joy Merwin Monteiro +1Global Climate ModelsEmulators

  16. PanGuide3D: Cohort-Robust Pancreas Tumor Segmentation via Probabilistic Pancreas Conditioning and a Transformer Bottleneck

    Apr 22, 2026Sunny Joy Ma, Xiang MaTumor SegmentationPanoptic Segmentation

  17. Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

    Apr 22, 2026Pranava Madhyastha, Dagmar AdamcovaTransformer ArchitecturesWorking Memory

  18. Explicit Dropout: Deterministic Regularization for Transformer Architectures

    Apr 22, 2026Vidhi Agrawal, Illia Oleksiienko, Alexandros IosifidisDropoutTransformer Attention

  19. MAE-Based Self-Supervised Pretraining for Data-Efficient Medical Image Segmentation Using nnFormer

    Apr 22, 2026R. M. Krishna Sureddi, T. Satyanarayana Murthy, Nomula Varsha Reddy +2Semi-Supervised Medical Image SegmentationSelf-Supervised Learning

  20. LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

    Apr 22, 2026Zhe Feng, Sen Lian, Changwei Wang +5Linear AttentionTransformer Architectures

  21. PASTA: A Patch-Agnostic Twofold-Stealthy Backdoor Attack on Vision Transformers

    Apr 21, 2026Dazhuang Liu, Yanqi Qiao, Rui Wang +2Clean Label Backdoor AttackVision Transformer

  22. Benign Overfitting in Adversarial Training for Vision Transformers

    Apr 21, 2026Jiaming Zhang, Meng Ding, Shaopeng Fu +2Adversarial TrainingSelf-Supervised Vision Transformers

  23. GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

    Apr 21, 2026Pradyumna YM, Yuxuan Xue, Yue Chen +3Scene ReconstructionArticulated Objects

  24. Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

    Apr 21, 2026Kadir Yilmaz, Adrian Kruse, Tristan Höfer +23D Scene UnderstandingVisual Geometry Grounded Transformer

  25. EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment

    Apr 21, 2026Guray Ozgur, Tahar Chettaoui, Eduarda Caldeira +4Self-Supervised Vision TransformersImage Quality Assessment

  26. Multimodal Transformer for Sample-Aware Prediction of Metal-Organic Framework Properties

    Apr 21, 2026Seunghee Han, Jaewoong Lee, Jihan KimMolecular Property PredictionPowder X-Ray Diffraction

  27. Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

    Apr 21, 2026Qi Zhang, Jixuan Chen, Kaiyi Zhang +3Multi-Object TrackingMulti-View

  28. Multimodal embodiment-aware navigation transformer

    Apr 21, 2026Louis Dezons, Quentin Picard, Rémi Marsal +2Object Goal NavigationMultimodal Fusion

  29. One-Block Transformer (1BT) for EEG-Based Cognitive Workload Assessment

    Apr 21, 2026Stefanos Gkikas, Christian Arzate Cruz, Thomas Kassiotis +3Inference WorkloadsCognitive Load

  30. ConvVitMamba: Efficient Multiscale Convolution, Transformer, and Mamba-Based Sequence modelling for Hyperspectral Image Classification

    Apr 20, 2026Mohammed Q. AlkhatibHyperspectral ImageMulti-Scale Convolution

  31. One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models

    Apr 20, 2026Chris Cameron, Wangzheng Wang, Nikita Ivanov +3Denoising Diffusion Probabilistic ModelRecursive Models

  32. Towards Understanding the Robustness of Sparse Autoencoders

    Apr 20, 2026Ahson Saiyed, Sabrina Sadiekh, Chirag AgarwalLarge Language Model JailbreaksTransformer Architectures

  33. URoPE: Universal Relative Position Embedding across Geometric Spaces

    Apr 20, 2026Yichen Xie, Depu Meng, Chensheng Peng +4Visual Geometry Grounded TransformerRotary Position Embedding

  34. Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language Models

    Apr 20, 2026Tobias Grantner, Emanuel Sallinger, Martin FlechlHybrid Mamba-Transformer ModelTransformer Architectures

  35. Towards Real-Time ECG and EMG Modeling on μμNPUs

    Apr 20, 2026Josh Millar, Ashok Samraj Thangarajan, Soumyajit Chatterjee +1Physiological SignalsNeural Processing Units

  36. Chatting about Upper-Body Expressive Human Pose and Shape Estimation

    Apr 20, 2026Yuxiang Zhao, Wei Huang, Yujie Song +2Statistical Shape ModelTransformer Architectures

  37. Attention Is not Everything: Efficient Alternatives for Vision

    Apr 19, 2026Nur Mohammad Kazi, Ibteshum Khaled, Md. Luthful Hasan Galib +2Self-Supervised Vision TransformersComputer Vision

  38. Towards Generalizable Deepfake Image Detection with Vision Transformers

    Apr 19, 2026Kaliki V Srinanda, M Manvith Prabhu, Hemanth K Mogilipalem +4Deepfake DetectionSelf-Supervised Vision Transformers

  39. The Topological Trouble With Transformers

    Apr 18, 2026Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne LiuTransformer ArchitecturesFeed-Forward

  40. One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them

    Apr 18, 2026Ali Holmov, Paul Youssef, Nandi Schoots +1Multimodal Knowledge EditingModifications

  41. NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

    Apr 18, 2026Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco +2Path PlanningOffline Reinforcement Learning

  42. Closing the Theory-Practice Gap in Spiking Transformers via Effective Dimension

    Apr 17, 2026Dongxin Guo, Jikun Wu, Siu Ming YiuNeuromorphic ComputingTransformer Architectures

  43. Continued Pretraining of FinBERT on Finnish Histopathological Reports: Train-Time Signals and Proxy Downstream Correlations

    Apr 16, 2026Rami Luisto, Liisa Petäinen, Tommi Grönholm +5Bert-Based ModelsLarge Language Model Classification

  44. Personalized and Context-Aware Transformer Models for Predicting Post-Intervention Physiological Responses from Wearable Sensor Data

    Apr 16, 2026Esther Brown, Victoria Dean, Finale Doshi-VelezWearable PhysiologyPhysiological Data

  45. Expressivity of Transformers: A Tropical Geometry Perspective

    Apr 16, 2026Ye Su, Yong LiuTransformer AttentionMulti-Head Attention

  46. FreqTrack: Frequency Learning based Vision Transformer for RGB-Event Object Tracking

    Apr 16, 2026Jinlin You, Muyu Li, Xudong ZhaoRgb-Event Object TrackingRgbt

  47. FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

    Apr 2, 2026Wei Li, Yufan Ren, Hanqing Jiang +6Cross-View FusionProgressive Attention Fusion

  48. Crystalite: A Lightweight Transformer for Efficient Crystal Modeling

    Apr 2, 2026Tin Hadži Veljković, Joshua Rosenthal, Ivor Lončarić +1Crystal StructureCrystal