Decoder-Only Language Models

Latest papers 67

All topics
CardsList
  1. The Wiola Architecture for Efficient Small Language Models

    Jul 1, 2026Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi +1Rotary Positional EmbeddingsToken Merging

  2. Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models

    Jul 1, 2026Mikołaj Słowikowski, Maciej Witold MajewskiDecoder-Only Language ModelsPrivacy Leakage in Language Models

  3. Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text

    Jun 29, 2026Tanvir Ahmed Sijan, S. M Golam Rifat, Nayeemul Islam +1Decoder-Only Language ModelsLow-Resource Language Processing

  4. MultiHashFormer: Hash-based Generative Language Models

    Jun 26, 2026Huiyin Xue, Atsuki Yamaguchi, Nikolaos AletrasLLM CompressionDecoder-Only Language Models

  5. Dual Dimensionality for Local and Global Attention

    Jun 17, 2026Zhiyuan Wang, Xuan Luo, Sirui Zeng +1LLM CompressionDecoder-Only Language Models

  6. Variable-Width Transformers

    Jun 16, 2026Zhaofeng Wu, Oliver Sieberling, Shawn Tan +3TransformerDecoder-Only Language Models

  7. SpikeDecoder: Realizing the GPT Architecture with Spiking Neural Networks

    Jun 10, 2026Claas Beger, Florian Walter, Alois KnollEfficient Neural Network InferenceSpiking Transformers

  8. DECSELFMASK: Leveraging Unlabeled Text via Self-Relevance-Guided Masking for Decoder-Only Classification

    Jun 8, 2026Pietro Ferrazzi, Matteo Merler, Giovanni Bonetta +2Self-Supervised Pre-TrainingDecoder-Only Language Models

  9. Where does Absolute Position come from in decoder-only Transformers?

    Jun 4, 2026Valeria Ruscio, Umberto Nanni, Fabrizio SilvestriRotary Positional EmbeddingsTransformer Interpretability

  10. ReverseEOL: Improving Training-free Text Embeddings via Text Reversal in Decoder-only LLMs

    Jun 4, 2026Ailiang Lin, Zhuoyun Li, Yusong Wang +3Text EmbeddingsDecoder-Only Language Models

  11. Depth-Attention: Cross-Layer Value Mixing for Language Models

    Jun 3, 2026Boyi Zeng, Yiqin Hao, Zitong Wang +7Efficient Transformer InferenceDecoder-Only Language Models

  12. AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

    Jun 2, 2026Quentin Fuxa, Dominik MacháčekSpeech TranslationDecoder-Only Language Models

  13. Post-Hoc Understanding of Metaphor Processing in Decoder-Only Language Models via Conditional Scale Entropy

    May 20, 2026Lawhori Chakrabarti, Jennifer Johnson-Leung, Bert Baumgaertner +3Figurative Language UnderstandingTransformer Interpretability

  14. MiniGPT: Rebuilding GPT from First Principles

    May 17, 2026Jibin JosephLanguage Model PretrainingDecoder-Only Language Models

  15. Transformer-like Inference from Optimal Control

    May 15, 2026Aditya Kudre, Heng-Sheng Chang, Prashant G. MehtaTransformer InferenceDecoder-Only Language Models

  16. Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance

    May 14, 2026Mahdi Naser-Moghadasi, Faezeh GhaderiLLM EvaluationDecoder-Only Language Models

  17. Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining

    May 11, 2026Jinchang Zhu, Jindong Li, Yuwen Hao +3Language Model PretrainingSelf-Attention

  18. Spectral Lens: Activation and Gradient Spectra as Diagnostics of LLM Optimization

    May 7, 2026Andy Zeyi Liu, Elliot Paquette, John SousRepresentation LearningDecoder-Only Language Models

  19. Escaping Mode Collapse in LLM Generation via Geometric Regulation

    May 1, 2026Xin Du, Kumiko Tanaka-IshiiLanguage Model SteeringDecoder-Only Language Models

  20. Graph Memory Transformer (GMT)

    Apr 26, 2026Nicola Zanarini, Niccolò Ferrari, Evelina LammaMemory-Augmented Neural NetworksTransformer FFNs

  21. Scaling Point-in-Time Language Models

    Apr 24, 2026Bryan Kelly, Semyon Malamud, Johannes Schwab +1Decoder-Only Language ModelsTemporal Data Leakage