Transformer FFNs

FFN: Feed-Forward Network

Momentum

2 papers in the last four weeks, against 2 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 24

All topics
CardsList
  1. On the Necessity of Attention-FFN Split in Vision Transformers

    Oct 7, 2026Junhyeok Kim, Jinyeong Kim, Jae Wan Park +1Vision TransformerAttention Mechanisms

  2. Which the Eye Fears: Writing with Read-Blindness Explains Massive Activations in Transformers

    Sep 28, 2026Swagatam Mukhopadhyay, Vishal Vivek Saley, Vraj Parikh +1Transformer InterpretabilityTransformer FFNs

  3. Weakening Neurons: An Input-Output Functionality in Transformers with Outsize Influence

    Sep 16, 2026Sebastian Gerstner, Hilal AlQuabeh, Kentaro Inui +1Transformer InterpretabilityTransformer FFNs

  4. Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks

    Aug 28, 2026Munawar Hasan, Apostol VassilevTransformer FFNs

  5. TANGO: Treating Tokens as Operators

    Aug 22, 2026Joshua NunleyTransformer FFNsTransformer

  6. Feed-Forward Steering in Transformer Residual Dynamics

    Aug 3, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer InterpretabilityTransformer FFNs

  7. Geometry-Guided Layerwise FFN Width Allocation in Transformers

    Aug 3, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer FFNsTransformer

  8. A Controlled Study of Attention-Only Transformers

    Jul 20, 2026Henry Ndubuaku, Karen Mosoyan, Jakub Mroz +5Transformer FFNsTransformer

  9. Training, Reading, and Editing Legible Transformers

    Jul 9, 2026Mark OskinTransformer InterpretabilityTransformer FFNs

  10. Sparsely gated tiny linear experts

    Jun 5, 2026Simon SchugTransformer FFNsMixture-of-Experts Language Models

  11. More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations

    May 26, 2026Mingze Wang, Jinbo Wang, Yikuan Xia +2Transformer FFNsTransformer Expressivity

  12. Large Vision-Language Models Get Lost in Attention

    May 7, 2026Gongli Xi, Ye Tian, Mengyu Yang +5Transformer FFNsVision-Language Models

  13. Graph Memory Transformer (GMT)

    Apr 26, 2026Nicola Zanarini, Niccolò Ferrari, Evelina LammaMemory-Augmented Neural NetworksTransformer FFNs

  14. Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

    Apr 26, 2026Audrey Cherilyn, Houman SafaaiTransformer InterpretabilityLLM Pruning

  15. The Topological Trouble With Transformers

    Apr 18, 2026Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne LiuTransformer FFNsRecurrent Neural Networks

  16. Revisiting the Shape Convention of Transformer Language Models

    Feb 6, 2026Feng-Ting Liao, Guan-Ting Yi, Tzu-Quan Lin +2Efficient Transformer InferenceTransformer FFNs

  17. Equivalence of Context and Parameter Updates in Modern Transformer Blocks

    Nov 22, 2025Adrian Goldwaser, Michael Munn, Javier Gonzalvo +1Transformer InterpretabilityTransformer FFNs