Attention Head Specialization

Momentum

4 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 30

All topics
CardsList
  1. Which Attention Heads are like the Human Head? Not the Ones that Compute

    Sep 29, 2026Christopher Pinier, Gustaw Opiełka, Hannes Rosenbusch +3Attention Head AnalysisCross-Modal Alignment

  2. When Can Attention Heads Be Statically Defined?

    Sep 28, 2026Weixian Waylon Li, Yintao Tai, Marcio Fonseca +1Attention Head AnalysisEfficient Attention

  3. Rethinking Contextualization by Reinterpreting Attention Head Channels

    Sep 27, 2026Hakaze Cho, Haolin Yang, Zhun Sun +3Attention Head AnalysisRepresentation Geometry in Language Models

  4. Temporal-Attention Head Specialization During Video Diffusion Training

    Sep 14, 2026Taewoo Ha, Shafayat Mowla Anik, Dae Yeol Lee +2Video Diffusion ModelsAttention Head Analysis

  5. Modern Transformers Are Implicit Hybrids: From Functional Differentiation to Principled Hybrid Architecture Design

    Sep 2, 2026Runlin Shi, Bojian Yin, Guoqi LiRotary Positional EmbeddingsLinear Attention

  6. Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

    Aug 7, 2026Yehan Yang, Junyuan Shang, Yang Li +3Attention Head AnalysisLLM Inference Acceleration

  7. Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

    Jul 31, 2026Kamil Książek, Piotr Suszyński, Michał Jan Włodarczyk +2Transformer InterpretabilityAttention Head Analysis

  8. HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation

    Jul 22, 2026Jinliang Shen, Lianghao Su, Zheming Li +4KV-Cache ManagementAutoregressive Video Generation

  9. Where Computation Lives Inside TabPFN: Causal Localisation of Attention Head Function

    Jun 11, 2026Atharva Gupta, Dhruv Kumar, Murari Mandal +1Tabular Foundation ModelsAttention Head Analysis

  10. A Unifying View of Attention Sinks: From Mechanisms to Architectural Interventions

    Jun 6, 2026Lukas Fesser*, Mozes Jacobs*, Thomas Fel* +2Transformer InterpretabilityVision Transformer

  11. Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

    Jun 4, 2026Ruoxi Sun, Quantong Qiu, Juntao Li +3Multimodal Large Language ModelsVLM Interpretability

  12. Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

    May 29, 2026Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias +3Rotary Positional EmbeddingsAttention Head Analysis

  13. From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

    May 20, 2026Hao Chen, Qi Zhang, Liyao Li +7LLM AlignmentLLM Fine-Tuning

  14. Multi-Head Attention as Ensemble Nadaraya-Watson Estimation: Variance Reduction, Decorrelation, and Optimal Head Diversity

    May 18, 2026Ernest FokouéSelf-AttentionEnsemble Learning

  15. Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

    May 14, 2026Jiahao Tian, Yiwei Wang, Gang Yu +1Diffusion TransformerAutoregressive Diffusion

  16. Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation

    May 13, 2026Jiayu Chen, Junbei Tang, Wenbiao Zhao +6Self-AttentionLong-Horizon Video Generation

  17. GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

    May 12, 2026Xiaosong Jia, Bowen Yang, Zuhao Ge +17VLM RobustnessRobotic Manipulation

  18. Learning Less Is More: Premature Upper-Layer Attention Specialization Hurts Language Model Pretraining

    May 11, 2026Jinchang Zhu, Jindong Li, Yuwen Hao +3Language Model PretrainingSelf-Attention

  19. HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

    Apr 26, 2026Peize He, Yaodi Luo, Xiaoqian Liu +7Audio Token CompressionSelf-Attention

  20. Incremental Learning of Sparse Attention Patterns in Transformers

    Feb 22, 2026Oğuz Kaan Yüksel, Rodrigo Alvarez Lucendo, Nicolas FlammarionSelf-AttentionTransformer Attention

  21. A Mechanistic Study of Transformers Training Dynamics

    Oct 31, 2024Ambroise Odonnat, Wassim Bouaziz, Vivien CabannesTransformer InterpretabilityAttention Mechanisms

  22. AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally

    Date pendingShaowen Wang, Yuke Zheng, Tansheng Zhu +4Rotary Positional EmbeddingsSelf-Attention

  23. Diffract: Spectral View of LLM Domain Adaptation

    Date pendingNikita Borodin, Maria Krylova, Artem Zabolotnyi +6Domain AdaptationDomain-Adaptive Pretraining